M2CA про автоматизацию продаж

A/B-тесты на сайте: как проверять гипотезы и не обмануться

A/B-тесты на сайте: как проверять гипотезы и не обмануться

A/B-тест выглядит как способ заменить споры цифрами: половине посетителей один вариант, половине другой, побеждает тот, где конверсия выше. Но большинство тестов в малом бизнесе кончается ложным выводом: вариант «выиграл» на трёхстах визитах, его выкатили на всех, а заявок не прибавилось.

Что тестировать, а что не стоит

Сила гипотезы зависит от того, насколько глубоко она сидит в решении посетителя. По убыванию отдачи:

Гипотеза вместо «давайте попробуем»

Рабочая гипотеза состоит из трёх частей: наблюдение, изменение, ожидаемый результат с метрикой.

Вебвизор показывает, что 60% посетителей бросают форму на поле «бюджет». Если убрать это поле, конверсия визита в заявку вырастет с 2,4% минимум до 3%.

Так вы заранее фиксируете метрику и минимальный эффект. Иначе начинается подгонка: конверсия не выросла, зато «выросло время на сайте» — и провальный вариант объявляют победой.

Метрику берите ближе к деньгам. Клики по кнопке — плохая цель: «Узнать цену» соберёт больше кликов и меньше сделок, чем «Заказать замер». В Яндекс Метрике для этого есть составные цели и статусы из CRM.

Сколько нужно трафика и времени

Чем меньше разница между вариантами, тем больше нужно выборки, и зависимость нелинейная.

При базовой конверсии 2% рост до 3% виден примерно на четырёх тысячах визитов на вариант. А чтобы достоверно поймать рост с 2% до 2,2%, нужно уже около восьмидесяти тысяч визитов на вариант: в двадцать раз больше данных ради эффекта, который меньше в десять раз.

Практический ориентир для сайта услуг — от 200–300 конверсий на вариант. Сотня — минимум, на котором различимы только крупные расхождения.

По времени: минимум одна полная неделя, обычно две, и всегда кратно семи дням — иначе тест, оборванный в четверг, перекосит по дням недели. Дольше месяца тоже плохо: посетители успевают почистить куки и попасть в оба варианта.

Почему нельзя останавливать тест на «уже видно»

Конверсия колеблется случайно, и за две недели лидер меняется несколько раз. Если смотреть отчёт каждый день и остановиться на первом убедительном разрыве, вы ловите шум: риск объявить победителем случайность растёт с обещанных 5% до 20–30%.

Статзначимость простыми словами — ответ на вопрос «насколько вероятно получить такую разницу, если варианты на самом деле одинаковые». Значимость 95% означает, что случайно она выпадала бы в одном случае из двадцати. Это не гарантия, а уровень допустимого риска.

Поэтому выборку и дату окончания фиксируют до старта и не двигают.

Ошибки, которые превращают тест в самообман

Ставить тест удобно через бесплатный Varioqub от Яндекса: он делит трафик и считает значимость по целям Метрики.

Если трафика мало

При 500–1000 визитов в месяц классический тест не наберёт выборку никогда. Что делать:

Тест — страховка от того, чтобы выкатить на сайт то, что лишь кажется улучшением. Одна гипотеза за раз, метрика и выборка зафиксированы заранее.

И прежде чем тестировать кнопки, проверьте скорость ответа на заявку — обычно это даёт больше любого сплит-теста: AI-ассистент Excella отвечает в первые секунды и передаёт менеджеру тёплый контакт, включая ночь и выходные.