Что именно сравнивает тест
Трафик случайно делится на две группы, каждая видит свой вариант, дальше считается доля целевых действий. Вопрос теста звучит не «какой вариант лучше», а «отличаются ли варианты сильнее, чем отличались бы две случайные половины одного и того же трафика».
Разница между половинами есть всегда. Разделите поток пополам и покажите обеим группам одну и ту же страницу — числа не совпадут. Совпадут они только случайно. Задача теста — отделить эту фоновую разницу от разницы, вызванной изменением.
Отсюда следует главное практическое ограничение. Тест не измеряет, насколько один вариант лучше. Он отвечает «да» или «нет» на вопрос о том, различимо ли отличие вообще. И на этот вопрос он часто честно отвечает «неизвестно».
Почему малый трафик убивает тест
Конверсия — редкое событие. Именно поэтому её колебания велики относительно самой величины: одна крупная сделка или один день с плохой погодой заметно двигают недельный итог.
Условный пример. На вариант приходится по 600 визитов в месяц, вариант A принёс 18 заявок, вариант B — 21. Три заявки разницы выглядят как прирост в одну шестую. Но три заявки — это буквально три человека, и достаточно одного удачного вторника, чтобы результат перевернулся. Через месяц те же варианты могут поменяться местами без единой правки.
Дальше работает арифметика, а не мнение. Случайный разброс убывает пропорционально корню из числа наблюдений. Значит, чтобы уверенно различить вдвое меньшее отличие, данных нужно примерно вчетверо больше. Мелкие правки — цвет кнопки, порядок слов в подзаголовке — дают маленькое отличие по устройству, и требование к объёму у них запредельное.
Практический вывод неприятный: на большинстве сайтов A/B-тест мелких изменений технически невозможен. Не «неточен», а невозможен — при доступном объёме он не различит ни улучшение, ни ухудшение.
Подглядывание — способ получить победителя из ничего
Разница между вариантами не стоит на месте: она блуждает вокруг истинного значения, и на малых накопленных объёмах блуждает широко. Если смотреть на отчёт каждый день и останавливать тест в момент, когда один вариант вырвался вперёд, вы фиксируете не итог, а максимум колебания.
Механика проще, чем кажется. Каждая проверка — отдельная попытка поймать случайный выброс. Одна проверка даёт один шанс ошибиться, двадцать проверок — двадцать шансов. Порог значимости рассчитан на однократное решение в конце и при многократных взглядах перестаёт означать то, что написано на панели.
Отсюда правило, которое ломает привычку: срок и нужный объём назначаются до запуска, а панель до конца срока не открывается ради решения. Смотреть можно на техническую исправность — не сломался ли вариант, идёт ли трафик, — но не на то, кто впереди.
Второе правило про срок: тест длится целое число недель. Иначе в одну группу попадёт лишний понедельник, и вы измерите разницу между днями недели.
Таблица: тестировать или нет
| Ситуация | Решение | Почему |
|---|---|---|
| Крупный магазин, сотни заказов в неделю | Тестировать | Объёма хватает, чтобы отделить отличие от фонового разброса |
| Лендинг с двумя заявками в неделю | Не тестировать | Любая разница объяснима случайностью; решать разговором с клиентами |
| Форма, где часть полей не отправляется | Сначала починить | Тест сравнит рабочий вариант со сломанным и выдаст очевидность |
| Смена шрифта, оттенка, отступа | Не тестировать | Отличие слишком мало, чтобы его различить при любом реальном объёме |
| Полный редизайн страницы | Не A/B, а поэтапный выкат | Тест скажет «хуже» или «лучше», но не назовёт, какой из тридцати правок это вызвано |
| Заголовки объявлений в рекламном кабинете | Тестировать средствами площадки | Показов набирается быстрее, чем визитов на сайте, и деление делает система |
| Рассылка по базе | Тестировать | Выборка известна заранее, обе группы получают письмо одновременно |
| Период распродажи или праздников | Перенести | Состав аудитории меняется, тест поймает сезон, а не вариант |
| Цена одного и того же товара | С оговорками | Технически возможно, но покупатели сравнивают цены между собой |
| Страница, которую открывают единицы | Не тестировать | Даже верный ответ не изменит ничего в деньгах |
Правая колонка важнее левой. Отказ от теста — это не признание слабости, а экономия месяца на вопрос, ответ на который всё равно не получится.
Порядок, при котором тесту можно верить
- Гипотеза с направлением. Не «попробуем другой заголовок», а «если убрать обязательное поле с отчеством, заявок станет больше, потому что форма прерывается именно на нём». Гипотеза без причины непроверяема.
- Одна метрика решения, назначенная заранее. Одна. Если метрик восемь, какая-нибудь обязательно покажет прирост, и это будет чистая арифметика перебора, а не результат.
- Расчёт нужного числа конверсий на вариант до запуска. Если требуемое количество набирается за полгода, тест не запускают.
- Срок в целых неделях, не короче цикла принятия решения. Короткий тест измеряет самых быстрых посетителей, а не всех.
- Никаких правок внутри вариантов по ходу. Правка обнуляет накопленные данные, потому что первая половина испытуемых видела не то, что вторая.
- Один взгляд в конце и записанное решение. Отрицательный результат тоже записывают: он экономит следующую попытку.
Пункт третий отсеивает больше половины замыслов ещё до запуска, и в этом его ценность. Считать конверсию полезно всегда, а вот проверять её тестом — только когда объём позволяет.
Как получить красивый, но ложный результат
Смотреть на много метрик сразу. Конверсия, глубина просмотра, время на странице, отказы, добавления в корзину. Чем длиннее список, тем выше шанс, что хоть где-то возникнет заметное отличие — и тем сильнее соблазн объявить его находкой.
Резать сегменты после теста. «В целом ничья, но на мобильных выиграл B». Разбиение, придуманное после просмотра данных, — не проверка гипотезы, а подбор среза под желаемый вывод. Сегмент назначают до запуска или тестируют отдельно.
Запускать варианты не одновременно. Неделя A против следующей недели B — это сравнение двух недель, а не двух вариантов. Между ними успевают смениться реклама, погода и новостной фон.
Допускать пересечение групп. Человек с двух устройств попадает в обе группы, а при неверной разметке источников ещё и учитывается дважды. Границы групп должны быть жёстче, чем кажется.
Считать конверсией то, что не приносит денег. Клик по кнопке — не результат. Вариант, увеличивающий число кликов и уменьшающий число оплат, формально побеждает.
Границы: чего тест не покажет
Отложенный эффект. Вариант с агрессивным обещанием собирает больше заявок и худших клиентов. На горизонте теста он выигрывает, на горизонте года проигрывает. Проверяется это только по пожизненной ценности и разбивке по когортам, а не по конверсии на странице.
Причина. Тест сообщает, что стало иначе, и молчит о том, почему. Ответ на «почему» приходит из записей сессий, опросов и разговоров с теми, кто продаёт.
Стратегические решения. Позиционирование, ассортимент, модель работы не проверяются сплитом трафика: эффект от них растянут во времени и не помещается в две недели.
Потолок текущей идеи. Цепочка мелких улучшений доводит страницу до максимума одной конструкции и никогда не выводит к другой, более удачной. Локальный максимум выглядит как исчерпание идей.
Эффект новизны. Постоянные посетители реагируют на изменение самим фактом изменения. Через несколько недель реакция гаснет, и выигрыш испаряется.
Переносимость. Результат, полученный на одной аудитории и в одном канале, не переносится на другую аудиторию — распределение заслуг между каналами вообще устроено отдельно и разобрано в материале про модели атрибуции.
Спорное место
Всё вышенаписанное — правила классического теста с фиксированным горизонтом: объём назначен заранее, взгляд один. Из этих правил следует, что подглядывание запрещено. Но это утверждение верно не вообще, а внутри выбранного метода.
Существуют последовательные методы, которые как раз и рассчитаны на непрерывное наблюдение: они пересчитывают порог по мере накопления данных и позволяют останавливаться раньше без потери корректности. Их слабое место практическое — реализованы они далеко не во всех инструментах, а там, где реализованы, интерфейс редко объясняет, какой именно критерий применён. Пользователь видит слово «значимость» и не знает, к какой схеме оно относится.
Есть и вторая неувязка. Требования выше настолько строги, что для большинства компаний означают простое «тестировать нельзя». А отказ от тестов на практике оборачивается не аккуратными решениями по здравому смыслу, а решениями по вкусу руководителя — и это не лучше испорченной статистики.
Компромисс, который выглядит рабочим: тестировать только там, где решение повторяемое и обратимое, а во всём остальном честно называть изменения изменениями, а не проверенными улучшениями. Слабость компромисса в том, что граница между этими случаями проводится на глаз, и провести её без собранных до конца воронки данных обычно не получается.
Частые вопросы
Сколько нужно трафика для A/B-теста?
Можно ли остановить тест, если один вариант уже выигрывает?
Сколько должен длиться тест?
Что делать, если трафика на тест не хватает?
Можно ли тестировать цену?
Тест показал прирост, а денег не прибавилось. Почему?