Медиана

A/B-тесты: когда имеет смысл, а когда нет

A/B-тест на малом трафике не даёт вывода, а подглядывание за результатом ломает статистику. Условия, при которых тест возможен, и таблица ситуаций.

Обновлено 12.08.2026 · 6 мин чтения

A/B-тест — сравнение двух вариантов страницы или объявления на случайно разделённом трафике. Он работает при двух условиях: конверсий хватает, чтобы разница превышала случайный разброс, и результат смотрят один раз, в заранее назначенный срок. При малом трафике тест не даёт ответа — а это не то же самое, что даёт слабый.

Коротко

  • A/B-тест отвечает на один вопрос: превышает ли разница между вариантами тот разброс, который возникает сам по себе.
  • При малом числе конверсий тест не даёт слабого ответа — он не даёт ответа вообще, потому что различить способен только очень крупные отличия.
  • Остановка теста в момент, когда один вариант вырвался вперёд, превращает случайное колебание в «победу»: чем чаще смотришь, тем выше шанс поймать шум.
  • Срок и нужный объём назначаются до запуска и не пересматриваются по ходу — это единственная защита от самообмана.
  • Значительная часть изменений на сайте вообще не требует теста: сломанное чинят, а редко посещаемые страницы правят по здравому смыслу.

Что именно сравнивает тест

Трафик случайно делится на две группы, каждая видит свой вариант, дальше считается доля целевых действий. Вопрос теста звучит не «какой вариант лучше», а «отличаются ли варианты сильнее, чем отличались бы две случайные половины одного и того же трафика».

Разница между половинами есть всегда. Разделите поток пополам и покажите обеим группам одну и ту же страницу — числа не совпадут. Совпадут они только случайно. Задача теста — отделить эту фоновую разницу от разницы, вызванной изменением.

Отсюда следует главное практическое ограничение. Тест не измеряет, насколько один вариант лучше. Он отвечает «да» или «нет» на вопрос о том, различимо ли отличие вообще. И на этот вопрос он часто честно отвечает «неизвестно».

Почему малый трафик убивает тест

Конверсия — редкое событие. Именно поэтому её колебания велики относительно самой величины: одна крупная сделка или один день с плохой погодой заметно двигают недельный итог.

Условный пример. На вариант приходится по 600 визитов в месяц, вариант A принёс 18 заявок, вариант B — 21. Три заявки разницы выглядят как прирост в одну шестую. Но три заявки — это буквально три человека, и достаточно одного удачного вторника, чтобы результат перевернулся. Через месяц те же варианты могут поменяться местами без единой правки.

Дальше работает арифметика, а не мнение. Случайный разброс убывает пропорционально корню из числа наблюдений. Значит, чтобы уверенно различить вдвое меньшее отличие, данных нужно примерно вчетверо больше. Мелкие правки — цвет кнопки, порядок слов в подзаголовке — дают маленькое отличие по устройству, и требование к объёму у них запредельное.

Практический вывод неприятный: на большинстве сайтов A/B-тест мелких изменений технически невозможен. Не «неточен», а невозможен — при доступном объёме он не различит ни улучшение, ни ухудшение.

Подглядывание — способ получить победителя из ничего

Разница между вариантами не стоит на месте: она блуждает вокруг истинного значения, и на малых накопленных объёмах блуждает широко. Если смотреть на отчёт каждый день и останавливать тест в момент, когда один вариант вырвался вперёд, вы фиксируете не итог, а максимум колебания.

Механика проще, чем кажется. Каждая проверка — отдельная попытка поймать случайный выброс. Одна проверка даёт один шанс ошибиться, двадцать проверок — двадцать шансов. Порог значимости рассчитан на однократное решение в конце и при многократных взглядах перестаёт означать то, что написано на панели.

Отсюда правило, которое ломает привычку: срок и нужный объём назначаются до запуска, а панель до конца срока не открывается ради решения. Смотреть можно на техническую исправность — не сломался ли вариант, идёт ли трафик, — но не на то, кто впереди.

Второе правило про срок: тест длится целое число недель. Иначе в одну группу попадёт лишний понедельник, и вы измерите разницу между днями недели.

Таблица: тестировать или нет

СитуацияРешениеПочему
Крупный магазин, сотни заказов в неделюТестироватьОбъёма хватает, чтобы отделить отличие от фонового разброса
Лендинг с двумя заявками в неделюНе тестироватьЛюбая разница объяснима случайностью; решать разговором с клиентами
Форма, где часть полей не отправляетсяСначала починитьТест сравнит рабочий вариант со сломанным и выдаст очевидность
Смена шрифта, оттенка, отступаНе тестироватьОтличие слишком мало, чтобы его различить при любом реальном объёме
Полный редизайн страницыНе A/B, а поэтапный выкатТест скажет «хуже» или «лучше», но не назовёт, какой из тридцати правок это вызвано
Заголовки объявлений в рекламном кабинетеТестировать средствами площадкиПоказов набирается быстрее, чем визитов на сайте, и деление делает система
Рассылка по базеТестироватьВыборка известна заранее, обе группы получают письмо одновременно
Период распродажи или праздниковПеренестиСостав аудитории меняется, тест поймает сезон, а не вариант
Цена одного и того же товараС оговоркамиТехнически возможно, но покупатели сравнивают цены между собой
Страница, которую открывают единицыНе тестироватьДаже верный ответ не изменит ничего в деньгах

Правая колонка важнее левой. Отказ от теста — это не признание слабости, а экономия месяца на вопрос, ответ на который всё равно не получится.

Порядок, при котором тесту можно верить

  1. Гипотеза с направлением. Не «попробуем другой заголовок», а «если убрать обязательное поле с отчеством, заявок станет больше, потому что форма прерывается именно на нём». Гипотеза без причины непроверяема.
  2. Одна метрика решения, назначенная заранее. Одна. Если метрик восемь, какая-нибудь обязательно покажет прирост, и это будет чистая арифметика перебора, а не результат.
  3. Расчёт нужного числа конверсий на вариант до запуска. Если требуемое количество набирается за полгода, тест не запускают.
  4. Срок в целых неделях, не короче цикла принятия решения. Короткий тест измеряет самых быстрых посетителей, а не всех.
  5. Никаких правок внутри вариантов по ходу. Правка обнуляет накопленные данные, потому что первая половина испытуемых видела не то, что вторая.
  6. Один взгляд в конце и записанное решение. Отрицательный результат тоже записывают: он экономит следующую попытку.

Пункт третий отсеивает больше половины замыслов ещё до запуска, и в этом его ценность. Считать конверсию полезно всегда, а вот проверять её тестом — только когда объём позволяет.

Как получить красивый, но ложный результат

Смотреть на много метрик сразу. Конверсия, глубина просмотра, время на странице, отказы, добавления в корзину. Чем длиннее список, тем выше шанс, что хоть где-то возникнет заметное отличие — и тем сильнее соблазн объявить его находкой.

Резать сегменты после теста. «В целом ничья, но на мобильных выиграл B». Разбиение, придуманное после просмотра данных, — не проверка гипотезы, а подбор среза под желаемый вывод. Сегмент назначают до запуска или тестируют отдельно.

Запускать варианты не одновременно. Неделя A против следующей недели B — это сравнение двух недель, а не двух вариантов. Между ними успевают смениться реклама, погода и новостной фон.

Допускать пересечение групп. Человек с двух устройств попадает в обе группы, а при неверной разметке источников ещё и учитывается дважды. Границы групп должны быть жёстче, чем кажется.

Считать конверсией то, что не приносит денег. Клик по кнопке — не результат. Вариант, увеличивающий число кликов и уменьшающий число оплат, формально побеждает.

Границы: чего тест не покажет

Вопросы за пределами A/B-теста

Отложенный эффект. Вариант с агрессивным обещанием собирает больше заявок и худших клиентов. На горизонте теста он выигрывает, на горизонте года проигрывает. Проверяется это только по пожизненной ценности и разбивке по когортам, а не по конверсии на странице.

Причина. Тест сообщает, что стало иначе, и молчит о том, почему. Ответ на «почему» приходит из записей сессий, опросов и разговоров с теми, кто продаёт.

Стратегические решения. Позиционирование, ассортимент, модель работы не проверяются сплитом трафика: эффект от них растянут во времени и не помещается в две недели.

Потолок текущей идеи. Цепочка мелких улучшений доводит страницу до максимума одной конструкции и никогда не выводит к другой, более удачной. Локальный максимум выглядит как исчерпание идей.

Эффект новизны. Постоянные посетители реагируют на изменение самим фактом изменения. Через несколько недель реакция гаснет, и выигрыш испаряется.

Переносимость. Результат, полученный на одной аудитории и в одном канале, не переносится на другую аудиторию — распределение заслуг между каналами вообще устроено отдельно и разобрано в материале про модели атрибуции.

Спорное место

Всё вышенаписанное — правила классического теста с фиксированным горизонтом: объём назначен заранее, взгляд один. Из этих правил следует, что подглядывание запрещено. Но это утверждение верно не вообще, а внутри выбранного метода.

Существуют последовательные методы, которые как раз и рассчитаны на непрерывное наблюдение: они пересчитывают порог по мере накопления данных и позволяют останавливаться раньше без потери корректности. Их слабое место практическое — реализованы они далеко не во всех инструментах, а там, где реализованы, интерфейс редко объясняет, какой именно критерий применён. Пользователь видит слово «значимость» и не знает, к какой схеме оно относится.

Есть и вторая неувязка. Требования выше настолько строги, что для большинства компаний означают простое «тестировать нельзя». А отказ от тестов на практике оборачивается не аккуратными решениями по здравому смыслу, а решениями по вкусу руководителя — и это не лучше испорченной статистики.

Компромисс, который выглядит рабочим: тестировать только там, где решение повторяемое и обратимое, а во всём остальном честно называть изменения изменениями, а не проверенными улучшениями. Слабость компромисса в том, что граница между этими случаями проводится на глаз, и провести её без собранных до конца воронки данных обычно не получается.

Частые вопросы

Сколько нужно трафика для A/B-теста?

Считать надо не визиты, а конверсии на вариант, и нужное количество зависит от того, какую разницу вы хотите заметить. Правило простое и неприятное: чтобы уверенно различить вдвое меньшее отличие, данных нужно примерно вчетверо больше. Поэтому мелкие правки на низком трафике не проверяются в принципе.

Можно ли остановить тест, если один вариант уже выигрывает?

В классическом тесте с фиксированным сроком — нельзя. Разница между вариантами колеблется всё время, и если останавливаться в момент максимума, вы фиксируете не результат, а верхнюю точку случайного блуждания. Срок и объём выборки назначают заранее и досматривают до конца.

Сколько должен длиться тест?

Не меньше целого числа недель, чтобы будни и выходные попали в обе группы одинаково, и не меньше типичного срока принятия решения в вашей нише. Если люди думают две недели, тест длиной в пять дней измеряет не конверсию, а скорость реакции самых быстрых.

Что делать, если трафика на тест не хватает?

Отказаться от проверки мелких правок и заниматься тем, что видно без статистики: неработающие формы, непонятные формулировки, отсутствующие ответы на вопросы клиента. Качественные методы — записи сессий, разговоры с отделом продаж, опросы — на малых объёмах дают больше, чем испорченный тест.

Можно ли тестировать цену?

Технически да, практически — с оговорками. Разные цены на один товар в одно время для разных людей создают риск конфликта, если покупатели сравнят. Безопаснее сравнивать не саму цену, а её подачу: способ оплаты, комплектацию, порядок вывода на странице.

Тест показал прирост, а денег не прибавилось. Почему?

Чаще всего измеряли не тот шаг: вариант увеличил число заявок, но заявки пришли хуже качеством и не дошли до оплаты. Проверить это можно только сквозным учётом до сделки. Второе объяснение — эффект новизны у постоянных посетителей, который сходит на нет через несколько недель.

Источники

  1. A/B testing — Wikipedia
  2. Статистическая значимость — Wikipedia
Артём Строев
Пишу про измеримый маркетинг и видимость в ИИ-поиске. Публикуюсь под псевдонимом — почему так.