A/B-тесты без самообмана: как проверять гипотезы честно
A/B-тест кажется простым: показали две версии страницы, посчитали конверсию, выбрали победителя. На практике большинство тестов в небольших компаниях дают выводы, которые не подтверждаются на дистанции. Причина не в инструментах, а в статистике и человеческой психологии. Разберём, как не обмануть самих себя.
Идея A/B-теста в том, чтобы отделить влияние изменения от случайного шума. Проблема в том, что шум в небольших выборках огромен, а желание увидеть подтверждение своей гипотезы — велико. Эти две вещи вместе порождают уверенные, но ошибочные выводы.
Почему двадцати заявок недостаточно
Представьте: на версии A из 100 посетителей заявку оставили 5 человек, на версии B — 8. Разница выглядит внушительно, почти в полтора раза. Но если бы вы просто разделили один и тот же трафик на две случайные половины, не меняя вообще ничего, разброс был бы примерно таким же. Случайность на малых числах легко имитирует результат.
| Текущая конверсия | Хотим уловить рост | Нужно посетителей на группу |
|---|---|---|
| 2% | до 3% (+50%) | около 4 500 |
| 2% | до 2,4% (+20%) | около 25 000 |
| 5% | до 7% (+40%) | около 1 700 |
| 5% | до 5,5% (+10%) | около 27 000 |
Практический ориентир: чтобы уверенно зафиксировать улучшение на пару процентных пунктов, нужны сотни конверсий в каждой группе, а не десятки. Если у вас пять заявок в неделю, полноценный A/B-тест мелких изменений просто не окупится по времени.
Главные ошибки, которые убивают достоверность
Первая — подглядывание. Тест запущен, вы смотрите отчёт каждый день и останавливаете эксперимент в тот момент, когда разница выглядит убедительно. Это гарантированный способ поймать случайный всплеск: при достаточно частых проверках «значимая» разница возникает почти всегда, даже между двумя одинаковыми версиями.
Вторая — изменение нескольких элементов сразу. Поменяли заголовок, картинку и кнопку, конверсия выросла. Что именно сработало? Возможно, заголовок помог, а картинка навредила, и в сумме получился скромный плюс вместо большого. Вы не узнаете этого и потащите вредное изменение дальше.
Третья — сравнение разных периодов. «В июне было так, в июле стало лучше» — это не тест. Между периодами изменились сезон, конкуренты, рекламные ставки и десяток других факторов. Тест требует одновременного показа обеих версий одной и той же аудитории.
- Определите размер выборки и срок ДО запуска — и не останавливайте тест раньше
- Меняйте одну переменную за раз
- Обе версии показывайте параллельно, а не последовательно
- Ведите тест полными неделями: у будних и выходных разное поведение
- Не тестируйте в аномальные периоды: распродажи, праздники, сбои в рекламе
Тест, остановленный в момент красивой разницы, измеряет не эффект изменения, а вашу нетерпеливость.
Тестируйте крупное, а не оттенок кнопки
Классические истории про рост от смены цвета кнопки относятся к сервисам с миллионами посетителей, где доли процента стоят серьёзных денег. В бизнесе с сотнями визитов такие изменения растворяются в шуме — вы физически не сможете их измерить.
Поэтому проверяйте то, что способно дать заметный сдвиг: другое главное обещание на первом экране, иная структура страницы, изменение предложения, упрощение формы с семи полей до двух. Крупные гипотезы дают крупный эффект, который видно даже на скромном трафике.
Что делать, если трафика мало
Отсутствие возможности проводить корректные A/B-тесты не означает, что улучшать нечего. Есть методы, которые на малых объёмах работают лучше.
- Разговоры с клиентами: десять содержательных интервью дают больше идей, чем сто размытых тестов
- Записи сессий и карты кликов — видно, где люди застревают
- Анализ вопросов, которые задают в переписке: каждый повторяющийся вопрос это дыра в тексте
- Последовательные изменения с честной оценкой на длинном горизонте
- Тест на людях: покажите две версии пяти посторонним и спросите, что понятнее
Как фиксировать результат
Заведите простую таблицу: гипотеза, что меняли, период, результат, вывод. Через полгода она станет ценнее любого отчёта — вы увидите, какие типы изменений в вашем бизнесе стабильно работают, а какие раз за разом не оправдываются. Без записи эти знания теряются, и команда наступает на те же грабли.
Что считать настоящей победой
Статистическая значимость отвечает лишь на вопрос, могла ли разница возникнуть случайно. Она ничего не говорит о том, стоит ли изменение внедрения. Рост конверсии на полпроцента может быть математически достоверным и при этом коммерчески бессмысленным, если внедрение требует месяца работы разработчиков.
Поэтому до старта полезно определить минимальный интересный эффект — величину, ниже которой результат вам просто не нужен. Если прирост меньше, вы оставляете старую версию независимо от красоты цифр в отчёте. Такой порог защищает от бесконечной погони за микроулучшениями.
Проверяйте результат после внедрения
Даже корректно проведённый тест иногда не подтверждается в бою: аудитория меняется, сезон заканчивается, конкуренты меняют предложение. Возьмите за правило через месяц после внедрения сверять фактическую конверсию с ожидаемой. Если расхождение стабильное и большое — гипотеза была ложной, и лучше это признать, чем защищать давнее решение.
Короткий чек-лист перед запуском
- Какую одну гипотезу проверяем?
- Какой минимальный эффект нам вообще интересен?
- Сколько конверсий нужно набрать в каждой группе?
- Когда останавливаемся — по дате или по числу наблюдений?
- Что сделаем с результатом в каждом из исходов?
Если на любой из вопросов нет ответа — тест лучше не начинать: его результат всё равно нельзя будет интерпретировать.
С чего начать
Посчитайте, сколько у вас конверсий в неделю. Если меньше пятидесяти, забудьте про A/B-тесты мелких элементов и начните с крупных гипотез плюс качественных методов: записи визитов, разговоры с клиентами, разбор повторяющихся вопросов в переписке.
Частые вопросы
Сколько трафика нужно для A/B-теста?
Зависит от текущей конверсии и размера эффекта, который вы хотите уловить. Ориентир: при конверсии около 2% для фиксации роста в полтора раза нужно порядка 4–5 тысяч посетителей на группу, а для роста на 20% — десятки тысяч. Мелкие изменения на малом трафике измерить нельзя.
Почему нельзя остановить тест, когда разница уже видна?
Потому что при ежедневных проверках «значимая» разница рано или поздно возникает даже между двумя абсолютно одинаковыми версиями. Останавливая тест в удачный момент, вы измеряете случайный всплеск, а не эффект изменения. Срок и размер выборки определяются до запуска.
Можно ли менять несколько элементов сразу?
Можно, но тогда вы узнаете только суммарный результат и не поймёте, что именно сработало. Часто один элемент помогает, другой вредит, и в сумме получается скромный плюс. Для одиночного теста меняйте одну переменную.
Что делать, если трафика мало для тестов?
Использовать качественные методы: записи визитов, карты кликов, десять разговоров с клиентами, разбор повторяющихся вопросов в переписке. Они дают больше идей, чем некорректные тесты, и не создают ложной уверенности.
Что такое минимальный интересный эффект?
Величина прироста, ниже которой изменение вам просто не нужно — например, меньше 10% роста конверсии не окупает неделю работы. Задав этот порог до теста, вы защищаетесь от погони за статистически достоверными, но коммерчески бессмысленными улучшениями.
Надо ли проверять результат после внедрения?
Обязательно. Через месяц сверьте фактическую конверсию с ожидаемой: аудитория, сезон и предложения конкурентов меняются, и часть подтверждённых гипотез в бою не работает. Стабильное расхождение — повод признать гипотезу ложной, а не защищать прошлое решение.
