Во многих командах A/B-тест подают как арбитра, завершающего спор: не согласны — давайте протестируем. Но тесты не бесплатны: они тратят трафик, время и внимание. Настоящий навык не в том, чтобы запустить тест, а в том, чтобы выбрать, какое решение его заслуживает.
Nielsen Norman Group напоминает, что A/B-тест показывает, какой вариант работает лучше, но не объясняет почему, а для понимания причины нужны качественные исследования. Эксперимент, таким образом, дополняет исследование пользователей, а не заменяет его.Nielsen Norman Group — A/B Testing 101
1. Не каждое решение требует эксперимента
У части решений ответ известен заранее. Дефект доступности, сломанную форму или нечитаемый контраст не тестируют, а исправляют. Прогонять их через эксперимент — значит лишь создавать задержку.
Другие решения слишком малы для измерения. Тест цвета кнопки на странице с несколькими сотнями посетителей в месяц займёт месяцы до значимого результата и всё это время будет занимать внимание команды.
Решения, достойные эксперимента, обладают тремя признаками сразу: исход действительно неопределён, трафика достаточно, а результат направит инвестицию. Если чего-то из трёх нет, эффективнее суждение, исследование или прямое внедрение.
Культура экспериментов, построенная без этого фильтра, быстро рушится под собственным весом. Чем больше накапливается безрезультатных тестов, тем сильнее команда верит, что данные не работают, хотя проблема была в выборе вопроса.
Защищая эксперименты, произнесите и вторую часть вслух: не тестировать — не лень. Повторно измерять вопрос, на который устоявшиеся принципы юзабилити давно ответили, значит красть время у настоящих неопределённостей.
2. Сопоставьте решение с методом
Тип неопределённости определяет подходящий метод. Если вы не знаете, чего пользователи не понимают, нужен не эксперимент, а наблюдение; если вы выбираете между двумя хорошими вариантами, эксперимент уместен.
Таблица ниже соотносит часто путаемые ситуации с методами. Цель не принизить тестирование, а выделить вопросы, на которые оно способно ответить.
Запишите в таблицу и свой порог трафика. Один и тот же вопрос решается наблюдением при двухстах посетителях в день и экспериментом при двадцати тысячах.
| Ситуация | Тип неопределённости | Подходящий метод | Ожидаемый результат |
|---|---|---|---|
| Пользователи бросают форму | Причина неизвестна | Наблюдение сессий и интервью | Точка трения |
| Колебание между двумя заголовками | Предпочтение неясно | A/B-тест | Измеренная разница |
| Сломанный сценарий или дефект доступности | Неопределённости нет | Прямое исправление | Дефект устранён |
| Идея нового типа страницы | Объём неясен | Прототип и юзабилити-тест | Понятность |
| Мелкое изменение на низком трафике | Недостаточная мощность | Суждение и принципы | Быстрое решение |
3. Запишите гипотезу и метрику заранее
Хорошая гипотеза состоит из трёх частей: для кого, какое изменение и какую перемену в поведении вы ожидаете. Тест, начатый без этих трёх, толкуется как угодно.
Выберите одну первичную метрику. Команды, следящие за несколькими сразу, строят рассказ вокруг той, что сдвинулась, и превращают тест в обряд подтверждения.
Рядом с первичной поставьте защитную метрику. Если изменение поднимает конверсию, но увеличивает возвраты или обращения в поддержку, выигрыш ненастоящий.
До запуска запишите и само решение: при каком результате выкатываем, при каком откатываем, при каком считаем данные недостаточными. Без этих трёх порогов итог всегда трактуется в свою пользу.
- Сформулируйте гипотезу одной фразой.
- Выберите единственную первичную метрику.
- Определите защитную метрику.
- Рассчитайте выборку и срок заранее.
- Зафиксируйте пороги решения заранее.
4. Гипотетический сценарий: победивший тест, который стоил денег
На гипотетическом сайте услуг команда пробует вариант, сокращающий форму запроса с семи полей до трёх. Через две недели число отправок заметно растёт, и вариант объявляют победителем.
Через месяц продажи жалуются: большинство обращений приходит от людей, чей бюджет или объём задачи не подходят, а доля доходящих до первой встречи упала. Тест выиграл, а бизнес проиграл.
Ошибка не в конструкции теста, а в выборе метрики. Если бы первичной метрикой была квалифицированная встреча, а не отправка формы, а защитной — срок сделки, результат читался бы иначе с самого начала. Это гипотетический пример, а не клиентский результат.
5. Статистическая дисциплина
Надёжность обычно страдает не от статистики, а от нетерпения. Ежедневная проверка результатов и остановка при первом появлении значимости заметно поднимают долю ложноположительных выводов.
Именно об этом предупреждает известный текст Эвана Миллера: многократная проверка результатов и остановка в момент появления значимости поднимают реальную частоту ошибок далеко выше заявленной, а лекарство — определить размер выборки заранее и придерживаться его. Поэтому календарь экспериментов строится по статистической мощности, а не по маркетинговому плану.Evan Miller — How Not To Run An A/B Test
Задавайте срок и по деловому циклу. На сайте, где поведение в будни и выходные различается, трёхдневный тест измеряет календарь, а не изменение.
Неопределённый результат не считайте провалом. Решение не выкатывать изменение без измеримого эффекта — тоже решение, и оно ведёт команду к следующему, более крупному вопросу.
Рассчитывайте выборку заранее
До теста запишите текущую конверсию, наименьшую разницу, которую хотите обнаружить, и допустимую погрешность. Эти три величины задают нужное число посетителей и срок.
Если расчётный срок превышает три месяца, тест не запускайте. Это признак того, что вопрос требует суждения или более крупного изменения.
Не попадайтесь в ловушку сегментов
Когда общий результат нулевой, поиск выигрышного сегмента — самый частый способ принять случайность за открытие. Сегментный анализ надёжен, только если определён заранее.
Если неожиданная разница по сегменту выглядит интересной, запишите её как гипотезу, а не как результат, и проверьте отдельным тестом.
6. Порядок построения системы экспериментов
Стройте процесс до выбора инструмента. Платформа тестирования без бэклога гипотез, критериев приоритизации, порогов решения и архива результатов лишь быстрее выдаёт безрезультатность.
Соберите гипотезы в один список и упорядочьте по ожидаемому эффекту, стоимости внедрения и статистической мощности. Когда критерии записаны, спор смещается от мнения к методу.
Фиксируйте каждый результат вместе с выводом, прежде чем называть его победой или поражением. Через полгода самым ценным активом окажется не набор победивших вариантов, а архив уже отвергнутых идей.
Держите архив пригодным для поиска. В каждой записи должны быть гипотеза, аудитория, срок, выборка, первичная метрика, результат и принятое решение. При стандартных полях новый сотрудник не повторит ту же идею через полгода.
- Бэклог гипотез собран в один список.
- Критерии приоритизации записаны.
- Выбраны первичная и защитная метрики.
- Выборка и срок рассчитаны заранее.
- Пороги решения зафиксированы.
- Тест ограничен одной переменной.
- Результат и вывод внесены в архив.
7. Границы и режимы отказа
A/B-тест не отвечает на вопрос «почему». Он говорит, какой вариант победил; что именно осталось непонятым и почему пользователь колебался, показывают наблюдение и интервью.
Выигрыш от накопления мелких изменений тоже ограничен. Программа, движущаяся только пробами цвета и текста, со временем начинает гоняться за разницей, слишком малой для измерения.
Эффект новизны способен временно завысить результат. Первая реакция действующих пользователей на новую раскладку может не отражать долгого поведения, поэтому за критическими изменениями наблюдайте дольше.
У экспериментов есть этические и правовые границы. Пробы с ценами, условиями договора или объёмом сбора персональных данных могут быть несправедливыми или недопустимыми; здесь правовая оценка идёт первой.
Наконец, система экспериментов — культурное обязательство. В команде, принимающей результат лишь при совпадении с ожиданием, тест становится инструментом убеждения, а не решения.
Заключение
Система экспериментов строится отбором правильных вопросов, а не числом тестов. Сопоставляйте решения с методами, записывайте гипотезу и пороги заранее, рассчитывайте выборку и архивируйте выводы.
Часто задаваемые вопросы
Источники
- Nielsen Norman Group — A/B Testing 101
На какой вопрос тест отвечает, а на какой нет
- Evan Miller — How Not To Run An A/B Test
Влияние ранней остановки на частоту ошибок
Превратим тесты в систему, которая принимает решения
Вместе выстроим бэклог гипотез, метрики и пороги решения.
Запросить настройку системы экспериментов


