Калькулятор A/B-теста

Отвечает на два вопроса, которые задают в разное время. До запуска: сколько нужно трафика, чтобы тест вообще смог что-то показать.

Результаты теста

Вариант A — контроль

3,00% конверсия

Вариант B — новый

3,70% конверсия

Можно ли верить разнице

Заполните обе колонки.
95% доверительный интервал прироста конверсии
Предупреждения появятся после расчёта.

Сколько нужно наблюдений

Конверсия контрольного варианта, в процентах.
Относительный: 15% значит рост с 3% до 3,45%.
Вероятность заметить эффект, если он есть.

Как это работает

После: можно ли верить разнице, которая получилась. Значимость считается z-критерием для двух долей — тем же способом, что в рекламных кабинетах и в статистических пакетах.

Под ответом стоит доверительный интервал прироста: он говорит больше одного числа, потому что показывает не только «выиграл», но и насколько уверенно. Отдельно инструмент предупреждает о самой частой ошибке — подглядывании в тест до набора выборки.

Что считает A/B-тест и какие величины в нём главные

A/B-тест сравнивает два варианта и отвечает на один вопрос: достаточно ли данных, чтобы считать разницу настоящей. Наблюдаемое отличие конверсий почти всегда есть, но оно может быть случайным колебанием. Статистическая значимость показывает, насколько маловероятно получить такую разницу, если варианты на деле одинаковы.

До запуска считают размер выборки: он зависит от исходной конверсии, минимального эффекта, который вы хотите заметить, и требуемой мощности. Чем меньше эффект, тем больше нужно людей, причём зависимость квадратичная: чтобы поймать разницу вдвое меньшую, выборку увеличивают вчетверо.

Сравнение вариантов
Вопрос теста один: отличается ли результат сильнее, чем позволяет случайность. Фото: File:Defect watch Poljot Buran chronogra, CC BY-SA 3.0.
ВеличинаОбычное значениеЧто означает
Уровень значимости5 %риск увидеть эффект там, где его нет
Мощность80 %шанс заметить эффект, если он есть
Минимальный эффектзадаёте самиразница, ради которой стоит менять
Длительностьот неделичтобы попали все дни недели

Главная ловушка теста — подглядывание. Если проверять результат каждый день и останавливаться в тот момент, когда значимость впервые перешла порог, тест перестаёт работать: при достаточном числе проверок случайное колебание рано или поздно даст нужную цифру. Поэтому размер выборки и срок фиксируют заранее и досматривают до конца.

История: от делянок Фишера до почтовых рассылок

Идея сравнивать группы с случайным распределением пришла из сельского хозяйства. В двадцатые годы Рональд Фишер, работая на опытной станции в Ротамстеде, показал: чтобы понять действие удобрения, делянки нужно распределять жребием, иначе почва и погода подменят собой эффект. Там же он ввёл понятие уровня значимости и предложил порог в пять процентов как удобное практическое соглашение.

Медицина взяла метод в середине века и сделала рандомизированное испытание золотым стандартом. В прямой маркетинг он пришёл через почтовые рассылки: каталог печатали в двух версиях и рассылали случайным половинам базы, а считали по возвратам купонов. Веб добавил к этому лишь скорость: тот же план эксперимента исполняется за дни и без типографии.

Опытное поле
Рандомизация родилась на опытных делянках: без жребия эффект удобрения путался с качеством почвы. Фото: Викисклад, общественное достояние.

Как спланировать тест и прочитать результат

Для расчёта выборки задайте текущую конверсию и минимальный эффект, который вам интересен. Для проверки результата введите посетителей и конверсии по обоим вариантам — калькулятор покажет разницу и её значимость.

Один тест проверяет одну гипотезу: меняя сразу кнопку, заголовок и цену, вы не узнаете, что сработало. Рядом лежат расчёт размера выборки и калькулятор конверсии.

Порог значимостиобычно 5 %
Мощностьобычно 80 %
Эффект вдвое меньшевыборка вчетверо больше
Минимумполные недели
Подглядываниеломает тест
Одна гипотезана один тест

Значимость не отвечает на вопрос, стоит ли внедрять вариант. Разница в полпроцента может оказаться статистически надёжной на большой выборке и при этом не окупить переделку. Поэтому минимальный эффект задают из экономики: считают, какой прирост вернёт стоимость изменений, и уже под него планируют тест.

Как пользоваться

  1. Сколько человек увидело вариант и сколько совершило целевое действие.
  2. Значимо или нет, при каком уровне и с каким доверительным интервалом прироста.
  3. Во втором блоке видно, сколько наблюдений нужно, чтобы поймать интересующий вас прирост.
  4. Инструмент скажет, если данных мало или если разница попадает в интервал неопределённости.

Частые вопросы

Что означает p-value

Вероятность увидеть такую же или большую разницу между вариантами, если на самом деле разницы нет. P-value 0,03 значит: если бы варианты были одинаковыми, такой результат случайно выпадал бы в трёх случаях из ста. Это не вероятность того, что вариант B лучше, — распространённое, но неверное прочтение.

Почему порог именно 5%

Это практическое соглашение, закона природы за ним нет. Порог 0,05 предложил Рональд Фишер в 1920-е как удобную границу, и он прижился. Для решений с высокой ценой ошибки берут 1%, для быстрых продуктовых проверок иногда допускают 10%. Важно выбрать порог ДО теста: подбирать его после того, как увидел данные, — это способ получить любой желаемый ответ.

Можно ли остановить тест, как только появилась значимость

Нет, и это главная причина ложных побед. При подглядывании каждый день вероятность хотя бы раз случайно пересечь порог доходит до 20–30% даже когда разницы нет вообще. Размер выборки считается заранее, тест останавливается по его достижении. Исключение — заранее заложенные промежуточные проверки со скорректированным порогом.

Что такое доверительный интервал прироста

Диапазон, в котором с заданной уверенностью лежит настоящая разница. Интервал «от −2% до +18%» означает, что вариант B может оказаться и хуже: результат не значим, хотя среднее показывает рост. Интервал «от +4% до +12%» говорит не только о победе, но и о её масштабе — а это то, что нужно для решения.

Сколько трафика нужно для теста

Зависит от базовой конверсии и от того, какой прирост вы хотите поймать. Ловить рост на 1% при конверсии 2% — это десятки тысяч наблюдений на вариант. Правило простое: чем меньше эффект, тем больше выборка, причём вчетверо при уменьшении эффекта вдвое. Второй блок считает это точно.

Тест не значим — значит, вариант B не работает

Значит, данных не хватило, чтобы отличить его от A. Отсутствие доказательства не есть доказательство отсутствия. Посмотрите на доверительный интервал: если он широкий, тест просто не добрал выборку; если узкий и лежит вокруг нуля, разницы действительно нет.

Данные куда-то отправляются

Нет, всё считается в браузере.

Похожие инструменты

Размер выборки

Сколько ответов нужно опросу при погрешности и доверии, сколько пользователей на вариант нужно A/B-тесту, дни теста по трафику.

Открыть
Калькулятор конверсии

Считает CR сайта из трафика и заявок: сколько посетителей превращается в лиды и сколько нужно трафика под план.

Открыть
Прогноз трафика по позициям

Кривая CTR × частотность: переходы сейчас, при выходе в топ-3 и топ-1, редактируемая кривая и поправка на Вордстат.

Открыть
Калькулятор NPS

Индекс лояльности клиентов по ответам на шкале 0–10: промоутеры, нейтралы, критики и итоговый NPS с трактовкой.

Открыть
Проверка UTM-меток списком

Разбирает список ссылок из медиаплана: разный регистр значений, кириллица, второй знак вопроса, метки после якоря, дубли и незакрытые макросы площадок.

Открыть
Калькулятор оттока клиентов

Отток и удержание за период, перевод месячного оттока в годовой по сложному проценту, срок жизни клиента и цена процентного пункта.

Открыть

Ещё инструменты для рекламы и аналитики

Генератор UTM-меток, минус-слова и кросс-минусовка, расчёты CTR, конверсии, ROMI и юнит-экономики, калькулятор A/B-теста — в разделе 30 инструментов.

Сервисы, о которых здесь речь

Что это за инструменты, кому подходят и что доступно без оплаты — в карточках каталога.

Весь раздел: Опросы и формы.