Калькулятор A/B-теста
Отвечает на два вопроса, которые задают в разное время. До запуска: сколько нужно трафика, чтобы тест вообще смог что-то показать.
Результаты теста
Вариант A — контроль
Вариант B — новый
Можно ли верить разнице
Сколько нужно наблюдений
Как это работает
После: можно ли верить разнице, которая получилась. Значимость считается z-критерием для двух долей — тем же способом, что в рекламных кабинетах и в статистических пакетах.
Под ответом стоит доверительный интервал прироста: он говорит больше одного числа, потому что показывает не только «выиграл», но и насколько уверенно. Отдельно инструмент предупреждает о самой частой ошибке — подглядывании в тест до набора выборки.
Что считает A/B-тест и какие величины в нём главные
A/B-тест сравнивает два варианта и отвечает на один вопрос: достаточно ли данных, чтобы считать разницу настоящей. Наблюдаемое отличие конверсий почти всегда есть, но оно может быть случайным колебанием. Статистическая значимость показывает, насколько маловероятно получить такую разницу, если варианты на деле одинаковы.
До запуска считают размер выборки: он зависит от исходной конверсии, минимального эффекта, который вы хотите заметить, и требуемой мощности. Чем меньше эффект, тем больше нужно людей, причём зависимость квадратичная: чтобы поймать разницу вдвое меньшую, выборку увеличивают вчетверо.

| Величина | Обычное значение | Что означает |
|---|---|---|
| Уровень значимости | 5 % | риск увидеть эффект там, где его нет |
| Мощность | 80 % | шанс заметить эффект, если он есть |
| Минимальный эффект | задаёте сами | разница, ради которой стоит менять |
| Длительность | от недели | чтобы попали все дни недели |
Главная ловушка теста — подглядывание. Если проверять результат каждый день и останавливаться в тот момент, когда значимость впервые перешла порог, тест перестаёт работать: при достаточном числе проверок случайное колебание рано или поздно даст нужную цифру. Поэтому размер выборки и срок фиксируют заранее и досматривают до конца.
История: от делянок Фишера до почтовых рассылок
Идея сравнивать группы с случайным распределением пришла из сельского хозяйства. В двадцатые годы Рональд Фишер, работая на опытной станции в Ротамстеде, показал: чтобы понять действие удобрения, делянки нужно распределять жребием, иначе почва и погода подменят собой эффект. Там же он ввёл понятие уровня значимости и предложил порог в пять процентов как удобное практическое соглашение.
Медицина взяла метод в середине века и сделала рандомизированное испытание золотым стандартом. В прямой маркетинг он пришёл через почтовые рассылки: каталог печатали в двух версиях и рассылали случайным половинам базы, а считали по возвратам купонов. Веб добавил к этому лишь скорость: тот же план эксперимента исполняется за дни и без типографии.

Как спланировать тест и прочитать результат
Для расчёта выборки задайте текущую конверсию и минимальный эффект, который вам интересен. Для проверки результата введите посетителей и конверсии по обоим вариантам — калькулятор покажет разницу и её значимость.
Один тест проверяет одну гипотезу: меняя сразу кнопку, заголовок и цену, вы не узнаете, что сработало. Рядом лежат расчёт размера выборки и калькулятор конверсии.
| Порог значимости | обычно 5 % |
| Мощность | обычно 80 % |
| Эффект вдвое меньше | выборка вчетверо больше |
| Минимум | полные недели |
| Подглядывание | ломает тест |
| Одна гипотеза | на один тест |
Значимость не отвечает на вопрос, стоит ли внедрять вариант. Разница в полпроцента может оказаться статистически надёжной на большой выборке и при этом не окупить переделку. Поэтому минимальный эффект задают из экономики: считают, какой прирост вернёт стоимость изменений, и уже под него планируют тест.
Как пользоваться
- Сколько человек увидело вариант и сколько совершило целевое действие.
- Значимо или нет, при каком уровне и с каким доверительным интервалом прироста.
- Во втором блоке видно, сколько наблюдений нужно, чтобы поймать интересующий вас прирост.
- Инструмент скажет, если данных мало или если разница попадает в интервал неопределённости.
Частые вопросы
Что означает p-value
Вероятность увидеть такую же или большую разницу между вариантами, если на самом деле разницы нет. P-value 0,03 значит: если бы варианты были одинаковыми, такой результат случайно выпадал бы в трёх случаях из ста. Это не вероятность того, что вариант B лучше, — распространённое, но неверное прочтение.
Почему порог именно 5%
Это практическое соглашение, закона природы за ним нет. Порог 0,05 предложил Рональд Фишер в 1920-е как удобную границу, и он прижился. Для решений с высокой ценой ошибки берут 1%, для быстрых продуктовых проверок иногда допускают 10%. Важно выбрать порог ДО теста: подбирать его после того, как увидел данные, — это способ получить любой желаемый ответ.
Можно ли остановить тест, как только появилась значимость
Нет, и это главная причина ложных побед. При подглядывании каждый день вероятность хотя бы раз случайно пересечь порог доходит до 20–30% даже когда разницы нет вообще. Размер выборки считается заранее, тест останавливается по его достижении. Исключение — заранее заложенные промежуточные проверки со скорректированным порогом.
Что такое доверительный интервал прироста
Диапазон, в котором с заданной уверенностью лежит настоящая разница. Интервал «от −2% до +18%» означает, что вариант B может оказаться и хуже: результат не значим, хотя среднее показывает рост. Интервал «от +4% до +12%» говорит не только о победе, но и о её масштабе — а это то, что нужно для решения.
Сколько трафика нужно для теста
Зависит от базовой конверсии и от того, какой прирост вы хотите поймать. Ловить рост на 1% при конверсии 2% — это десятки тысяч наблюдений на вариант. Правило простое: чем меньше эффект, тем больше выборка, причём вчетверо при уменьшении эффекта вдвое. Второй блок считает это точно.
Тест не значим — значит, вариант B не работает
Значит, данных не хватило, чтобы отличить его от A. Отсутствие доказательства не есть доказательство отсутствия. Посмотрите на доверительный интервал: если он широкий, тест просто не добрал выборку; если узкий и лежит вокруг нуля, разницы действительно нет.
Данные куда-то отправляются
Нет, всё считается в браузере.
Похожие инструменты
Сколько ответов нужно опросу при погрешности и доверии, сколько пользователей на вариант нужно A/B-тесту, дни теста по трафику.
ОткрытьКалькулятор конверсииСчитает CR сайта из трафика и заявок: сколько посетителей превращается в лиды и сколько нужно трафика под план.
ОткрытьПрогноз трафика по позициямКривая CTR × частотность: переходы сейчас, при выходе в топ-3 и топ-1, редактируемая кривая и поправка на Вордстат.
ОткрытьКалькулятор NPSИндекс лояльности клиентов по ответам на шкале 0–10: промоутеры, нейтралы, критики и итоговый NPS с трактовкой.
ОткрытьПроверка UTM-меток спискомРазбирает список ссылок из медиаплана: разный регистр значений, кириллица, второй знак вопроса, метки после якоря, дубли и незакрытые макросы площадок.
ОткрытьКалькулятор оттока клиентовОтток и удержание за период, перевод месячного оттока в годовой по сложному проценту, срок жизни клиента и цена процентного пункта.
ОткрытьЕщё инструменты для рекламы и аналитики
Генератор UTM-меток, минус-слова и кросс-минусовка, расчёты CTR, конверсии, ROMI и юнит-экономики, калькулятор A/B-теста — в разделе 30 инструментов.
Сервисы, о которых здесь речь
Что это за инструменты, кому подходят и что доступно без оплаты — в карточках каталога.
Весь раздел: Опросы и формы.