A/B-тест — это сравнение двух версий страницы (или элемента) на реальном живом трафике. Половина посетителей видит «A» (контроль), половина — «B» (новый вариант). Через 1–4 недели смотрите, какая версия дала больше конверсий с учётом статистической значимости. Это единственный честный способ узнать, что работает — на цифрах.
Что тестируют: заголовок (H1), CTA-кнопку (текст, цвет, размер), первый экран, цены и тарифы, форму заявки, расположение блоков, фото и иллюстрации. Иногда — структуру страницы целиком (radical test). Главное правило: один тест — одна переменная. Если меняете заголовок и кнопку одновременно — не поймёте, что сработало.
Самая частая ошибка — остановить тест слишком рано. Чтобы получить статистически значимый результат, нужно набрать достаточный объём конверсий: ориентир — минимум 100 конверсий на каждый вариант, в идеале — 200–300. С CR 2% это 5–10 тысяч уников на вариант. Меньше — это шум, а не результат.
Чем запускать в России. Главный штатный инструмент — Varioqub (раньше — «Эксперименты в Метрике», в 2022 Яндекс выделил их в отдельный продукт): сплит-тестер с интеграцией Метрики, бесплатный для большинства задач, удобен для CRO, тестов заголовков, цен и лендингов. Google Optimize Google закрыл в сентябре 2023 — вместо него теперь связка GA4 + сторонние сервисы (Optimizely, AB Tasty, VWO) или серверные решения на собственном бэкенде.
5 000 уников → CR 2.1%
105 заявок
5 000 уников → CR 2.9%
145 заявок · p=0.97
+38% заявок при том же трафике. Эффект на год: +14 400 заявок
Как делать правильно
- когда есть стабильный трафик (от 1000 уников в день) и измеримая конверсия
- тестировать по одной переменной — иначе не поймёте, что сработало
- ждать статистической значимости 95%+, не останавливать тест преждевременно
- тестировать гипотезы из анализа: куда уходят пользователи на heatmap, что говорит Webvisor
- не тестировать без четкой гипотезы «зачем» — это лотерея
- не запускать на низком трафике — выборки не хватит, результат — шум
- не делать «вижу — A лидирует на 5%, остановим тест» — это ловушка ранней остановки
- не тестировать одновременно несколько A/B — они влияют друг на друга
Клиент-edtech: лендинг курса с конверсией 2.1%. Гипотеза — сильнее работает «начни бесплатно», чем «подробнее о курсе». Запустили тест 50/50 на 18 000 уников за 12 дней — «начни бесплатно» дал 2.9% при p=0.97. Раскатили вариант B, годовой эффект — +38% заявок.
Не путайте A/B-тест с MVT (мультивариантным тестом). A/B сравнивает две-три цельные версии, MVT — комбинации нескольких элементов сразу (3 заголовка × 2 кнопки = 6 вариантов). MVT требует кратно больше трафика: при тех же 100 конверсиях на ячейку шести комбинациям нужно 600+ конверсий, и на сайте с 30–50 заявками в неделю такой тест не доберёт значимости и за квартал. Поэтому на среднем российском бизнесе MVT почти не запускают — режут гипотезы на последовательные A/B.
Главная скрытая ловушка — peeking, подглядывание в результат каждый день и остановка в момент, когда B «вырвался вперёд». Это ломает математику: при ежедневной проверке ложноположительный результат вылезает не в 5% случаев, а в 25–30%. Лечится двумя способами: либо фиксируете объём выборки и срок заранее и не трогаете тест до конца, либо берёте инструмент с последовательным тестированием (Varioqub умеет байесовский подход, который корректно пересчитывает вероятность на лету). И помните про недельную сезонность: трафик и поведение в будни и выходные разные, поэтому тест всегда должен покрывать целое число недель, иначе перекос дней исказит CR.
Интернет-магазин запустил B-версию карточки товара с кнопкой «Купить в 1 клик». На третий день B показал CR 3,4% против 2,6% у A — менеджер захотел катить в прод. Но конверсий было всего по 40 на вариант, и сервис показывал значимость 71% (нужно ≥95%). Тест докрутили до 260 конверсий на вариант за 3 недели: разрыв схлопнулся до 2,9% против 2,7% — статистически неотличимо. Ранняя остановка дала бы
Частые вопросы
Сколько нужно трафика для A/B-теста?
Ориентир — минимум 100 конверсий на каждый вариант, в идеале 200–300. При конверсии 2% это 5–10 тысяч уников на вариант; меньше — статистический шум. И держи тест на целое число недель: поведение в будни и выходные разное, иначе перекос дней исказит CR.
Чем запускать A/B-тесты в России после закрытия Google Optimize?
Google Optimize закрыли в сентябре 2023. Главный штатный инструмент теперь — Varioqub от Яндекса (бывшие «Эксперименты в Метрике»): сплит-тестер с интеграцией Метрики, бесплатный для большинства задач. Альтернатива — связка GA4 со сторонними Optimizely, AB Tasty, VWO или серверное решение на своём бэкенде.
Почему нельзя останавливать A/B-тест, когда один вариант вырвался вперёд?
Это peeking: при ежедневном подглядывании ложноположительный результат вылезает в 25–30% случаев вместо честных 5%. Зафиксируй объём выборки и срок заранее и не трогай тест до конца — либо возьми инструмент с байесовским подходом, Varioqub так умеет. В примере B «Купить в 1 клик» на третий день показывал 3,4% против 2,6%, но при 260 конверсиях разрыв схлопнулся до неотличимого.