Proanalytics.tech
ГайдыКак посчитать A/B-тест: выборка, длительность и чтение результата

Как посчитать A/B-тест: выборка, длительность и чтение результата

11 мин чтения · 8 разделов

Путь эксперимента — от гипотезы до решения «запускать или откатывать». С формулами словами, SQL-проверками и разбором ошибок, из-за которых тест врёт.

Что такое A/B-тест и когда он не подходит

A/B-тест — сравнение двух вариантов на случайных группах: одна часть пользователей видит текущую версию, вторая — изменённую. Случайность делает группы сопоставимыми: разницу в метрике можно связать с изменением, а не с тем, что в группу попали более активные люди.

Подходит метод не всегда. Если трафика мало, тест растянется на месяцы, а доверительный интервал окажется шире эффекта. Если изменение нельзя разделить между пользователями — скажем, смена цены — тест не ваш инструмент.

Гипотеза и метрики: главная, вторичные и guardrail

Гипотеза формулируется до запуска по схеме «если — то — на сколько». Плохо: «рекомендации улучшат продажи». Хорошо: «Если показать похожие товары на карточке, конверсия в добавление в корзину вырастёт на 3 процентных пункта за две недели».

Размер выборки и длительность

Выборку считают до запуска. Она зависит от пяти величин: базовый уровень метрики, минимальный заметный эффект, разброс метрики, мощность и уровень значимости.

Для доли логика простая: размер одной группы примерно равен 16 × p × (1 − p), делённому на квадрат минимального заметного эффекта. Здесь p — базовый уровень конверсии, эффект — в абсолютных пунктах, а 16 связывает мощность 80 % и уровень значимости 5 %. При конверсии 10 % и желаемом росте до 11 % нужно около 14 400 пользователей на группу.

Длительность берут кратной целым неделям: будни и выходные ведут себя по-разному.

Рандомизация и качество теста

Единица рандомизации — то, что делится на группы. Чаще всего это пользователь: метрика считается по нему, и он же остаётся в одном варианте до конца теста. На анонимном трафике берут сессию или устройство, но тогда человек попадает в оба варианта и эффект размывается.

До старта проверяют сопоставимость групп: доли совпадают с ожидаемыми, срез по платформе, гео и источнику трафика — тоже.

Как считать результат

Итог описывают тремя числами: абсолютная разница, относительный прирост и доверительный интервал вокруг разницы. Без интервала одна лишь цифра прироста ничего не значит.

Ошибки, из-за которых тест врёт

Большая часть провальных экспериментов ломается в процессе: кто-то посмотрел отчёт на третий день и остановил тест на удачном утре.

Что делать с результатом

Решение принимают по главной метрике и guardrail, которые выбрали до старта. Исходов три: запускаем, дорабатываем, откатываем.

Практика: SQL, выгрузка, визуализация

Проверки лучше держать в SQL: они воспроизводимы и не зависят от интерфейса отчётов.

Что сделать: короткий чеклист

Где тренировать

Темы из гайда разобраны в тестах портала — каждый вопрос с объяснением ответа:

Статистика в экспериментах прощает мало: аккуратный расчёт выборки, одна главная метрика и честное чтение интервала решают больше, чем красивый график. Проверьте себя: начните с бесплатной вводной темы курса «Статистика и A/B-тесты», пройдите диагностику уровня из 20 вопросов и добейте слабые места в тренажёре Proanalytics.tech — 1 443 вопроса с объяснением каждого ответа.

Проверьте себя

Диагностика из 20 вопросов покажет ваш уровень и темы, которые стоит подтянуть. Вводная тема любого курса открыта бесплатно и без регистрации.

Создать аккаунт — вводная тема бесплатна Пройти демо-тест без регистрации

Частые вопросы

Сколько должен длиться A/B-тест?
Минимум одну полную неделю, чаще две: срок зависит от выборки и бизнес-цикла и редко укладывается в пару дней.
Можно ли остановить тест раньше, если вариант выигрывает?
Нет. Остановка на всплеске раздувает долю ложных срабатываний: часть «побед» исчезает через неделю, а решение остаётся.
Что делать при Sample Ratio Mismatch?
Не читать результат. Проверьте логику разделения, выгрузку событий и кэш: доли разъезжаются из-за ботов, дублей или потери событий.
Чем относительный эффект отличается от абсолютного?
Абсолютный — разница в процентных пунктах, относительный — в процентах от базового уровня. Рост с 10 % до 11 % это плюс 1 процентный пункт и плюс 10 % относительно.
Что делать, если результат спорный?
Оставляйте текущий вариант, зафиксируйте, чего не хватило, и запускайте новый тест с уточнённой гипотезой.

Другие гайды

Как подготовиться к собеседованию аналитика: план по шагам и срокам Что делать, если не знаешь ответ на собеседовании С чего начать в аналитике: направления, порядок обучения и план первых недель Вопросы на собеседовании системного аналитика: блоки, примеры и логика ответа Вопросы на собеседовании бизнес-аналитика: блоки, примеры и логика ответов Вопросы на собеседовании продуктового аналитика: блоки, примеры и логика ответов Вопросы на собеседовании аналитика данных: блоки и задачи Собеседование джуна аналитика: чего ждут и как отвечать Собеседование на Мидл-аналитика: блоки вопросов, логика ответов и кейсы Собеседование на Сеньор аналитика: что проверяют и как отвечать SQL задачи на собеседовании: типы, логика решения и типичные ошибки Кейсы на собеседовании аналитика: как разбирать и отвечать по шагам Кейсы системного аналитика: 8 рабочих ситуаций с логикой решения Как читать чужой SQL запрос: пошаговый разбор Ошибки в отчётах: как найти расхождение и перестать терять доверие к цифрам Первая неделя работы аналитика: спокойный план действий Как подготовиться к тестовому заданию аналитика Метрики продукта: с чего начать Как вести документацию аналитика Собеседование без опыта: план на месяц
Все гайды Курсы и тесты