Понятие A/B-тестов · Словарь Romi+

Размер выборки в A/B-тесте: что это и как её рассчитать

Размер выборки (n) — это сколько наблюдений (показов, кликов, конверсий) нужно набрать каждому варианту, чтобы A/B-тест смог надёжно отличить реальную разницу между креативами от случайного шума. Чем меньше эффект, который вы хотите уловить, и чем ниже базовая конверсия, тем больше выборка нужна.

размер выборки в A/B-тесте, объём выборки, sample size, n на группу; расчёт размера выборки. Не путать с длительностью теста — выборка меряется в наблюдениях, а не в днях.

Обновлено:

Формула
Размер выборки на группу для сравнения двух конверсий: n = (z₁₋α/₂ + z₁₋β)² × [p₁(1−p₁) + p₂(1−p₂)] / (p₂ − p₁)². Здесь p₁ — базовая конверсия, p₂ = p₁ + MDE — ожидаемая, α — уровень значимости (обычно 0,05), 1−β — мощность (обычно 0,8). Точное n удобнее считать калькулятором.
n
— искомый размер выборки на одну группу (контроль или вариант). Общий объём теста — вдвое больше
p₁
— базовая конверсия контроля — исходный уровень метрики, от которого отсчитывается эффект
p₂ = p₁ + MDE
— ожидаемая конверсия варианта: базовая плюс минимальный эффект, который хотите уловить (MDE)
p₂ − p₁
— размер эффекта в абсолютном выражении (в долях). Стоит в знаменателе в квадрате — вдвое меньший эффект требует примерно вчетверо большей выборки
z₁₋α/₂
— квантиль нормального распределения под уровень значимости α (для двустороннего теста при α = 0,05 это ≈ 1,96)
z₁₋β
— квантиль под мощность 1−β (при мощности 80% это ≈ 0,84)
Пример расчёта

A/B-тест двух рекламных креативов. Базовая конверсия контроля p₁ = 3%. Хотите уловить прирост в 0,5 процентного пункта (p₂ = 3,5%), при α = 0,05 и мощности 80%.

Подставляем в формулу: числитель — (1,96 + 0,84)² ≈ 7,85, умноженное на [0,03×0,97 + 0,035×0,965] ≈ 0,0629; знаменатель — (0,005)² = 0,000025. Порядок величины получается — десятки тысяч наблюдений на каждую группу. Точное n зависит от округлений и берётся из калькулятора.

Вывод — не одно число, а зависимость: маленький эффект (0,5 п.п.) на невысокой базе (3%) требует крупной выборки — порядка десятков тысяч наблюдений на группу, а весь тест — вдвое больше. Захотите ловить прирост вдвое мельче — выборка вырастет примерно вчетверо. Точный n под ваши p₁, MDE, α и мощность посчитает калькулятор A/B-теста /calculators/ab-test — руками формулу разворачивать не нужно.

Ориентиры

Единого «нормального» размера выборки нет — он всегда считается под конкретные p₁, MDE, α и мощность, а не берётся из таблицы. Честные ориентиры: базовые значения — α = 0,05 и мощность 80% (z ≈ 1,96 и 0,84); поднимете мощность до 90% — выборка вырастет примерно на треть под тот же эффект. Ключевая закономерность: чем НИЖЕ базовая конверсия и чем МЕНЬШЕ ожидаемый эффект (MDE), тем БОЛЬШЕ нужна выборка — эффект стоит в знаменателе в квадрате, поэтому цена «различить мелочь» растёт нелинейно. Важная оговорка: n считают ДО запуска, а не подгоняют по ходу — остановить тест в момент, когда p-value случайно провалился ниже 0,05, значит завысить долю ложных выводов. И выборка — это наблюдения, а не дни: перевести n в срок теста можно, только зная дневной трафик и охват.

Зачем считать размер выборки до запуска

Разница в конверсии между двумя креативами есть почти всегда — вопрос в том, реальна она или это шум малой выборки. Если запустить тест «на глаз» и остановить, как только один вариант вырвался вперёд, легко принять удачную сотню показов за победу и слить бюджет на решение, построенное на случайности. Расчёт размера выборки заранее отвечает на вопрос «сколько наблюдений нужно набрать каждому варианту, чтобы вывод был обоснован». Он превращает тест из гадания в план: вы заранее знаете, какой объём трафика собрать и когда результат можно будет читать всерьёз. Недобрали выборку — тест физически не способен различить нужный эффект и, скорее всего, покажет «ничью», даже если разница есть. Перебрали — зря потратили трафик и время на то, что можно было решить раньше. Поэтому n планируют до запуска, а не оценивают постфактум.

От чего зависит размер выборки

В формулу входят четыре величины, и каждая тянет n в свою сторону. Первое — базовая конверсия p₁: чем она ниже, тем больше выборка нужна, потому что редкие события труднее статистически различить. Второе, и главное — ожидаемый эффект (MDE), то есть разница p₂ − p₁, которую вы хотите уловить: она стоит в знаменателе в квадрате, поэтому вдвое меньший эффект требует примерно вчетверо большей выборки. Отсюда ключевая связка: чем меньше эффект и чем ниже база, тем дороже обходится тест по трафику. Третье — уровень значимости α (обычно 0,05): строже порог — больше выборка. Четвёртое — мощность 1−β (обычно 80%): выше мощность — тоже больше выборка. Зафиксируйте α, мощность и MDE — и n полностью определяется базовой конверсией и размером эффекта. Именно поэтому под мелкие приросты в рекламе часто нужны десятки тысяч показов на вариант, которые не всегда реально набрать за разумный срок.

Размер выборки, MDE, значимость и мощность — как они связаны

Эти четыре понятия — стороны одной задачи планирования эксперимента, и их постоянно путают. MDE — это какой минимальный эффект вы хотите различить (что ловим), а не наблюдаемая по итогам теста разница. Мощность — вероятность заметить этот эффект, если он реально есть. Уровень значимости α — риск ложного срабатывания, увидеть разницу там, где её нет; это не «вероятность того, что гипотеза верна». А размер выборки — это то, что вы получаете на выходе, зафиксировав первые три: сколько наблюдений собрать, чтобы при выбранных MDE, мощности и α тест сработал. Двигать можно любую ручку, но не бесплатно: хотите ловить более тонкий эффект или поднять мощность — выборка растёт; готовы различать только крупные различия — выборки нужно меньше. Отдельно стоит статзначимость: её проверяют ПОСЛЕ теста по p-value, тогда как размер выборки и MDE планируют ДО. Правильно набранная выборка как раз и нужна, чтобы итоговая проверка значимости была осмысленной, а не выносила вердикт по паре сотен наблюдений.

Расчёт размера выборки в Romi+

Прежде чем запускать A/B-тест креативов, прикиньте нужный n: калькулятор A/B-теста Romi+ на /calculators/ab-test считает размер выборки по базовой конверсии, желаемому эффекту (MDE), уровню значимости и мощности — то есть по той самой формуле, только без ручной арифметики. Это фильтр здравого смысла на входе: он подсказывает, сколько трафика собрать на каждый вариант, чтобы результат вообще можно было трактовать. По итогам открутки Romi+ сравнивает креативы, считает конверсию и окупаемость по каждому объявлению из вашей выгрузки из рекламного кабинета или MMP и показывает, значима ли разница, — чтобы вы не масштабировали «победителя», который выиграл случайно на недобранной выборке. Серверы Romi+ находятся в РФ, работа с данными — в рамках 152-ФЗ.

Размер выборки, MDE, значимость и мощность: кто за что отвечает

ПонятиеЧто этоКогда задаётсяТипичное значение
MDEминимальный эффект, который тест способен уловитьдо запускапод задачу, например +0,5 п.п.
Уровень значимости αдопустимый риск ложного «различие есть»до запуска0,05
Мощность (1−β)вероятность заметить эффект, если он естьдо запуска0,8
Размер выборки nсколько наблюдений нужно каждой группевычисляется из трёх параметров вышеиз калькулятора A/B-теста
p-valueмера того, насколько наблюдаемое различие похоже на случайностьпосле тестасравнивается с α: p < 0,05 → значимо

A/B-тесты креативов — в Romi+

Romi+ прогоняет A/B-тесты объявлений и считает статистику за вас: сравнивает креативы, показывает, значимо ли различие, и выносит вердикт по каждому. Первый разбор бесплатно.

Частые вопросы

Что такое размер выборки в A/B-тесте простыми словами?

Это сколько наблюдений — показов, кликов или конверсий — нужно набрать каждому варианту, чтобы тест смог надёжно отличить реальную разницу между креативами от случайного шума. Слишком маленькая выборка не различит эффект и покажет «ничью», даже если разница есть; поэтому нужный размер считают заранее, до запуска.

Как рассчитать размер выборки для A/B-теста?

Для сравнения двух конверсий n на группу = (z₁₋α/₂ + z₁₋β)² × [p₁(1−p₁) + p₂(1−p₂)] / (p₂ − p₁)², где p₁ — базовая конверсия, p₂ = p₁ + MDE, α обычно 0,05, мощность обычно 80%. Руками разворачивать формулу не обязательно — точный n под ваши цифры быстрее посчитать калькулятором A/B-теста.

От чего зависит нужный размер выборки?

От четырёх величин: базовой конверсии, ожидаемого эффекта (MDE), уровня значимости α и мощности. Ключевая закономерность — чем НИЖЕ базовая конверсия и чем МЕНЬШЕ эффект, который хотите уловить, тем БОЛЬШЕ нужна выборка. Эффект стоит в знаменателе в квадрате, поэтому вдвое меньший прирост требует примерно вчетверо большей выборки.

Сколько наблюдений нужно для теста двух креативов?

Универсального числа нет — всё зависит от базы и MDE. Для примера: базовая конверсия 3%, хотим уловить +0,5 п.п., α = 0,05, мощность 80% — порядок величины получается десятки тысяч наблюдений на каждую группу. Точное n под ваши параметры даст калькулятор; выдумывать «магическое» число вроде 1000 на все случаи нельзя.

Чем размер выборки отличается от длительности теста?

Размер выборки меряется в наблюдениях (показах, кликах, конверсиях), а не в днях. Перевести n в срок можно, только зная дневной трафик: если формула требует 10 000 показов на вариант, а креатив набирает 1000 в день, тест продлится около 20 дней на обе группы. Останавливать его раньше по «удачному» p-value значит завышать долю ложных выводов.

Можно ли добирать выборку, если разница пока не значима?

Осознанно продлевать тест до заранее рассчитанного n — нормально. А вот подглядывать в результаты и останавливаться в момент, когда p-value случайно провалился ниже 0,05, — нет: это раздувает вероятность принять шум за победу. Поэтому размер выборки и планируют до запуска, а не по ходу под желаемый результат.

Смежные метрики

Мы используем cookie для работы сайта, аналитики (Яндекс.Метрика) и улучшения сервиса. Подробнее — в Политике cookie и Политике обработки ПД.