Понятие A/B-тестов · Словарь Romi+

MDE — минимальный обнаружимый эффект в A/B-тесте

MDE — это наименьшая разница между вариантами, которую A/B-тест способен надёжно заметить при вашей выборке, выбранной мощности и уровне значимости. Если реальный эффект меньше MDE, тест его, скорее всего, «не увидит» и покажет ничью, даже когда разница на самом деле есть.

Minimum Detectable Effect; минимальный детектируемый эффект; иногда «чувствительность теста». Не путать с фактическим размером эффекта — той разницей, которую тест показал по итогу открутки.

Обновлено:

Формула
MDE ≈ (z₁₋α/2 + z₁₋β) · √(2·p·(1−p) / n) — стандартная нормальная аппроксимация для сравнения двух долей (конверсий) при равных группах по n наблюдений. Для α = 0,05 и мощности 80% множитель (z₁₋α/2 + z₁₋β) ≈ 1,96 + 0,84 = 2,8. Ключевая зависимость: MDE обратно пропорционален √n — чтобы различить вдвое меньший эффект, нужна вчетверо большая выборка. MDE, выборка и мощность взаимозависимы: зафиксировав любые две (плюс α и базовую конверсию p), третью вы уже не выбираете свободно — она вычисляется.
MDE
— минимальный обнаружимый эффект — порог чувствительности теста; разницу меньше этой тест надёжно не отличит от нуля. Задают до запуска, а не измеряют по итогу
z₁₋α/2, z₁₋β
— квантили стандартного нормального распределения для уровня значимости и мощности; при α = 0,05 и мощности 80% это ≈ 1,96 и 0,84 (в сумме ≈ 2,8)
p
— базовая конверсия контроля, от которой отсчитывается эффект; влияет на то, какая выборка нужна под заданный MDE
n
— размер выборки на каждый вариант — сколько наблюдений (показов, кликов, конверсий) набрал. Главный рычаг: больше выборка — меньше MDE
мощность (1−β)
— вероятность заметить эффект, если он действительно есть; типовое значение 80%. Чем выше мощность, тем больше нужна выборка под тот же MDE
уровень значимости (α)
— допустимая вероятность ложного срабатывания — увидеть различие там, где его нет; обычно 0,05 (5%). Строже α — больше требуемая выборка
Пример расчёта

A/B-тест двух баннеров. Базовая конверсия контроля из клика в заявку — 3%. Вы хотите поймать относительный прирост в 10% (то есть с 3% до 3,3%, абсолютно это +0,3 процентного пункта).

Такой относительно тонкий эффект при мощности 80% и α = 0,05 требует крупной выборки — по порядку величины это десятки тысяч кликов на каждый вариант; точное число даёт калькулятор размера выборки. Наберёте заметно меньше — MDE теста вырастет, и различить он сможет только более грубые сдвиги; прирост в +0,3 п.п. утонет в шуме и даст «ничью». Захотите ловить не 10%, а 5% относительно (вдвое меньший эффект) — требуемая выборка вырастет примерно вчетверо, а не вдвое.

Вывод здесь не арифметический, а про связь трёх величин: MDE, выборка и мощность тянут друг друга. Хотите различать мелкие эффекты — нужна большая выборка; трафик ограничен — тест увидит только крупные различия. Поэтому MDE прикидывают заранее: он подсказывает, сколько кликов нужно набрать, чтобы результат A/B-теста вообще был осмысленным.

Ориентиры

Единого «правильного» MDE нет — его задают под задачу, а не берут из таблицы. На практике по конверсии часто целятся в относительный прирост порядка 5–20%: меньшие эффекты требуют выборки, которую в рекламе редко удаётся набрать за разумный срок. Ключевые оговорки: чем ниже базовая конверсия и чем меньше трафика, тем крупнее эффект вы вообще сможете различить; чем выше желаемая мощность (90% вместо 80%) и строже α, тем больше выборка под тот же MDE. Разумный ориентир — задавать MDE от практической значимости: какой минимальный прирост окупит смену креатива, тот и есть смысл ловить, а не гнаться за различением любых микроразниц.

Зачем нужен MDE и что он показывает

MDE отвечает на вопрос «какую разницу этот тест вообще способен заметить». Это не результат эксперимента, а его настройка — планка чувствительности, которую задают до запуска. У любого A/B-теста есть предел разрешения: на малой выборке видны только грубые различия, тонкие тонут в случайном шуме. Если не задать MDE заранее, легко попасть в ловушку — открутить тест, получить «ничью» и решить, что креативы равны. А на самом деле эффект мог быть, просто теста не хватило, чтобы его различить: он был меньше MDE. Поэтому MDE — честный способ заранее сказать, что вы рассчитываете поймать, а что для этого объёма трафика заведомо недостижимо.

Абсолютный и относительный MDE — не путайте единицы

MDE можно выразить двумя способами, и их постоянно смешивают. Абсолютный MDE — разница в тех же единицах, что и метрика: с конверсии 3% до 3,5% это +0,5 процентного пункта. Относительный MDE — та же разница в процентах от базы: те же +0,5 п.п. при базе 3% это уже +16,7% относительно. Одна и та же формулировка «прирост на 5%» означает совершенно разную выборку в зависимости от трактовки: 5% относительно базы 3% — это всего +0,15 п.п., крошечный эффект, под который нужна огромная выборка. Правило простое: всегда проговаривайте, о чём речь — о пунктах или о процентах от базы, — иначе расчёт нужного трафика уедет в разы. В отчётах по рекламе чаще удобнее относительный MDE: «на сколько процентов вырастет конверсия», — но считать выборку нужно от того же определения, в котором задали цель.

Как MDE связан с мощностью, выборкой и значимостью

MDE не живёт сам по себе — он завязан на четыре величины, и все они взаимозависимы. Уровень значимости α (обычно 0,05) — риск увидеть различие там, где его нет. Мощность 1−β (обычно 80%) — вероятность заметить эффект, если он реально есть. Размер выборки — сколько наблюдений набрал каждый вариант. Базовая конверсия — от неё отсчитывается эффект. Зафиксируйте α, мощность и базу — и MDE полностью определяется выборкой: чем больше данных, тем меньший эффект тест различит. Обратно тоже верно: задайте желаемый MDE — и выборка вычислится однозначно. Отсюда практический расчёт до запуска: берут базовую конверсию, целевой MDE, мощность и α — и получают, сколько трафика нужно на каждый вариант. Захотите ловить эффект вдвое меньше — выборка вырастет примерно вчетверо, а не вдвое. А статзначимость и MDE — две стороны одной монеты: значимость говорит, отличается ли результат от нуля постфактум, MDE — какую разницу вы в принципе рассчитывали различить.

Три частые ошибки с MDE

Первая — задавать MDE постфактум, «подгоняя» под уже полученный результат: так теряется весь смысл планирования, а тест превращается в самооправдание. MDE выбирают до старта. Вторая — путать MDE с наблюдаемым эффектом: MDE это планка, которую вы назначили заранее, а не та разница, что реально показали варианты по итогу открутки. Увидеть в отчёте «+7%» и решить, что это и был MDE, — концептуальная ошибка. Третья — ставить нереалистично маленький MDE «на всякий случай»: желание ловить прирост в доли процента оборачивается требованием в сотни тысяч показов на вариант, которых в рекламной кампании не набрать за разумный срок. Тест либо не доживает до нужной выборки, либо его останавливают раньше и делают вывод по недобранным данным. Лечится это привязкой MDE к практической значимости — к минимальному приросту, который реально окупит смену креатива.

MDE в A/B-тестах креативов и в Romi+

Romi+ умеет сравнивать креативы в A/B-тесте и считать статистику по результату. MDE здесь — фильтр здравого смысла на входе: он подсказывает, набрал ли тест достаточно данных, чтобы вывод «этот креатив лучше» вообще был обоснован, или разница пока в пределах шума. Сам сервис считает окупаемость и конверсию по каждому объявлению из вашей выгрузки из рекламного кабинета или MMP, а по A/B-паре показывает, значима ли разница, — чтобы вы не масштабировали «победителя», выигравшего случайно на паре сотен показов. Прикинуть MDE и нужную выборку до запуска удобно в бесплатном калькуляторе A/B-теста: задаёте базовую конверсию, желаемый эффект, мощность и α — и видите, сколько кликов набрать на вариант. Так решение принимается по деньгам и по данным. Серверы Romi+ находятся в РФ, работа с данными — в рамках 152-ФЗ.

Размер выборки, MDE, значимость и мощность: кто за что отвечает

ПонятиеЧто этоКогда задаётсяТипичное значение
MDEминимальный эффект, который тест способен уловитьдо запускапод задачу, например +0,5 п.п.
Уровень значимости αдопустимый риск ложного «различие есть»до запуска0,05
Мощность (1−β)вероятность заметить эффект, если он естьдо запуска0,8
Размер выборки nсколько наблюдений нужно каждой группевычисляется из трёх параметров вышеиз калькулятора A/B-теста
p-valueмера того, насколько наблюдаемое различие похоже на случайностьпосле тестасравнивается с α: p < 0,05 → значимо

A/B-тесты креативов — в Romi+

Romi+ прогоняет A/B-тесты объявлений и считает статистику за вас: сравнивает креативы, показывает, значимо ли различие, и выносит вердикт по каждому. Первый разбор бесплатно.

Частые вопросы

Что такое MDE простыми словами?

MDE (минимальный обнаружимый эффект) — самая маленькая разница между вариантами, которую A/B-тест реально способен заметить на вашей выборке при выбранной мощности и уровне значимости. Если настоящий эффект меньше MDE, тест его, скорее всего, не различит и покажет ничью, хотя разница есть.

По какой формуле рассчитывается MDE?

Для сравнения двух конверсий используют нормальную аппроксимацию: MDE ≈ (z₁₋α/2 + z₁₋β) · √(2·p·(1−p) / n), где p — базовая конверсия, n — размер выборки на вариант, а множитель (z₁₋α/2 + z₁₋β) при α = 0,05 и мощности 80% равен ≈ 2,8. MDE обратно пропорционален √n: чтобы поймать вдвое меньший эффект, нужна вчетверо большая выборка. Вручную это обычно не считают — задают базовую конверсию, желаемый эффект, мощность и α в калькуляторе A/B-теста, и он возвращает нужную выборку.

Чем абсолютный MDE отличается от относительного?

Абсолютный MDE — это разница в единицах метрики, например +0,5 процентного пункта конверсии. Относительный — та же разница в процентах от базы: +0,5 п.п. при базе 3% это +16,7% относительно. Формулировка «прирост 5%» без уточнения двусмысленна, поэтому всегда проговаривайте, о пунктах речь или о процентах от базы — от этого зависит нужная выборка.

Как MDE связан с размером выборки и мощностью?

Все три величины взаимозависимы. Зафиксировав мощность (обычно 80%), α (0,05) и базовую конверсию, вы получаете жёсткую связь MDE и выборки: чем больше выборка, тем меньший эффект тест различит. Поэтому MDE задают заранее и от него считают, сколько трафика набрать на каждый вариант.

Чем MDE отличается от статистической значимости?

MDE задают до теста — это планка чувствительности, какую разницу вы рассчитываете различить. Значимость проверяют после — не случайна ли наблюдаемая разница. Одно про план эксперимента, другое про трактовку результата; вместе они не дают принять шум за победу.

Какой MDE выбрать для A/B-теста креативов?

Универсального числа нет — MDE задают от практической значимости: какой минимальный прирост окупит смену креатива, тот и ловят. По конверсии часто целятся в относительный прирост 5–20%; меньшие эффекты требуют выборки, которую в рекламе редко удаётся набрать за разумный срок.

Что будет, если задать слишком маленький MDE или не задать его вовсе?

Слишком маленький MDE требует огромной выборки — тест не доживает до неё или его останавливают на недобранных данных. Если MDE не задать заранее, есть риск получить «ничью» и принять её за равенство вариантов, хотя эффект просто оказался меньше порога различения. Расчёт MDE и нужной выборки до запуска защищает от обоих сценариев.

Смежные метрики

Мы используем cookie для работы сайта, аналитики (Яндекс.Метрика) и улучшения сервиса. Подробнее — в Политике cookie и Политике обработки ПД.