MDE — минимальный обнаружимый эффект в A/B-тесте
MDE — это наименьшая разница между вариантами, которую A/B-тест способен надёжно заметить при вашей выборке, выбранной мощности и уровне значимости. Если реальный эффект меньше MDE, тест его, скорее всего, «не увидит» и покажет ничью, даже когда разница на самом деле есть.
Minimum Detectable Effect; минимальный детектируемый эффект; иногда «чувствительность теста». Не путать с фактическим размером эффекта — той разницей, которую тест показал по итогу открутки.
Обновлено:
- MDE
- — минимальный обнаружимый эффект — порог чувствительности теста; разницу меньше этой тест надёжно не отличит от нуля. Задают до запуска, а не измеряют по итогу
- z₁₋α/2, z₁₋β
- — квантили стандартного нормального распределения для уровня значимости и мощности; при α = 0,05 и мощности 80% это ≈ 1,96 и 0,84 (в сумме ≈ 2,8)
- p
- — базовая конверсия контроля, от которой отсчитывается эффект; влияет на то, какая выборка нужна под заданный MDE
- n
- — размер выборки на каждый вариант — сколько наблюдений (показов, кликов, конверсий) набрал. Главный рычаг: больше выборка — меньше MDE
- мощность (1−β)
- — вероятность заметить эффект, если он действительно есть; типовое значение 80%. Чем выше мощность, тем больше нужна выборка под тот же MDE
- уровень значимости (α)
- — допустимая вероятность ложного срабатывания — увидеть различие там, где его нет; обычно 0,05 (5%). Строже α — больше требуемая выборка
A/B-тест двух баннеров. Базовая конверсия контроля из клика в заявку — 3%. Вы хотите поймать относительный прирост в 10% (то есть с 3% до 3,3%, абсолютно это +0,3 процентного пункта).
Такой относительно тонкий эффект при мощности 80% и α = 0,05 требует крупной выборки — по порядку величины это десятки тысяч кликов на каждый вариант; точное число даёт калькулятор размера выборки. Наберёте заметно меньше — MDE теста вырастет, и различить он сможет только более грубые сдвиги; прирост в +0,3 п.п. утонет в шуме и даст «ничью». Захотите ловить не 10%, а 5% относительно (вдвое меньший эффект) — требуемая выборка вырастет примерно вчетверо, а не вдвое.
Вывод здесь не арифметический, а про связь трёх величин: MDE, выборка и мощность тянут друг друга. Хотите различать мелкие эффекты — нужна большая выборка; трафик ограничен — тест увидит только крупные различия. Поэтому MDE прикидывают заранее: он подсказывает, сколько кликов нужно набрать, чтобы результат A/B-теста вообще был осмысленным.
Ориентиры
Единого «правильного» MDE нет — его задают под задачу, а не берут из таблицы. На практике по конверсии часто целятся в относительный прирост порядка 5–20%: меньшие эффекты требуют выборки, которую в рекламе редко удаётся набрать за разумный срок. Ключевые оговорки: чем ниже базовая конверсия и чем меньше трафика, тем крупнее эффект вы вообще сможете различить; чем выше желаемая мощность (90% вместо 80%) и строже α, тем больше выборка под тот же MDE. Разумный ориентир — задавать MDE от практической значимости: какой минимальный прирост окупит смену креатива, тот и есть смысл ловить, а не гнаться за различением любых микроразниц.
Зачем нужен MDE и что он показывает
MDE отвечает на вопрос «какую разницу этот тест вообще способен заметить». Это не результат эксперимента, а его настройка — планка чувствительности, которую задают до запуска. У любого A/B-теста есть предел разрешения: на малой выборке видны только грубые различия, тонкие тонут в случайном шуме. Если не задать MDE заранее, легко попасть в ловушку — открутить тест, получить «ничью» и решить, что креативы равны. А на самом деле эффект мог быть, просто теста не хватило, чтобы его различить: он был меньше MDE. Поэтому MDE — честный способ заранее сказать, что вы рассчитываете поймать, а что для этого объёма трафика заведомо недостижимо.
Абсолютный и относительный MDE — не путайте единицы
MDE можно выразить двумя способами, и их постоянно смешивают. Абсолютный MDE — разница в тех же единицах, что и метрика: с конверсии 3% до 3,5% это +0,5 процентного пункта. Относительный MDE — та же разница в процентах от базы: те же +0,5 п.п. при базе 3% это уже +16,7% относительно. Одна и та же формулировка «прирост на 5%» означает совершенно разную выборку в зависимости от трактовки: 5% относительно базы 3% — это всего +0,15 п.п., крошечный эффект, под который нужна огромная выборка. Правило простое: всегда проговаривайте, о чём речь — о пунктах или о процентах от базы, — иначе расчёт нужного трафика уедет в разы. В отчётах по рекламе чаще удобнее относительный MDE: «на сколько процентов вырастет конверсия», — но считать выборку нужно от того же определения, в котором задали цель.
Как MDE связан с мощностью, выборкой и значимостью
MDE не живёт сам по себе — он завязан на четыре величины, и все они взаимозависимы. Уровень значимости α (обычно 0,05) — риск увидеть различие там, где его нет. Мощность 1−β (обычно 80%) — вероятность заметить эффект, если он реально есть. Размер выборки — сколько наблюдений набрал каждый вариант. Базовая конверсия — от неё отсчитывается эффект. Зафиксируйте α, мощность и базу — и MDE полностью определяется выборкой: чем больше данных, тем меньший эффект тест различит. Обратно тоже верно: задайте желаемый MDE — и выборка вычислится однозначно. Отсюда практический расчёт до запуска: берут базовую конверсию, целевой MDE, мощность и α — и получают, сколько трафика нужно на каждый вариант. Захотите ловить эффект вдвое меньше — выборка вырастет примерно вчетверо, а не вдвое. А статзначимость и MDE — две стороны одной монеты: значимость говорит, отличается ли результат от нуля постфактум, MDE — какую разницу вы в принципе рассчитывали различить.
Три частые ошибки с MDE
Первая — задавать MDE постфактум, «подгоняя» под уже полученный результат: так теряется весь смысл планирования, а тест превращается в самооправдание. MDE выбирают до старта. Вторая — путать MDE с наблюдаемым эффектом: MDE это планка, которую вы назначили заранее, а не та разница, что реально показали варианты по итогу открутки. Увидеть в отчёте «+7%» и решить, что это и был MDE, — концептуальная ошибка. Третья — ставить нереалистично маленький MDE «на всякий случай»: желание ловить прирост в доли процента оборачивается требованием в сотни тысяч показов на вариант, которых в рекламной кампании не набрать за разумный срок. Тест либо не доживает до нужной выборки, либо его останавливают раньше и делают вывод по недобранным данным. Лечится это привязкой MDE к практической значимости — к минимальному приросту, который реально окупит смену креатива.
MDE в A/B-тестах креативов и в Romi+
Romi+ умеет сравнивать креативы в A/B-тесте и считать статистику по результату. MDE здесь — фильтр здравого смысла на входе: он подсказывает, набрал ли тест достаточно данных, чтобы вывод «этот креатив лучше» вообще был обоснован, или разница пока в пределах шума. Сам сервис считает окупаемость и конверсию по каждому объявлению из вашей выгрузки из рекламного кабинета или MMP, а по A/B-паре показывает, значима ли разница, — чтобы вы не масштабировали «победителя», выигравшего случайно на паре сотен показов. Прикинуть MDE и нужную выборку до запуска удобно в бесплатном калькуляторе A/B-теста: задаёте базовую конверсию, желаемый эффект, мощность и α — и видите, сколько кликов набрать на вариант. Так решение принимается по деньгам и по данным. Серверы Romi+ находятся в РФ, работа с данными — в рамках 152-ФЗ.
Размер выборки, MDE, значимость и мощность: кто за что отвечает
| Понятие | Что это | Когда задаётся | Типичное значение |
|---|---|---|---|
| MDE | минимальный эффект, который тест способен уловить | до запуска | под задачу, например +0,5 п.п. |
| Уровень значимости α | допустимый риск ложного «различие есть» | до запуска | 0,05 |
| Мощность (1−β) | вероятность заметить эффект, если он есть | до запуска | 0,8 |
| Размер выборки n | сколько наблюдений нужно каждой группе | вычисляется из трёх параметров выше | из калькулятора A/B-теста |
| p-value | мера того, насколько наблюдаемое различие похоже на случайность | после теста | сравнивается с α: p < 0,05 → значимо |
A/B-тесты креативов — в Romi+
Romi+ прогоняет A/B-тесты объявлений и считает статистику за вас: сравнивает креативы, показывает, значимо ли различие, и выносит вердикт по каждому. Первый разбор бесплатно.
Частые вопросы
Что такое MDE простыми словами?
MDE (минимальный обнаружимый эффект) — самая маленькая разница между вариантами, которую A/B-тест реально способен заметить на вашей выборке при выбранной мощности и уровне значимости. Если настоящий эффект меньше MDE, тест его, скорее всего, не различит и покажет ничью, хотя разница есть.
По какой формуле рассчитывается MDE?
Для сравнения двух конверсий используют нормальную аппроксимацию: MDE ≈ (z₁₋α/2 + z₁₋β) · √(2·p·(1−p) / n), где p — базовая конверсия, n — размер выборки на вариант, а множитель (z₁₋α/2 + z₁₋β) при α = 0,05 и мощности 80% равен ≈ 2,8. MDE обратно пропорционален √n: чтобы поймать вдвое меньший эффект, нужна вчетверо большая выборка. Вручную это обычно не считают — задают базовую конверсию, желаемый эффект, мощность и α в калькуляторе A/B-теста, и он возвращает нужную выборку.
Чем абсолютный MDE отличается от относительного?
Абсолютный MDE — это разница в единицах метрики, например +0,5 процентного пункта конверсии. Относительный — та же разница в процентах от базы: +0,5 п.п. при базе 3% это +16,7% относительно. Формулировка «прирост 5%» без уточнения двусмысленна, поэтому всегда проговаривайте, о пунктах речь или о процентах от базы — от этого зависит нужная выборка.
Как MDE связан с размером выборки и мощностью?
Все три величины взаимозависимы. Зафиксировав мощность (обычно 80%), α (0,05) и базовую конверсию, вы получаете жёсткую связь MDE и выборки: чем больше выборка, тем меньший эффект тест различит. Поэтому MDE задают заранее и от него считают, сколько трафика набрать на каждый вариант.
Чем MDE отличается от статистической значимости?
MDE задают до теста — это планка чувствительности, какую разницу вы рассчитываете различить. Значимость проверяют после — не случайна ли наблюдаемая разница. Одно про план эксперимента, другое про трактовку результата; вместе они не дают принять шум за победу.
Какой MDE выбрать для A/B-теста креативов?
Универсального числа нет — MDE задают от практической значимости: какой минимальный прирост окупит смену креатива, тот и ловят. По конверсии часто целятся в относительный прирост 5–20%; меньшие эффекты требуют выборки, которую в рекламе редко удаётся набрать за разумный срок.
Что будет, если задать слишком маленький MDE или не задать его вовсе?
Слишком маленький MDE требует огромной выборки — тест не доживает до неё или его останавливают на недобранных данных. Если MDE не задать заранее, есть риск получить «ничью» и принять её за равенство вариантов, хотя эффект просто оказался меньше порога различения. Расчёт MDE и нужной выборки до запуска защищает от обоих сценариев.