Понятие A/B-тестов · Словарь Romi+

Статистическая значимость: что это и как её проверяют

Статистическая значимость — это признак того, что различие между двумя вариантами (например, конверсией креатива A и B) вряд ли возникло случайно. Результат считают статистически значимым, если p-value меньше заранее выбранного уровня значимости α (обычно 0,05).

Статзначимость, статистическая значимость, уровень статистической значимости, проверка статистической значимости; Statistical significance, significance level

Обновлено:

Формула
Результат статистически значим, если p-value < α (уровень значимости, обычно 0,05). α — допустимая вероятность ошибки I рода: принять случайное различие за реальное. Это критерий проверки, а не арифметическая формула.
p-value
— вероятность получить наблюдаемое (или ещё большее) различие, ЕСЛИ на самом деле разницы между вариантами нет. Это НЕ вероятность того, что гипотеза верна, и НЕ «вероятность, что данные случайны»
α
— уровень значимости — порог, выбранный до теста. Максимум ошибки I рода, который вы готовы допустить. Чаще всего 0,05 (5%)
ошибка I рода
— ложноположительный вывод: посчитать различие реальным, когда его нет. Её вероятность и ограничивает α
H₀ (нулевая гипотеза)
— предположение, что различия между вариантами нет. Значимый результат даёт основание её отклонить
Пример расчёта

A/B-тест двух рекламных креативов на одну аудиторию. Вариант A: 100 конверсий на 5 000 показов посадочной (CR 2,0%). Вариант B: 145 конверсий на те же 5 000 (CR 2,9%). Порог α = 0,05 зафиксирован до запуска.

Проверка различия двух долей (двусторонний z-критерий) даёт p-value ≈ 0,004. Сравниваем с порогом: 0,004 < 0,05 → критерий выполнен, нулевую гипотезу «разницы нет» отклоняем.

Различие статистически значимо: разрыв в конверсии вряд ли объясняется случайностью выборки, вариант B действительно конвертит лучше. Здесь эффект (0,9 п.п.) ещё и практически заметен — но значимость сама по себе этого не гарантирует. На больших объёмах значимой становится и разница в 0,05 п.п., которой на практике можно пренебречь. Поэтому вывод всегда читают в паре: значимо ли различие и достаточно ли оно велико, чтобы что-то менять.

Ориентиры

Стандартный порог α = 0,05 (5%) — это соглашение, а не закон природы. Там, где цена ошибки выше, берут α = 0,01 (1%); в ранних поисковых экспериментах, где допустимо больше ложных срабатываний, иногда 0,1 (10%). Выбор зависит от того, чем вы рискуете: 0,05 означает, что примерно в 1 случае из 20 вы рискуете принять случайное различие за реальное. Порог фиксируют ДО теста, а не подгоняют под полученный p-value. Две поправки к «норме»: если вы гоняете сразу много креативов, ложные срабатывания накапливаются, и порог на каждое сравнение имеет смысл ужесточать (поправка на множественные сравнения); и помните, что значимость зависит от объёма выборки — на маленьких данных даже крупный реальный эффект может не дотянуть до значимости, а на огромных значимой окажется любая мелочь.

Зачем нужна статистическая значимость

Когда вы сравниваете два креатива или две посадочные, разница в конверсии есть почти всегда — вопрос в том, реальна она или это шум выборки. Одна неделя, другой день недели, случайный набор пользователей — и цифры уже разошлись сами по себе. Статистическая значимость — это способ отделить настоящее различие от случайного колебания. Если результат значим (p-value < α), у различия есть основания: оно вряд ли возникло по воле случая, и на него можно опираться при решении. Если не значим — данных пока недостаточно, чтобы утверждать, что варианты вообще отличаются, и масштабировать «победителя» рано. Без этой проверки легко принять удачную неделю за победу креатива и слить бюджет на решение, построенное на шуме.

Как проверяют значимость на практике

Схема одна для большинства A/B-тестов. Сначала формулируют нулевую гипотезу H₀ — «различий между вариантами нет». До запуска выбирают уровень значимости α (обычно 0,05). Затем набирают данные и статистическим критерием (для сравнения конверсий — z-критерий для долей, для средних чеков — t-критерий) считают p-value. Если p-value < α, нулевую гипотезу отклоняют: различие признают статистически значимым. Если p-value ≥ α — оснований отклонять H₀ нет, вывод откладывают до накопления данных. Важная развилка на старте — сторонность теста. Двусторонний тест проверяет «варианты просто различаются» (B может оказаться и лучше, и хуже) и используется по умолчанию. Односторонний проверяет только одно направление («B не хуже A») и даёт значимость легче, но применим, лишь когда обратный исход вам действительно неинтересен; выбирать сторонность нужно до теста, а не после того, как увидели, куда качнулись цифры.

Что p-value НЕ означает

Здесь чаще всего ошибаются. p-value = 0,03 — это НЕ «вероятность 97%, что B лучше A» и НЕ «вероятность того, что ваша гипотеза верна». Это и НЕ «вероятность того, что различие случайно»: p-value вообще не про вероятность гипотезы или причины, оно про данные. Строго: p-value = 0,03 означает, что ЕСЛИ реальной разницы между A и B нет, то различие такого размера или больше встречалось бы примерно в 3 случаях из 100 просто из-за случайности выборки. Всё, что p-value умеет, — сказать, насколько наблюдаемая картина совместима с допущением «разницы нет». Оно не переворачивается в вероятность того, что B победил, и не измеряет, насколько B лучше. Поэтому маленький p-value — это довод «различие похоже на настоящее», но не мера его величины и не гарантия правоты.

Значимость — не размер эффекта, не MDE и не мощность

Три разграничения, которые экономят деньги. Первое: статистически значимо ≠ практически важно. Значимость говорит только «различие не случайно», но не «различие большое». На большой выборке значимым станет разрыв в конверсии в сотые доли процента, который не окупит ни одного изменения, — поэтому рядом со значимостью всегда смотрят величину эффекта и его окупаемость. Второе: значимость — это не MDE и не мощность. MDE (минимальный детектируемый эффект) и мощность отвечают на вопрос «какой размер выборки нужен, чтобы вообще уловить эффект заданного размера» (а нужный объём зависит ещё и от базовой конверсии), и планируются ДО теста; значимость — проверка результата ПОСЛЕ. Третье, самое дорогое на практике: подглядывание и множественные сравнения. Если останавливать тест в первый момент, когда p-value случайно провалился ниже 0,05, фактическая ошибка I рода раздувается в разы — «когда стало значимо» это не финиш, а совпадение. Тот же эффект даёт перебор десятка креативов: чем больше сравнений, тем выше шанс, что хоть одно «выстрелит» случайно. Лечится это фиксацией объёма выборки заранее и поправкой порога на число сравнений.

Как значимость считается в Romi+

При сравнении креативов в A/B-тесте Romi+ сам считает статистическую значимость различия и показывает, набрано ли достаточно данных, чтобы вообще делать вывод, — чтобы вы не останавливали тест на случайном всплеске. Если хочется прикинуть расклад вручную, есть бесплатный калькулятор A/B-теста (/calculators/ab-test): подставляете конверсии двух вариантов и видите p-value и вердикт о значимости. При этом значимость не подаётся в отрыве от денег: решение по креативу — масштабировать, оптимизировать, оставить или отключить — опирается и на статистику, и на экономику, а не только на факт «p-value провалился ниже 0,05». Так вывод принимается по совокупности: и различие не случайно, и оно достаточно велико, чтобы окупиться.

Размер выборки, MDE, значимость и мощность: кто за что отвечает

ПонятиеЧто этоКогда задаётсяТипичное значение
MDEминимальный эффект, который тест способен уловитьдо запускапод задачу, например +0,5 п.п.
Уровень значимости αдопустимый риск ложного «различие есть»до запуска0,05
Мощность (1−β)вероятность заметить эффект, если он естьдо запуска0,8
Размер выборки nсколько наблюдений нужно каждой группевычисляется из трёх параметров вышеиз калькулятора A/B-теста
p-valueмера того, насколько наблюдаемое различие похоже на случайностьпосле тестасравнивается с α: p < 0,05 → значимо

A/B-тесты креативов — в Romi+

Romi+ прогоняет A/B-тесты объявлений и считает статистику за вас: сравнивает креативы, показывает, значимо ли различие, и выносит вердикт по каждому. Первый разбор бесплатно.

Частые вопросы

Что такое статистическая значимость простыми словами?

Это признак того, что различие между двумя вариантами — например, конверсией двух креативов — скорее всего не случайно. Формально результат значим, если p-value меньше выбранного порога α (обычно 0,05). Простыми словами: разница достаточно устойчива, чтобы не списывать её на удачную выборку, и на неё можно опираться при решении.

Какой уровень статистической значимости считается нормальным?

Чаще всего берут α = 0,05: это значит, что вы допускаете примерно 1 ложный вывод из 20. Это соглашение, а не жёсткое правило. Где ошибка дороже — используют 0,01, в ранних поисковых экспериментах иногда 0,1. Главное — выбрать порог до теста и не менять его задним числом под полученный результат.

p-value 0,03 — это вероятность, что вариант B лучше?

Нет, это частая ошибка. p-value = 0,03 означает: если бы реальной разницы между A и B не было, различие такого размера или больше встречалось бы примерно в 3% случаев из-за случайности выборки. Это НЕ «вероятность 97%, что B лучше», не вероятность того, что ваша гипотеза верна, и даже не «вероятность, что различие случайно». p-value описывает данные при допущении «разницы нет», а не саму гипотезу.

Одно- или двусторонний тест выбрать для A/B?

По умолчанию — двусторонний: он проверяет, что варианты просто различаются, и не подыгрывает вам, если B неожиданно окажется хуже. Односторонний проверяет только одно направление («B не хуже A») и даёт значимость легче, но оправдан, лишь когда обратный исход вам по-настоящему безразличен. Сторонность выбирают до теста; переключиться на односторонний после того, как увидели цифры, — это скрытое раздувание ошибки I рода.

Можно ли остановить тест, как только результат стал значимым?

Нет, это подглядывание, и оно ломает проверку. Если следить за p-value каждый день и останавливаться в первый момент, когда он провалился ниже 0,05, фактическая доля ложных выводов оказывается заметно выше заявленных 5%: рано или поздно случайный всплеск даст «значимость». Объём выборки честнее планировать заранее и подводить итог, когда он набран. Тот же риск даёт перебор многих креативов — тогда порог стоит ужесточать на число сравнений.

Чем статистическая значимость отличается от MDE и мощности теста?

MDE (минимальный детектируемый эффект) и мощность планируют ДО теста: они отвечают, какой объём выборки нужен, чтобы уловить эффект заданного размера. Статистическая значимость — это проверка уже собранных данных ПОСЛЕ: случайно различие или нет. Мощность про то, «сможем ли мы заметить эффект»; значимость про то, «заметили ли и не шум ли это». И ни то, ни другое не говорит о размере эффекта — его смотрят отдельно.

Смежные метрики

Мы используем cookie для работы сайта, аналитики (Яндекс.Метрика) и улучшения сервиса. Подробнее — в Политике cookie и Политике обработки ПД.