Калькулятор A/B-тестов

Сравните две конверсии с помощью z-теста двух долей, p-значения и относительного прироста.

Значимость A/B-теста
Введите число посетителей и конверсий для контрольного и тестового вариантов.
Вариант A (контроль)
Вариант B (тест)

О значимости A/B-тестов

A/B-тест случайным образом распределяет сопоставимых посетителей между контрольным и альтернативным вариантами, затем измеряет заранее выбранный результат: покупку, регистрацию, клик или выполнение задачи. Этот калькулятор сравнивает две бинарные конверсии с помощью z-теста двух долей с объединённой оценкой доли. Он показывает обе конверсии, относительный прирост, z-оценку, двустороннее p-значение и достижение общепринятого порога значимости 0.05. Конверсия каждого варианта равна числу конверсий, делённому на число посетителей. При нулевой гипотезе о равенстве истинных долей калькулятор объединяет конверсии обеих выборок. По объединённой доле он оценивает стандартную ошибку разности, затем делит наблюдаемую разность долей на эту ошибку и получает z-оценку. Двустороннее p-значение показывает, насколько необычной была бы разница не меньше наблюдаемой, если бы нулевая гипотеза была верна. p-значение ниже 0.05 обычно называют статистически значимым при доверительном уровне девяносто пять процентов. Это не означает такую вероятность превосходства тестового варианта и не измеряет ценность изменения для бизнеса. Относительный прирост сопоставляет разницу долей с контрольной долей, а абсолютный прирост — просто конверсия B минус конверсия A. Небольшой, но статистически надёжный рост может быть ценным в большом масштабе, а большой наблюдаемый рост может оставаться неопределённым при малых выборках. Корректные выводы зависят от дизайна эксперимента. Распределяйте пользователей случайно, сохраняйте назначенный вариант, не учитывайте одну независимую единицу несколько раз, выбирайте основную метрику до просмотра результатов и проводите эксперимент достаточно долго, чтобы охватить обычные циклы. Остановка при первом появлении значимости повышает риск ложноположительных выводов. Несколько метрик, повторные просмотры и многочисленные сравнения вариантов также требуют скорректированного анализа или заранее запланированного последовательного метода. Нормальное приближение лучше работает, когда в каждом варианте достаточно ожидаемых конверсий и отсутствий конверсии. При очень редких исходах может понадобиться точный критерий Фишера или другой точный метод. Статистическая значимость также не защищает от ошибок измерения, эффекта новизны, несоответствия долей выборки, трафика ботов или изменений во время теста. Перед внедрением используйте результат вместе с доверительными интервалами, защитными метриками, порогами практически значимого эффекта и проверкой качества эксперимента.

Примеры A/B-тестов

Посетители и конверсииКонверсии и p-значениеВывод при α = 0.05
A: 1,000/100; B: 1,000/14010.00% против 14.00%; p ≈ 0.006Значимое улучшение
A: 500/50; B: 500/5410.00% против 10.80%; p ≈ 0.676Незначимо
A: 2,000/300; B: 2,000/27015.00% против 13.50%; p ≈ 0.176Наблюдаемое снижение незначимо

Как рассчитать значимость A/B-теста

  1. Введите число назначенных посетителей и завершённых конверсий для варианта A.
  2. Введите соответствующее число посетителей и конверсий для варианта B.
  3. Нажмите «Рассчитать значимость», чтобы выполнить z-тест двух долей с объединённой оценкой.
  4. Перед решением оцените конверсии, прирост, p-значение и практическую важность.

Частые вопросы

Какое p-значение считается статистически значимым?

Часто используют порог 0.05, выбранный до эксперимента. Порог решения должен учитывать план теста, риск и поправки на множественные сравнения.

Что такое относительный прирост?

Это (конверсия B − конверсия A), делённое на конверсию A. Показатель описывает относительное изменение, и его следует рассматривать вместе с абсолютной разницей в процентных пунктах.

Доказывает ли значимость, что вариант B лучше?

Нет. Она количественно оценивает свидетельства против равенства долей при допущениях модели. Качество данных, дизайн эксперимента, доверительные интервалы и практическая ценность по-прежнему важны.

Можно ли остановить A/B-тест, как только p станет ниже 0.05?

Повторные проверки и остановка при первом значимом результате увеличивают число ложноположительных выводов. Используйте фиксированный размер выборки или корректный метод последовательного тестирования.

Когда следует отказаться от z-теста?

При очень малом числе конверсий или отсутствий конверсии нормальное приближение может быть ненадёжным. Для разреженных данных лучше подходит точный тест или специализированный анализ.