Калькулятор достоверности конверсии и статистической значимости теста

1

Оценка текущей конверсии

Вбей фактические цифры — калькулятор покажет, в каком коридоре реально лежит твоя конверсия.

Уверенность
Конверсия p = x / n
10,0%
z = 1,960
Мало данных
Меньше 30 конверсий — цифра случайна, играешь в угадайку.
95% доверительный интервал конверсии коридор, в котором лежит истинная конверсия
Уилсон рекомендуется
0%
100%
5,5% 17,4%
Вальд
0%
100%
4,1% 15,9%
2

Сколько нужно посетителей

Задай желаемую точность — калькулятор скажет, сколько посетителей нужно собрать.

Уверенность
Нужно собрать посетителей
865
z = 1,960
Ожидаемое число конверсий
87
проверка: посетители × конверсия
Если конверсию не знаешь (запас, p = 50%)
2 401
самый осторожный вариант
Чем выше уверенность и чем уже требуемая точность ±E, тем больше посетителей нужно собрать.
3

Значимость A/B-теста

Сравни варианты с контролем A — калькулятор скажет, кто реально лучше, а где разница случайна. Можно добавить до 6 вариантов.

Порог значимости
Лучший — вариант B
Значимо лучше контроля (A).
Конверсии и их 95% доверительные интервалы
Мощность

Сколько крутить тест

Сколько посетителей нужно на каждый вариант, чтобы уверенно уловить заданный прирост. Наберёшь столько, а значимой разницы нет — значит, прироста такого размера нет: тест можно останавливать.

Мощность
Нужно посетителей на каждый вариант
3 841
всего на тест ≈ 7 682
Ловим прирост +20% (10,0% → 12,0%) при значимости 95% и мощности 80%. Меньше прирост или выше мощность — нужно больше посетителей.

Как читать

z

Множитель уверенности из таблицы нормального распределения:
90% → 1,645 · 95% → 1,960 · 99% → 2,576.

Вальд

Простая формула, годится примерно от 30 конверсий. На малых данных врёт и может вылезти за 0% или 100%.

Уилсон

Уточнённая формула, работает и на малых выборках, всегда остаётся в пределах 0–100%. Ей и верь.

Правило

Смотри на число конверсий, не посетителей:
<30 — угадайка · 30–100 — осторожно · 100+ — надёжно.

Справочник — откуда берутся числа

Для пытливых: все формулы, по которым калькулятор считает значения. Разверни нужный раздел.

Обозначения
n
размер выборки — число посетителей
x
число успехов — конверсий
p
конверсия, p = x / n
γ
уровень уверенности (90%, 95%, 99%)
α
уровень значимости, α = 1 − γ (для 95% → 0,05)
z
квантиль нормального распределения для уровня уверенности
МОЭ
минимальный обнаружимый эффект (англ. MDE) — наименьший прирост конверсии, который важно уловить в A/B-тесте (раздел 3)
мощность
вероятность заметить реальную разницу заданного размера (обычно 80%); zβ — её квантиль
E
требуемая точность — полуширина интервала (раздел 2)
Φ
функция стандартного нормального распределения; Φ−1 — обратная к ней
п.п.
процентные пункты — разница двух процентов (13% − 10% = 3 п.п.); не путать с относительным приростом (+30%)
Раздел 1 — доверительный интервал конверсии
z = Φ−1( 1 + γ2 )

Множитель уверенности. 90% → 1,645 · 95% → 1,960 · 99% → 2,576.

Вальд:   p ± z · √( p(1 − p) / n )

Простое нормальное приближение. Погрешность E = z·√(p(1−p)/n). На малых выборках врёт и может вылезти за 0–100%.

Уилсон, центр = p + z2/(2n)1 + z2/n полуширина = z1 + z2/n · √( p(1 − p)/n + z2/(4n2) )

Интервал = центр ± полуширина. Всегда остаётся в пределах 0–100%, точнее Вальда на малых данных.

Оценка надёжности считается по числу успехов x (конверсий): <30 — мало данных, 30–100 — осторожно, 100+ — надёжно.

Раздел 2 — сколько нужно посетителей
n = ⌈ z2 · p(1 − p)E2

Выводится из формулы погрешности Вальда E = z·√(p(1−p)/n), решённой относительно n. Скобки ⌈ ⌉ — округление вверх.

конверсий ≈ ⌈ n · p ⌉

Сколько успехов даст эта выборка при ожидаемой конверсии p.

nмакс = ⌈ z2 · 0,25E2

Верхняя оценка, когда конверсия заранее неизвестна: p(1−p) максимально при p = 0,5 и равно 0,25.

Раздел 3 — значимость A/B-теста
pA = xA / nA   ·   pB = xB / nB разница = pB − pA (п.п.)   ·   прирост = pB − pApA
объединённая доля:   p̂ = xA + xBnA + nB z = pB − pA√( p̂(1 − p̂)(1/nA + 1/nB) )

Двухпропорционный z-тест с объединённой оценкой доли (нулевая гипотеза: конверсии равны).

p-value = 2 · ( 1 − Φ(|z|) ) достоверность = (1 − p-value) · 100%

Двусторонний тест: вероятность увидеть такую (или большую) разницу случайно, если варианты одинаковы. Значимо, если p-value < α — достоверность выше порога.

интервал разницы = (pB − pA) ± z · √( pA(1−pA)/nA + pB(1−pB)/nB )

Раздельная оценка дисперсии. Если интервал не пересекает 0 — разница реальна.

nна вариант = ( zα/2·√( 2p̄(1−p̄) ) + zβ·√( p1(1−p1) + p2(1−p2) ) )2( p2 − p1 )2

Мощность (сколько крутить тест): p1 — базовая конверсия, p2 = p1·(1 + прирост), p̄ = (p1+p2)/2, zβ — квантиль мощности (80% → 0,84; 90% → 1,28). Чем меньше прирост или выше мощность — тем больше n.

Мощность — когда останавливать A/B-тест

Значимость и мощность страхуют от двух разных ошибок:

Ошибка I рода (α)

Увидеть разницу, которой нет — ложный победитель. От неё защищает уровень значимости: 95% → α = 5%.

Ошибка II рода (β)

Прозевать реальную разницу. От неё защищает мощность (1 − β): при 80% тест поймает эффект размером с МОЭ (минимальный обнаружимый эффект) в 80% случаев.

Как решать, когда останавливать:

  1. Заранее выбери МОЭ и мощность → посчитай выборку в подразделе «Сколько крутить тест».
  2. Крути тест до этой выборки и посмотри результат один раз.
  3. Значимо → победитель настоящий.
  4. Не значимо, но выборку набрал → эффекта размером ≥ МОЭ нет: останавливай, это ничья.
  5. Выборку не набрал → рано делать выводы, продолжай.

Практический ориентир — доверительный интервал разницы (показан в блоке 3): узкий и жмётся к 0 (напр. −0,3…+0,5 п.п.) → разницы практического размера нет, стоп; широкий (напр. −2…+5 п.п.) → данных мало, продолжай.

Не подглядывай. Нельзя каждый день смотреть p-value и останавливаться в момент значимости — это резко раздувает ложные срабатывания. Решение принимается один раз, на заранее посчитанной выборке (фиксированный горизонт). «Легально подглядывать» по ходу умеют только последовательные / байесовские тесты — это другая математика.
Калькулятор достоверности конверсии и статистической значимости теста Вальд · Уилсон · z-тест @KinyokuMarketing