Перейти до змісту
Увійти

Калькулятор статистичної значущості

Перевірте, чи різниця між двома групами більша за випадкову, і подивіться, що насправді означає p-значення (p-value).

Аналізуєте A/B-експеримент? Калькулятор результатів A/B-тесту зосереджений на прирості та інтервалі.

Хочете крок за кроком зрозуміти, що таке p-значення? Безкоштовний урок будує його з нуля. Вивчити p-значення і значущість

Ваші дві групи

Усього: люди, листи чи відвідувачі в групі. Успіхи: конверсії, кліки чи відповіді «так». Кожну людину рахуйте один раз.

Група A

Частка: 4%

Група B

Частка: 5,5%

Тест

Оберіть до того, як подивитеся на числа. Якщо перейти на однобічний тест, побачивши результат, p-значення зменшиться вдвічі, а хибних перемог стане вдвічі більше.

Додаткові налаштування
Рівень значущості α

Зазвичай обирають 5%. Оберіть його до того, як подивитеся на дані.

Що вводити в ці поля
Усього
Усі в групі, з ким міг статися результат: люди, надіслані листи чи відвідувачі, а не перегляди сторінок. Ціле число від 1 до 1 000 000 000.
Успіхи
Скільки з них мали результат, який ви рахуєте: конверсію, клік, відповідь «так». Кожну людину рахуйте один раз. Ціле число від 0 до загальної кількості.
Тест
Двобічний тест перевіряє, чи B відрізняється від A в будь-який бік, і є безпечним вибором за замовчуванням. Однобічний перевіряє лише, чи B вищий (або лише, чи нижчий). Обирайте його, тільки якщо вирішили це заздалегідь і діяли б однаково за «різниці немає» і за різниці в інший бік.

Результат

Введіть дані обох груп і натисніть «Перевірити значущість». Приклад у формі вже готовий.

Як читати результат

Висновок порівнює p-значення з обраним рівнем значущості. Якщо p менше, різницю називають статистично значущою: такий розрив був би незвичним, якби обидві групи насправді мали однакову частку.

Речення під висновком пояснює, що вимірює p-значення, на ваших власних числах, а рисунок це показує: заштриховані хвости — результати, які вважалися б значущими, зафарбована площа — яка частина кривої лежить на вашому результаті або далі.

Потім подивіться на розмір різниці та її інтервал у подробицях. Крихітна різниця може бути значущою, якщо даних багато, а велика — не досягти значущості на малій вибірці. Значущість каже, чи можна довіряти напрямку, а не чи важлива різниця.

Що означає статистична значущість

Група A конвертувала 120 з 3000 (4,0%), група B — 165 з 3000 (5,5%). Навіть якби обидві групи мали однакову справжню частку, дві вибірки рідко виходять точно рівними, тож питання в тому, чи розрив у 1,5 пункта — звичайний шум.

Калькулятор вимірює розрив в одиницях очікуваного шуму: z = 2,73, майже втричі більше за типовий випадковий розрив для вибірок такого розміру. Розрив такий самий або більший у будь-який бік траплявся б випадково лише приблизно в 0,63% таких порівнянь (p = 0,0063).

Оскільки 0,0063 менше за рівень 5%, різниця статистично значуща. Це твердження про шум, а не про причини: якщо групи відрізняються більш ніж одним, дані не скажуть, яка з цих відмінностей дала розрив.

Однобічний чи двобічний?

Візьмімо A — 120 з 3000 і B — 150 з 3000. Двобічний тест дає p = 0,062: не значуще на рівні 5%. Однобічний тест «чи B вищий?» на тих самих числах дає p = 0,031: значуще. Ті самі дані, протилежні висновки; різниця лише в запитанні.

Тому тест треба обрати до того, як подивитеся на дані. Якщо обрати бік, побачивши, яка група попереду, p-значення задарма зменшиться вдвічі, а шанс хибної перемоги приблизно подвоїться. У підручниках ці варіанти ще називають одностороннім і двостороннім критерієм.

Однобічний тест виправданий, коли ви обрали його заздалегідь і діяли б однаково за «різниці немає» і за «B гірший», наприклад коли B — дешевша версія, яку ви запустите, якщо вона не явно краща. Якщо сумніваєтеся, обирайте двобічний.

Метод і формули

Калькулятор використовує z-тест для двох часток з об'єднаною оцінкою — той самий механізм, що й калькулятор результатів A/B-тесту, тож для однакових кількостей двобічні результати обох інструментів збігаються. xA і xB — успіхи, nA і nB — загальні кількості:

pA = xA / nA,  pB = xB / nB,  d = pB − pA
pPool = (xA + xB) / (nA + nB)
SE0 = √(pPool (1 − pPool) (1/nA + 1/nB)),  z = d / SE0
two-sided:        p = P(|Z| ≥ |z|)
one-sided higher: p = P(Z ≥ z)
one-sided lower:  p = P(Z ≤ z)
significant = p < α

Двобічний інтервал — гібридний інтервал Ньюкомба для B − A з рівнем 1 − α. Однобічний тест показує одну межу з рівнем 1 − α: нижній кінець (для «B вищий») або верхній (для «B нижчий») інтервалу Ньюкомба з рівнем 1 − 2α.

Кожна група має містити щонайменше 10 успіхів і 10 неуспіхів. Нижче цього нормальне наближення ненадійне, тому калькулятор показує частки без p-значення, а не переходить мовчки на інший тест.

Запитання і відповіді

Що означає p = 0,03 простими словами (p-value)?
Якби між групами справді не було різниці, результати, розведені щонайменше так само, як ваші, траплялися б приблизно в 3% таких досліджень лише випадково. Це не 3% шансу, що різниці немає, і не 97% шансу, що B кращий.
Чи 5% — правильний рівень значущості? Коли брати 1% або 10%?
5% — домовленість, а не закон. Беріть 1%, коли хибна перемога дорого коштує, наприклад для зміни, яку важко скасувати. Беріть 10% для дешевих рішень, які легко відкотити, де пропустити справжній ефект дорожче. Обирайте рівень до тесту і не змінюйте його, побачивши p-значення.
Однобічний чи двобічний: що обрати?
Двобічний, якщо тільки до збору даних ви не вирішили, що важливий лише один напрямок і що «різниці немає» та «гірше» для вас означають те саме. Перехід на однобічний тест після того, як ви побачили числа, перетворює p = 0,06 на 0,03 без жодних нових доказів.
Результат значущий. Чи означає це, що різниця велика або вартує дій?
Ні. Значущість означає, що різниця навряд чи є чистим шумом. На великій вибірці розрив у 0,1 відсоткового пункта може бути значущим і водночас не вартим зусиль. Дивіться на саму різницю, її інтервал і на те, скільки вона важить для бізнесу.
Результат не значущий. Отже, групи однакові?
Не обов'язково. Можливо, даних просто замало, щоб відрізнити справжню різницю такого розміру від шуму. Інтервал показує, які різниці ще правдоподібні; якщо в ньому є різниці, важливі для вас, зберіть більше даних, перш ніж робити висновки.
Чи можна порівняти два сегменти клієнтів, а не експеримент?
Так, щоб з'ясувати, чи розрив між ними більший за шум. Ні, щоб з'ясувати чому: сегменти відрізняються багатьма речами одночасно, тож значущий розрив між, скажімо, користувачами мобільних і десктопу не доводить, що причина в пристрої.
Чи можна перевіряти числа щодня, доки вони не стануть значущими?
Ні. Кожна перевірка — ще один шанс для шуму перетнути межу, тож зупинка в перший значущий день робить хибні перемоги значно ймовірнішими за обраний рівень. Визначте розмір вибірки і момент перевірки заздалегідь; стаття про підглядання нижче пояснює чому.
Чому калькулятор не працює з дуже малими кількостями?
Z-тест спирається на наближення, яке не працює, коли в групі менше приблизно 10 успіхів або 10 неуспіхів. Замість p-значення, яке могло б сильно помилятися, калькулятор показує лише частки. Зберіть більше даних або скористайтеся точним тестом у статистичному пакеті.

Дізнатися більше

Плануєте наступне порівняння?

Щоб спланувати, скільки людей потрібно, щоб справжня різниця виявилася значущою, скористайтеся калькулятором розміру вибірки для A/B-тесту.

Порівнюєте відповіді в опитуванні? Кількість відповідей спланує калькулятор вибірки для опитування.

Терміни на цій сторінці