Калькулятор статистичної значущості
Перевірте, чи різниця між двома групами більша за випадкову, і подивіться, що насправді означає p-значення (p-value).
Аналізуєте A/B-експеримент? Калькулятор результатів A/B-тесту зосереджений на прирості та інтервалі.
Хочете крок за кроком зрозуміти, що таке p-значення? Безкоштовний урок будує його з нуля. Вивчити p-значення і значущість
Результат
Введіть дані обох груп і натисніть «Перевірити значущість». Приклад у формі вже готовий.
Як читати результат
Висновок порівнює p-значення з обраним рівнем значущості. Якщо p менше, різницю називають статистично значущою: такий розрив був би незвичним, якби обидві групи насправді мали однакову частку.
Речення під висновком пояснює, що вимірює p-значення, на ваших власних числах, а рисунок це показує: заштриховані хвости — результати, які вважалися б значущими, зафарбована площа — яка частина кривої лежить на вашому результаті або далі.
Потім подивіться на розмір різниці та її інтервал у подробицях. Крихітна різниця може бути значущою, якщо даних багато, а велика — не досягти значущості на малій вибірці. Значущість каже, чи можна довіряти напрямку, а не чи важлива різниця.
Що означає статистична значущість
Група A конвертувала 120 з 3000 (4,0%), група B — 165 з 3000 (5,5%). Навіть якби обидві групи мали однакову справжню частку, дві вибірки рідко виходять точно рівними, тож питання в тому, чи розрив у 1,5 пункта — звичайний шум.
Калькулятор вимірює розрив в одиницях очікуваного шуму: z = 2,73, майже втричі більше за типовий випадковий розрив для вибірок такого розміру. Розрив такий самий або більший у будь-який бік траплявся б випадково лише приблизно в 0,63% таких порівнянь (p = 0,0063).
Оскільки 0,0063 менше за рівень 5%, різниця статистично значуща. Це твердження про шум, а не про причини: якщо групи відрізняються більш ніж одним, дані не скажуть, яка з цих відмінностей дала розрив.
Однобічний чи двобічний?
Візьмімо A — 120 з 3000 і B — 150 з 3000. Двобічний тест дає p = 0,062: не значуще на рівні 5%. Однобічний тест «чи B вищий?» на тих самих числах дає p = 0,031: значуще. Ті самі дані, протилежні висновки; різниця лише в запитанні.
Тому тест треба обрати до того, як подивитеся на дані. Якщо обрати бік, побачивши, яка група попереду, p-значення задарма зменшиться вдвічі, а шанс хибної перемоги приблизно подвоїться. У підручниках ці варіанти ще називають одностороннім і двостороннім критерієм.
Однобічний тест виправданий, коли ви обрали його заздалегідь і діяли б однаково за «різниці немає» і за «B гірший», наприклад коли B — дешевша версія, яку ви запустите, якщо вона не явно краща. Якщо сумніваєтеся, обирайте двобічний.
Метод і формули
Калькулятор використовує z-тест для двох часток з об'єднаною оцінкою — той самий механізм, що й калькулятор результатів A/B-тесту, тож для однакових кількостей двобічні результати обох інструментів збігаються. xA і xB — успіхи, nA і nB — загальні кількості:
pA = xA / nA, pB = xB / nB, d = pB − pA
pPool = (xA + xB) / (nA + nB)
SE0 = √(pPool (1 − pPool) (1/nA + 1/nB)), z = d / SE0
two-sided: p = P(|Z| ≥ |z|)
one-sided higher: p = P(Z ≥ z)
one-sided lower: p = P(Z ≤ z)
significant = p < αДвобічний інтервал — гібридний інтервал Ньюкомба для B − A з рівнем 1 − α. Однобічний тест показує одну межу з рівнем 1 − α: нижній кінець (для «B вищий») або верхній (для «B нижчий») інтервалу Ньюкомба з рівнем 1 − 2α.
Кожна група має містити щонайменше 10 успіхів і 10 неуспіхів. Нижче цього нормальне наближення ненадійне, тому калькулятор показує частки без p-значення, а не переходить мовчки на інший тест.
Запитання і відповіді
- Що означає p = 0,03 простими словами (p-value)?
- Якби між групами справді не було різниці, результати, розведені щонайменше так само, як ваші, траплялися б приблизно в 3% таких досліджень лише випадково. Це не 3% шансу, що різниці немає, і не 97% шансу, що B кращий.
- Чи 5% — правильний рівень значущості? Коли брати 1% або 10%?
- 5% — домовленість, а не закон. Беріть 1%, коли хибна перемога дорого коштує, наприклад для зміни, яку важко скасувати. Беріть 10% для дешевих рішень, які легко відкотити, де пропустити справжній ефект дорожче. Обирайте рівень до тесту і не змінюйте його, побачивши p-значення.
- Однобічний чи двобічний: що обрати?
- Двобічний, якщо тільки до збору даних ви не вирішили, що важливий лише один напрямок і що «різниці немає» та «гірше» для вас означають те саме. Перехід на однобічний тест після того, як ви побачили числа, перетворює p = 0,06 на 0,03 без жодних нових доказів.
- Результат значущий. Чи означає це, що різниця велика або вартує дій?
- Ні. Значущість означає, що різниця навряд чи є чистим шумом. На великій вибірці розрив у 0,1 відсоткового пункта може бути значущим і водночас не вартим зусиль. Дивіться на саму різницю, її інтервал і на те, скільки вона важить для бізнесу.
- Результат не значущий. Отже, групи однакові?
- Не обов'язково. Можливо, даних просто замало, щоб відрізнити справжню різницю такого розміру від шуму. Інтервал показує, які різниці ще правдоподібні; якщо в ньому є різниці, важливі для вас, зберіть більше даних, перш ніж робити висновки.
- Чи можна порівняти два сегменти клієнтів, а не експеримент?
- Так, щоб з'ясувати, чи розрив між ними більший за шум. Ні, щоб з'ясувати чому: сегменти відрізняються багатьма речами одночасно, тож значущий розрив між, скажімо, користувачами мобільних і десктопу не доводить, що причина в пристрої.
- Чи можна перевіряти числа щодня, доки вони не стануть значущими?
- Ні. Кожна перевірка — ще один шанс для шуму перетнути межу, тож зупинка в перший значущий день робить хибні перемоги значно ймовірнішими за обраний рівень. Визначте розмір вибірки і момент перевірки заздалегідь; стаття про підглядання нижче пояснює чому.
- Чому калькулятор не працює з дуже малими кількостями?
- Z-тест спирається на наближення, яке не працює, коли в групі менше приблизно 10 успіхів або 10 неуспіхів. Замість p-значення, яке могло б сильно помилятися, калькулятор показує лише частки. Зберіть більше даних або скористайтеся точним тестом у статистичному пакеті.
Дізнатися більше
Плануєте наступне порівняння?
Щоб спланувати, скільки людей потрібно, щоб справжня різниця виявилася значущою, скористайтеся калькулятором розміру вибірки для A/B-тесту.
Порівнюєте відповіді в опитуванні? Кількість відповідей спланує калькулятор вибірки для опитування.
Терміни на цій сторінці
Схожі інструменти
- Калькулятор результатів A/B-тесту
Прочитати результати завершеного тесту з двома варіантами.
- Калькулятор розміру вибірки для A/B-тесту
Планування для двох варіантів (A/B) до початку тесту.
- Калькулятор довірчого інтервалу
Побачити, наскільки точна одна конверсія.