Перейти до змісту
КурсиУвійти
← Глосарій статистики

p-значення

Імовірність отримати результат, щонайменше такий самий екстремальний, як спостережуваний, якщо H0 правдива. Це не ймовірність того, що H0 правдива.

p-значення відповідає на одне вузьке запитання: якби різниці насправді не було (нульова гіпотеза H0 правдива), як часто сама лише випадковість вибірки давала б результат, щонайменше такий самий екстремальний, як у вас? Мале p-значення означає, що у світі без ефекту ваші дані виглядали б дивно, і це підстава відхилити H0. Велике — що дані цілком узгоджуються зі звичайним шумом.

Рахують його через статистику критерію. Спершу дані зводять до одного числа, яке показує розрив відносно шуму, наприклад z=різницястандартна похибкаz = \frac{\text{різниця}}{\text{стандартна похибка}} або tt Стьюдента. Потім дивляться, яка частка розподілу цієї статистики за умови H0 лежить на отриманому значенні або далі від нуля. Для двобічного критерію це p=P(∣Z∣≥∣zспост∣)p = P(|Z| \ge |z_{\text{спост}}|) за умови, що H0 правдива.

Правило рішення коротке: до початку тесту обирають рівень значущості α (зазвичай 0,05). Якщо p<αp < \alpha, результат статистично значущий і H0 відхиляють; якщо ні — не відхиляють.

Не менш важливо, чим p-значення не є. Це не ймовірність того, що H0 правдива, не ймовірність того, що варіант справді кращий, і не міра величини ефекту. Стандартна похибка зменшується зі зростанням вибірки, тож та сама невелика різниця на більшій кількості користувачів дає дедалі менше p-значення. Тому p-значення завжди варто подавати разом із розміром ефекту та довірчим інтервалом: вони показують, наскільки велика різниця і наскільки точно її виміряно.

Приклад

Котокорм протестував новий чекаут на 1000 користувачів у кожному варіанті. Контроль: 52 замовлення (5,2%). Новий варіант: 68 замовлень (6,8%).

  1. Об'єднаний коефіцієнт конверсії: pˉ=52+682000=0,06\bar p = \frac{52 + 68}{2000} = 0{,}06.
  2. Стандартна похибка за умови H0: SE=0,06×0,94×(11000+11000)=0,0001128≈0,0106SE = \sqrt{0{,}06 \times 0{,}94 \times \left(\frac{1}{1000} + \frac{1}{1000}\right)} = \sqrt{0{,}0001128} \approx 0{,}0106.
  3. Статистика критерію: z=0,068−0,0520,0106≈1,51z = \frac{0{,}068 - 0{,}052}{0{,}0106} \approx 1{,}51.
  4. Двобічне p-значення: P(∣Z∣≥1,51)≈0,13P(|Z| \ge 1{,}51) \approx 0{,}13.

Як це читати: якби новий чекаут нічого не змінював, розрив у 1,6 відсоткового пункту або більший однаково траплявся б приблизно в 13% таких тестів — чисто випадково. Це більше за α = 0,05, тож H0 ми не відхиляємо.

Як це не читати: «з імовірністю 13% редизайн марний» або «редизайн не має ефекту». Тест просто замалий, щоб це з'ясувати.

Тепер залишимо ті самі конверсії, але візьмемо 4000 користувачів на варіант (208 проти 272 замовлень). Об'єднана конверсія та сама — 0,06, але SE=0,0564×0,0005≈0,0053SE = \sqrt{0{,}0564 \times 0{,}0005} \approx 0{,}0053, отже z≈0,016/0,0053≈3,01z \approx 0{,}016 / 0{,}0053 \approx 3{,}01 і p≈0,003p \approx 0{,}003. Ефект той самий, p-значення зовсім інше — змінився лише обсяг вибірки.

Типові помилки

  • Вважати p імовірністю того, що H0 правдива. p = 0,03 не означає «3% шансів, що ефекту немає» чи «97% шансів, що варіант переміг». Це ймовірність щодо даних, обчислена за припущення H0.
  • Сприймати крихітне p-значення як великий ефект. На сотнях тисяч користувачів приріст у 0,05 відсоткового пункту може дати p < 0,001. Перш ніж святкувати, подивіться на сам приріст і його довірчий інтервал.
  • Вважати p > 0,05 доказом відсутності ефекту. Тест із малою статистичною потужністю не відхилить H0, навіть якщо зміна працює. Кажіть «результат непереконливий», а не «це не працює».
  • Підглядати й вишукувати. Якщо щодня зазирати в дашборд і зупиняти тест, щойно p опуститься нижче 0,05, або перевірити десять метрик і показати ту, що «спрацювала», реальна частка хибнопозитивних результатів буде значно вищою за 5%.
  • Сприймати 0,05 як прірву. p = 0,049 і p = 0,051 — майже однакові за силою докази. Фіксуйте α до тесту й наводьте точне p-значення, а не лише вердикт «значуще / незначуще».

Вивчити в курсі