Що таке p-значення: пояснення для продакт-менеджерів
Що таке p-значення простими словами: що воно каже про A/B-тест, чого не каже, типові хибні тлумачення і як звітувати про результати.
Автор: Sergey BruhОпубліковано 7 хв читання
Що таке p-значення (p-value), якщо одним реченням: це ймовірність побачити різницю, не меншу за ту, яку ви отримали, за умови, що насправді жодної різниці немає. Маленьке p-значення (за домовленістю — менше 0,05) означає, що ваш результат був би дивним у світі, де зміна нічого не дала. Отже, є певні підстави вважати, що вона таки щось дала. Але p-значення не каже, з якою ймовірністю ваш варіант кращий, наскільки великий ефект і чи важливий він для бізнесу. Більшість поганих рішень за підсумками A/B-тестів з'являються тоді, коли від p-значення чекають більшого, ніж воно може дати.
Швидкий приклад
Котокорм, інтернет-магазин кормів для тварин, тестує на сторінці товару банер «Безкоштовна доставка від 30 доларів». Через два тижні:
Варіант конвертує на 0,6 відсоткового пункту краще — це відносний приріст 15 %. Це реальний ефект чи такий розрив міг дати звичайний випадковий шум?
z-критерій для двох часток дає і .
Людською мовою: якби банер не впливав ні на що, розрив у 0,6 пункту або більший (в будь-який бік) траплявся б приблизно в 3,6 % експериментів такого розміру — просто через те, як випадково розподілилися відвідувачі між групами. Це досить малоймовірно, тож у команди є розумні підстави вважати, що банер допомагає.
Як влаштоване p-значення
Будь-яке p-значення отримують за три кроки:
- Припускаємо «нудний» світ. Нульова гіпотеза стверджує, що зміна нічого не робить: справжня конверсія в обох групах однакова.
- Вимірюємо, наскільки дані далекі від цього світу. Перетворюємо спостережувану різницю на статистику критерію, тут , де — стандартна похибка різниці. Що більше , то далі дані від «ефекту немає».
- Питаємо, як часто «нудний» світ дає щось настільки ж екстремальне. Ця частка і є p-значенням.
Далі його порівнюють із порогом, обраним до тесту, — рівнем значущості (зазвичай 0,05). Якщо , результат називають статистично значущим.
Чим p-значення не є
Це не ймовірність того, що нульова гіпотеза правдива
«, отже, з імовірністю 3,6 % банер нічого не дає» — найпоширеніше хибне тлумачення. p-значення рахують, припустивши, що правдива, тож воно не може водночас казати, наскільки імовірна.
Чому це важливо? Припустімо, що з усіх ідей, які тестує команда, справді працює лише кожна десята, потужність тестів — 80 %, а . Зі 1 000 тестів:
- 100 ідей справді працюють; тести ловлять 80 із них.
- 900 ідей не дають нічого; але 5 % із них, тобто 45 тестів, усе одно випадково виходять «значущими».
Разом 125 «переможців», і 45 із них хибні: 36 % значущих результатів — це шум, хоча в кожного з них . Саме p-значення не підкаже, які саме.
Це не ймовірність того, що варіант кращий
«З імовірністю 97 % банер виграє» — та сама помилка, тільки навпаки. Такі твердження потребують баєсівського аналізу з явно заданою апріорною ймовірністю. Деякі інструменти для A/B-тестів їх показують, але класичне p-значення — ні.
Це не розмір ефекту
Крихітний і марний ефект може мати дуже маленьке p-значення, якщо вибірка достатньо велика. За мільйона відвідувачів у кожній групі зміна конверсії з 4,00 % до 4,08 % дає . Результат дуже значущий — і, можливо, не вартий часу розробників на підтримку.
Працює і навпаки. Повернімося до тесту банера, але з 1 000 відвідувачів у групі і тими самими 4,0 % проти 4,6 %: тепер . Ефект точно такий самий, просто тест замалий, щоб відрізнити його від шуму.
Велике p-значення не доводить, що ефекту немає
не означає «банер не працює». Воно означає «цей тест не зміг розрізнити». Відсутність доказів — не доказ відсутності, особливо коли тест має низьку потужність. Перш ніж поховати ідею, перевірте, чи вистачало користувачів, щоб помітити важливий для вас ефект.
Статистична і практична значущість
Це два різні питання:
- Статистична значущість: чи можна відрізнити ефект від шуму?
- Практична значущість: чи достатньо він великий, щоб мати значення?
Потрібні обидві. Тому поряд із p-значенням завжди дивіться на розмір ефекту і його довірчий інтервал. Для тесту банера 95-відсотковий довірчий інтервал різниці — приблизно від +0,04 до +1,16 відсоткового пункту. Цей діапазон каже дві речі одночасно: ефект, імовірно, позитивний (інтервал не містить нуля, що узгоджується з ), і він може бути будь-яким — від мізерного до великого. Для рішення це набагато корисніше, ніж «».
Пастки, через які p-значення бреше
Підглядання. Якщо щодня перевіряти результати і зупиняти тест, щойно опуститься нижче 0,05, реальна частка хибнопозитивних результатів помітно перевищує 5 %. p-значення розраховане на один аналіз при запланованому розмірі вибірки.
Багато метрик — один «переможець». Перевірте 10 незалежних метрик без реального ефекту з — і ймовірність, що хоча б одна вийде «значущою», становитиме . Для 20 метрик — близько 64 %. Оберіть одну основну метрику до запуску або застосуйте поправку на множинні порівняння.
Нарізання сегментів постфактум. «Загалом незначуще, зате значуще для користувачів iOS у Києві у вихідні» — майже завжди хибнопозитивний результат. Сегменти, які ви не планували заздалегідь, — це ідеї для наступного тесту, а не висновки.
Вважати 0,049 і 0,051 протилежностями. Межа 0,05 — це домовленість, а не закон природи. Результат із майже такий самий переконливий, як і з .
Як звітувати стейкхолдерам
Стейкхолдерам не потрібне визначення p-значення. Їм потрібно знати, що сталося, наскільки ви впевнені і що пропонуєте. Шаблон, який працює:
Банер підвищив конверсію з 4,0 % до 4,6 % (+0,6 в. п., +15 %). 95-відсотковий довірчий інтервал приросту — від +0,04 до +1,16 в. п., тож ефект майже напевно позитивний, але може бути невеликим. Результат статистично значущий (). Сторінку товару відвідують близько 43 000 людей на місяць, тож за точковою оцінкою це приблизно 250 додаткових замовлень щомісяця; на нижній межі інтервалу виграш був би мінімальним. Рекомендація: запускаємо на всіх і ще чотири тижні стежимо за конверсією та середнім чеком.
Зверніть увагу на структуру: спершу ефект, невизначеність — як діапазон, p-значення — як допоміжна деталь, а рішення прив'язане до впливу на бізнес. Уникайте формулювань «тест довів», «на 97 % упевнені, що банер виграє» і «ефекту немає» для незначущого результату. Натомість кажіть: «ми не змогли виявити ефект, більший за X».
Головне
- p-значення — це ймовірність отримати дані, не менш екстремальні за ваші, якби реального ефекту не було.
- Це не ймовірність того, що нульова гіпотеза правдива, і не ймовірність, що варіант виграє.
- Маленьке p-значення не означає великого ефекту, а велике — не означає, що ефекту немає.
- Завжди подавайте разом із p-значенням розмір ефекту і довірчий інтервал.
- Визначайте , основну метрику і розмір вибірки до запуску — і не підглядайте.
FAQ
Що означає p < 0,05?
Це означає, що якби зміна не мала реального ефекту, результати, такі ж екстремальні, як ваші, траплялися б менш ніж у 5 % випадків. За домовленістю такий результат називають статистично значущим. Це не означає, що ваша гіпотеза правильна з імовірністю 95 %.
p = 0,06 — це «майже значуще»?
Це слабкий доказ — приблизно такий самий слабкий, як і 0,04. Замість суперечок про поріг подивіться на довірчий інтервал і на ставки для бізнесу. Якщо правдоподібний діапазон містить ефекти, які мали б значення, подумайте про довший або більший тест, а не оголошуйте ні перемогу, ні поразку.
Чи може p-значення дорівнювати нулю?
Не зовсім. Інструменти можуть показувати «p = 0,000» або «p < 0,001», коли значення дуже мале. Пишіть «p < 0,001» і пам'ятайте, що на величезних вибірках навіть дрібні ефекти дають мізерні p-значення.
Чому деякі інструменти для A/B-тестів показують «ймовірність перемогти контроль»?
Вони використовують баєсівські методи, які відповідають на інше питання: наскільки ймовірно, що варіант кращий, з огляду на дані й апріорне припущення. Це легше пояснити, але це не те саме число, що p-значення, і воно залежить від налаштувань, які варто розуміти, перш ніж йому довіряти.
Спробуйте на практиці
Безкоштовний урок p-значення та значущість будує p-значення з нуля на експерименті Котокорму. У ньому є тести саме на ті хибні тлумачення, про які йшлося вище, і практичне завдання з перевіркою ШІ. Це частина безкоштовного курсу «Статистика для продакт-менеджерів і маркетологів».