Перейти до змісту
КурсиУвійти
← Глосарій статистики

помилка першого роду (хибнопозитивний результат)

Відхилення правдивої H0: оголошення ефекту, якого немає. Її ймовірність дорівнює α.

Перевірка гіпотези завершується рішенням, а рішення може бути хибним двома різними способами. Якщо поєднати справжній стан речей із рішенням, виходить чотири варіанти:

H0H_0 правдива (ефекту немає)
H0H_0 хибна (ефект є)
Відхиляємо H0H_0 («працює!»)
помилка першого роду, хибнопозитивний результат
правильно: потужність, 1−β1 - \beta
Не відхиляємо H0H_0 («доказів немає»)
правильно
помилка другого роду, хибнонегативний результат

Помилка першого роду — оголосити перемогу, якої немає: ви запускаєте зміну чекауту, яка насправді нічого не дає. Коли H0H_0 правдива, її ймовірність дорівнює обраному рівню значущості α\alpha, зазвичай 5%. Помилка другого роду — пропустити реальний ефект: гарну ідею відкладають, бо тест «нічого не показав». Її ймовірність позначають β\beta, а 1−β1 - \beta — це статистична потужність критерію. Звична ціль — потужність 80%, тобто β=20%\beta = 20\%.

Ці дві помилки тягнуть у різні боки. Якщо знизити α\alpha з 5% до 1%, хибних перемог стане менше, але на тій самій вибірці пропущених ефектів — більше. Головний спосіб зменшити обидві одночасно — більше даних (або менш шумні метрики); саме для цього й розраховують обсяг вибірки.

Яка помилка гірша, залежить від бізнесу. Хибнопозитивний результат коштує часу розробки і може непомітно зашкодити метриці, за якою ніхто не стежив. Хибнонегативний коштує виручки від ідеї, яку так і не запустили. Дві ситуації роздувають частку помилок першого роду далеко понад α\alpha: перевірка багатьох метрик чи варіантів (проблема множинних порівнянь) і підглядання — зупинка тесту в ту мить, коли результат здається значущим.

Приклад

Продуктова команда Котокорму тестує чекаут на 1000 користувачах у кожній групі, двобічно, α=0,05\alpha = 0{,}05.

Помилка першого роду: зміни тексту, які нічого не дали. За квартал команда тестує 20 дрібних змін тексту кнопки. Припустімо, жодна з них насправді ні на що не впливає, тобто H0H_0 щоразу правдива. Кожен тест усе одно має 5% шансу на хибну перемогу:

  • очікувана кількість хибнопозитивних результатів: 20×0,05=120 \times 0{,}05 = 1
  • імовірність хоча б одного: 1−0,9520≈1−0,358=0,641 - 0{,}95^{20} \approx 1 - 0{,}358 = 0{,}64

Тож приблизно з імовірністю 64% квартальний звіт святкуватиме хоча б одну «виграшну» зміну тексту, яка є чистим шумом.

Помилка другого роду: редизайн, який справді працює. Тепер припустімо, що редизайн насправді піднімає конверсію з 5% до 6%. За 1000 користувачів у групі стандартна похибка різниці приблизно 0,05×0,95/1000+0,06×0,94/1000≈0,0102\sqrt{0{,}05 \times 0{,}95 / 1000 + 0{,}06 \times 0{,}94 / 1000} \approx 0{,}0102, тож реальний приріст на 1 в. п. — це лише близько 0,01/0,0102≈0,980{,}01 / 0{,}0102 \approx 0{,}98 стандартної похибки. Тест оголошує перемогу, лише коли ∣z∣>1,96|z| > 1{,}96, тому потужність приблизно така:

P(Z>1,96−0,98)=P(Z>0,98)≈0,16P(Z > 1{,}96 - 0{,}98) = P(Z > 0{,}98) \approx 0{,}16

Отже, β≈0,84\beta \approx 0{,}84: тест пропускає цей реальний приріст приблизно 5 разів із 6. Для потужності 80% команді знадобилося б близько 8150 користувачів на групу.

Та сама команда, той самий α\alpha: у першому випадку забагато хибних перемог, у другому — майже гарантований пропуск. Друге лікують обсягом вибірки, перше — меншою кількістю заздалегідь зареєстрованих тестів або поправкою на множинні порівняння.

Типові помилки

  • Тлумачити α як «імовірність, що наш переможець фейковий». α — частка хибнопозитивних результатів серед тестів, де ефекту немає; частка фейкових серед оголошених переможців може бути значно вищою, особливо коли більшість ідей не працює.
  • Ігнорувати помилки другого роду. Недопотужний тест, який «нічого не знайшов», часто ховає гарну ідею; перевірте потужність, перш ніж називати результат негативним.
  • Підглядати і зупиняти тест передчасно. Щоденна перевірка і зупинка при першому p < 0,05 піднімає справжню частку помилок першого роду значно вище 5%.
  • Перевіряти багато метрик і показувати ту, що зрушила. За 20 незалежних метрик без реальних ефектів імовірність хоча б одного хибнопозитивного результату — близько 64%.
  • Знижувати α, не додаючи даних. Хибних перемог стане менше, зате пропущених реальних ефектів — більше; обидві помилки зменшують лише більша вибірка або менш шумна метрика.

Вивчити в курсі

  • t-тест · Порівняння середніх двох груп і рішення, чи різниця більша за випадкову.