помилка першого роду (хибнопозитивний результат)
Відхилення правдивої H0: оголошення ефекту, якого немає. Її ймовірність дорівнює α.
Перевірка гіпотези завершується рішенням, а рішення може бути хибним двома різними способами. Якщо поєднати справжній стан речей із рішенням, виходить чотири варіанти:
Помилка першого роду — оголосити перемогу, якої немає: ви запускаєте зміну чекауту, яка насправді нічого не дає. Коли правдива, її ймовірність дорівнює обраному рівню значущості , зазвичай 5%. Помилка другого роду — пропустити реальний ефект: гарну ідею відкладають, бо тест «нічого не показав». Її ймовірність позначають , а — це статистична потужність критерію. Звична ціль — потужність 80%, тобто .
Ці дві помилки тягнуть у різні боки. Якщо знизити з 5% до 1%, хибних перемог стане менше, але на тій самій вибірці пропущених ефектів — більше. Головний спосіб зменшити обидві одночасно — більше даних (або менш шумні метрики); саме для цього й розраховують обсяг вибірки.
Яка помилка гірша, залежить від бізнесу. Хибнопозитивний результат коштує часу розробки і може непомітно зашкодити метриці, за якою ніхто не стежив. Хибнонегативний коштує виручки від ідеї, яку так і не запустили. Дві ситуації роздувають частку помилок першого роду далеко понад : перевірка багатьох метрик чи варіантів (проблема множинних порівнянь) і підглядання — зупинка тесту в ту мить, коли результат здається значущим.
Приклад
Продуктова команда Котокорму тестує чекаут на 1000 користувачах у кожній групі, двобічно, .
Помилка першого роду: зміни тексту, які нічого не дали. За квартал команда тестує 20 дрібних змін тексту кнопки. Припустімо, жодна з них насправді ні на що не впливає, тобто щоразу правдива. Кожен тест усе одно має 5% шансу на хибну перемогу:
- очікувана кількість хибнопозитивних результатів:
- імовірність хоча б одного:
Тож приблизно з імовірністю 64% квартальний звіт святкуватиме хоча б одну «виграшну» зміну тексту, яка є чистим шумом.
Помилка другого роду: редизайн, який справді працює. Тепер припустімо, що редизайн насправді піднімає конверсію з 5% до 6%. За 1000 користувачів у групі стандартна похибка різниці приблизно , тож реальний приріст на 1 в. п. — це лише близько стандартної похибки. Тест оголошує перемогу, лише коли , тому потужність приблизно така:
Отже, : тест пропускає цей реальний приріст приблизно 5 разів із 6. Для потужності 80% команді знадобилося б близько 8150 користувачів на групу.
Та сама команда, той самий : у першому випадку забагато хибних перемог, у другому — майже гарантований пропуск. Друге лікують обсягом вибірки, перше — меншою кількістю заздалегідь зареєстрованих тестів або поправкою на множинні порівняння.
Типові помилки
- Тлумачити α як «імовірність, що наш переможець фейковий». α — частка хибнопозитивних результатів серед тестів, де ефекту немає; частка фейкових серед оголошених переможців може бути значно вищою, особливо коли більшість ідей не працює.
- Ігнорувати помилки другого роду. Недопотужний тест, який «нічого не знайшов», часто ховає гарну ідею; перевірте потужність, перш ніж називати результат негативним.
- Підглядати і зупиняти тест передчасно. Щоденна перевірка і зупинка при першому p < 0,05 піднімає справжню частку помилок першого роду значно вище 5%.
- Перевіряти багато метрик і показувати ту, що зрушила. За 20 незалежних метрик без реальних ефектів імовірність хоча б одного хибнопозитивного результату — близько 64%.
- Знижувати α, не додаючи даних. Хибних перемог стане менше, зате пропущених реальних ефектів — більше; обидві помилки зменшують лише більша вибірка або менш шумна метрика.
Вивчити в курсі
- t-тест · Порівняння середніх двох груп і рішення, чи різниця більша за випадкову.