статистична значущість
Результат значущий, коли p < α; це означає, що ефект навряд чи є випадковим шумом, але не що він великий чи важливий.
Результат статистично значущий, коли його p-значення менше за рівень значущості α, зафіксований до тесту (зазвичай 0,05). Це означає, що спостережувана різниця була б незвичною, якби реального ефекту не було, тож пояснення «це просто шум» стає непереконливим. І все. Про те, чи ефект великий, цінний і чи варто його запускати, статистична значущість нічого не каже.
Практична значущість — це вже бізнесове питання: чи достатньо великий ефект, щоб мати значення з урахуванням витрат, ризиків і зусиль? Відповідають на нього через розмір ефекту в зрозумілих одиницях (абсолютний приріст у відсоткових пунктах, виручка на користувача, зекономлені хвилини) та його довірчий інтервал, порівнюючи їх із порогом, погодженим до тесту. Часто таким порогом є мінімальний виявлюваний ефект (MDE), під який розраховували обсяг вибірки.
Ці дві значущості можуть розходитися в обидва боки. На величезних вибірках стандартна похибка стає мізерною, і комерційно дріб'язкова різниця виявляється статистично значущою. На малих вибірках справді корисний ефект може лишитися незначущим, бо тестові бракує статистичної потужності.
Зручно читати будь-який результат через довірчий інтервал ефекту:
- увесь інтервал вище за практичний поріг — ефект значущий і вартий дій;
- інтервал не містить нуля, але лежить нижче порогу — ефект реальний, але замалий;
- інтервал містить і нуль, і значення вище порогу — результат непереконливий, потрібні ще дані.
І пам'ятайте: α = 0,05 означає, що ви погоджуєтеся на 5% хибнопозитивних результатів у кожному тесті. Проведіть двадцять тестів змін, які нічого не дають, — і приблизно один «значущий переможець» знайдеться.
Приклад
Котокорм показує банер «безкоштовна доставка» половині з 1,2 млн відвідувачів.
Статистична значущість. Об'єднана конверсія . , отже і . Явно значущий результат.
Практична значущість. Приріст становить +0,10 відсоткового пункту (2,5% відносно). Для 95% довірчого інтервалу різниці беремо необ'єднану стандартну похибку, яка тут теж близько 0,00036: , тобто від +0,03 до +0,17 в. п.
Безкоштовна доставка коштує дорого. Фінансисти порахували, що банер окупається лише за приросту конверсії щонайменше +0,3 в. п. Увесь інтервал лежить нижче цієї межі.
Висновок: ефект реальний (статистично значущий), але замалий, щоб окупити витрати (практично незначущий). У такому вигляді запускати не варто, а от спробувати дешевший варіант, наприклад безкоштовну доставку від певної суми кошика, має сенс.
Типові помилки
- Чути «значущий» як «важливий». У презентації пишіть «статистично значущий» і одразу поруч наводьте розмір ефекту.
- Запускати без практичного порогу. Якщо ніхто заздалегідь не домовився, який приріст вартий витрат, будь-який значущий результат виглядатиме перемогою.
- Називати незначущий результат «відсутністю ефекту». Якщо довірчий інтервал досі містить прирости, які вам важливі, чесна відповідь — «поки що не знаємо».
- Полювати на значущість. Якщо різати результати за сегментами, метриками й днями, доки щось не перетне 0,05, хибні переможці гарантовані. Застосовуйте поправку на множинні порівняння або фіксуйте план аналізу заздалегідь.
- Порівнювати вердикти замість ефектів. «Тест А значущий, а тест Б ні, отже А кращий» — хибний висновок: ефекти можуть бути майже однаковими. Порівнюйте самі ефекти та їхні інтервали.
Вивчити в курсі
- p-значення та значущість · Що насправді каже p-значення, чого воно не каже, і статистична значущість проти практичної.