довірчий інтервал
Діапазон правдоподібних значень параметра; 95% довірчий інтервал будують методом, який охоплює справжнє значення у 95% повторних вибірок.
Довірчий інтервал (ДІ) — це діапазон правдоподібних значень величини, яку неможливо побачити напряму, як-от справжнього середнього чека чи справжнього приросту від варіанта, замість однієї оцінки. Більшість інтервалів мають однакову будову: оцінка ± критичне значення × стандартна похибка. Для середнього:
Частина «± критичне значення × SE» — це похибка оцінки.
Правильне тлумачення стосується методу, а не одного конкретного інтервалу. Якби ви багато разів повторювали вибірку й щоразу будували інтервал тим самим способом, приблизно 95% таких інтервалів містили б справжнє значення. Будь-який уже обчислений інтервал або містить його, або ні — ви просто не знаєте, що саме. У розмові цілком можна сказати «ми на 95% упевнені, що справжній AOV — між $48 і $52», якщо пам'ятати, що 95% описують процедуру. Твердження на кшталт «з імовірністю 95% значення лежить тут» — це вже про баєсівські інтервали (credible intervals).
Ширину визначають три важелі. Більша мінливість даних розширює інтервал. Більша вибірка звужує його, але лише пропорційно : учетверо більша вибірка вдвічі зменшує ширину. Вищий довірчий рівень (99% замість 95%) робить інтервал ширшим.
Довірчий інтервал і перевірка гіпотез описують одне й те саме з двох боків: якщо 95% ДІ для різниці не містить нуля, двобічний тест значущий при α = 0,05. Але інтервал каже більше: він показує, наскільки великим правдоподібно може бути ефект, і дає змогу порівняти його з практичним порогом.
Приклад
Одне середнє. Минулого тижня Котокорм отримав 225 замовлень із середнім чеком $50,00 і стандартним відхиленням $15,00.
- Стандартна похибка: SE = \frac{15{,}00}{\sqrt{225}} = \frac{15{,}00}{15} = \1{,}00$.
- Похибка оцінки для 95%: 1{,}96 \times 1{,}00 = \1{,}96$.
- Інтервал: , тобто від $48,04 до $51,96.
Якщо наступного тижня середній чек буде $49,50, це в межах інтервалу, і про жодне падіння це не свідчить.
Різниця конверсій. У тесті нового чекауту в контролі конвертувалися 52 з 1000 користувачів (5,2%), у новому варіанті — 68 з 1000 (6,8%); розрив — 1,6 в. п.
- Стандартна похибка різниці: .
- Похибка оцінки: .
- Інтервал: , тобто від −0,5 до +3,7 в. п.
Інтервал містить нуль, і це узгоджується з незначущим тестом (p ≈ 0,13). Проте він містить і прирости +3 в. п. і більше, тож велику перемогу теж не виключено. Правильний висновок — «даних поки замало», а не «новий чекаут не працює».
Типові помилки
- «З імовірністю 95% справжнє значення лежить у цьому інтервалі». Для вже обчисленого інтервалу 95% описують, як часто метод влучає в довгій перспективі, а не цей конкретний інтервал.
- Сприймати ДІ для середнього як діапазон для окремих клієнтів. «$48,04–$51,96» стосується середнього чека; окремі замовлення розкидані значно ширше (це описує стандартне відхилення).
- Судити про різницю за тим, чи перетинаються два інтервали. 95% ДІ, що перетинаються, можуть приховувати значущу різницю. Будуйте інтервал для самої різниці.
- Забувати, що вибірка має бути випадковою. Зміщена вибірка, наприклад лише користувачі застосунку чи один тиждень з акцією, дає гарний вузький інтервал навколо хибного значення.
- Прибирати інтервал із дашборду. Голе «$50,00» провокує гонитву за шумом; показуйте діапазон або хоча б похибку оцінки.
Вивчити в курсі
- Довірчі інтервали · Діапазон правдоподібних значень замість одного числа.
- Графіки: як обрати правильний · Гістограми, діаграми розмаху, стовпчикові, кругові, діаграми розсіювання й лінійні графіки: на яке запитання відповідає кожен, як ширина інтервалів і осі змінюють історію, і класичні способи, якими графіки вводять в оману.
- Підсумок курсу: як обрати правильний тест · Шпаргалка для вибору методу, що поєднує весь курс.