Перейти до змісту
КурсиУвійти
← Глосарій статистики

довірчий інтервал

Діапазон правдоподібних значень параметра; 95% довірчий інтервал будують методом, який охоплює справжнє значення у 95% повторних вибірок.

Довірчий інтервал (ДІ) — це діапазон правдоподібних значень величини, яку неможливо побачити напряму, як-от справжнього середнього чека чи справжнього приросту від варіанта, замість однієї оцінки. Більшість інтервалів мають однакову будову: оцінка ± критичне значення × стандартна похибка. Для середнього:

xˉ±z⋅sn,z≈1,96 для 95%\bar x \pm z \cdot \frac{s}{\sqrt{n}}, \qquad z \approx 1{,}96 \text{ для 95\%}

Частина «± критичне значення × SE» — це похибка оцінки.

Правильне тлумачення стосується методу, а не одного конкретного інтервалу. Якби ви багато разів повторювали вибірку й щоразу будували інтервал тим самим способом, приблизно 95% таких інтервалів містили б справжнє значення. Будь-який уже обчислений інтервал або містить його, або ні — ви просто не знаєте, що саме. У розмові цілком можна сказати «ми на 95% упевнені, що справжній AOV — між $48 і $52», якщо пам'ятати, що 95% описують процедуру. Твердження на кшталт «з імовірністю 95% значення лежить тут» — це вже про баєсівські інтервали (credible intervals).

Ширину визначають три важелі. Більша мінливість даних розширює інтервал. Більша вибірка звужує його, але лише пропорційно n\sqrt{n}: учетверо більша вибірка вдвічі зменшує ширину. Вищий довірчий рівень (99% замість 95%) робить інтервал ширшим.

Довірчий інтервал і перевірка гіпотез описують одне й те саме з двох боків: якщо 95% ДІ для різниці не містить нуля, двобічний тест значущий при α = 0,05. Але інтервал каже більше: він показує, наскільки великим правдоподібно може бути ефект, і дає змогу порівняти його з практичним порогом.

Приклад

Одне середнє. Минулого тижня Котокорм отримав 225 замовлень із середнім чеком $50,00 і стандартним відхиленням $15,00.

  1. Стандартна похибка: SE = \frac{15{,}00}{\sqrt{225}} = \frac{15{,}00}{15} = \1{,}00$.
  2. Похибка оцінки для 95%: 1{,}96 \times 1{,}00 = \1{,}96$.
  3. Інтервал: 50,00±1,9650{,}00 \pm 1{,}96, тобто від $48,04 до $51,96.

Якщо наступного тижня середній чек буде $49,50, це в межах інтервалу, і про жодне падіння це не свідчить.

Різниця конверсій. У тесті нового чекауту в контролі конвертувалися 52 з 1000 користувачів (5,2%), у новому варіанті — 68 з 1000 (6,8%); розрив — 1,6 в. п.

  1. Стандартна похибка різниці: SE=0,052×0,9481000+0,068×0,9321000=0,0001127≈0,0106SE = \sqrt{\frac{0{,}052 \times 0{,}948}{1000} + \frac{0{,}068 \times 0{,}932}{1000}} = \sqrt{0{,}0001127} \approx 0{,}0106.
  2. Похибка оцінки: 1,96×0,0106≈0,02081{,}96 \times 0{,}0106 \approx 0{,}0208.
  3. Інтервал: 0,016±0,02080{,}016 \pm 0{,}0208, тобто від −0,5 до +3,7 в. п.

Інтервал містить нуль, і це узгоджується з незначущим тестом (p ≈ 0,13). Проте він містить і прирости +3 в. п. і більше, тож велику перемогу теж не виключено. Правильний висновок — «даних поки замало», а не «новий чекаут не працює».

Типові помилки

  • «З імовірністю 95% справжнє значення лежить у цьому інтервалі». Для вже обчисленого інтервалу 95% описують, як часто метод влучає в довгій перспективі, а не цей конкретний інтервал.
  • Сприймати ДІ для середнього як діапазон для окремих клієнтів. «$48,04–$51,96» стосується середнього чека; окремі замовлення розкидані значно ширше (це описує стандартне відхилення).
  • Судити про різницю за тим, чи перетинаються два інтервали. 95% ДІ, що перетинаються, можуть приховувати значущу різницю. Будуйте інтервал для самої різниці.
  • Забувати, що вибірка має бути випадковою. Зміщена вибірка, наприклад лише користувачі застосунку чи один тиждень з акцією, дає гарний вузький інтервал навколо хибного значення.
  • Прибирати інтервал із дашборду. Голе «$50,00» провокує гонитву за шумом; показуйте діапазон або хоча б похибку оцінки.

Вивчити в курсі