Перейти до змісту
КурсиУвійти
← Глосарій статистики

центральна гранична теорема

За достатньо великих вибірок вибіркове середнє розподілене приблизно нормально, навіть якщо самі дані ні.

Центральна гранична теорема — причина, з якої статистика взагалі працює на «брудних» продуктових даних. Її суть: беремо багато випадкових вибірок однакового обсягу nn, для кожної рахуємо середнє — і ці середні за достатньо великого nn утворюють приблизно нормальний розподіл, яким би не був розподіл самих даних.

Згадаймо витрати покупців Котокорму за 90 днів. Окремі покупці дуже нерівні: багато хто витрачає $20–40, а дехто — сотні. Але середнє 100 випадкових покупців — це суміш дешевих і дорогих, і крайнощі значною мірою компенсують одна одну. Середні по 100 покупців тісно й симетрично скупчуються довкола справжнього середнього, хоча окремі покупці так не поводяться.

Розподіл усіх можливих вибіркових середніх називають вибірковим розподілом, і саме його форму описує теорема. Вона ж каже, наскільки тісно скупчуються середні: розкид вибіркових середніх — це стандартна похибка, σ/n\sigma / \sqrt{n}. Тож вибіркове середнє розподілене приблизно так:

xˉ∼N ⁣(μ, σn)\bar{x} \sim \mathcal{N}\!\left(\mu,\ \frac{\sigma}{\sqrt{n}}\right)

На цьому факті тримаються довірчі інтервали, t-критерій і z-критерій для коефіцієнтів конверсії (конверсія — це просто середнє з нулів та одиниць). Саме тому A/B-тест на виручку можна проводити, хоча сама виручка не нормальна.

Що означає «достатньо великий», залежить від даних. Для приблизно симетричних метрик часто вистачає 30 спостережень. Для сильно скошених, де один «кит» зсуває середнє, можуть знадобитися сотні чи тисячі, а на малих вибірках таких даних надійніші ранговий критерій або бутстреп. Теорема стосується середніх, а не окремих значень: сирі дані вона нормальними не робить.

Приклад

Припустімо, витрати всіх нових покупців Котокорму за 90 днів мають середнє \mu = \50істандартневідхиленняі стандартне відхилення\sigma = $48, а також довгий правий хвіст: більшість витрачає \20–40, а дехто — понад $200.

Окремі покупці. Правило «95% у межах μ±2σ\mu \pm 2\sigma» дало б 50±9650 \pm 96, тобто від −$46 до $146. Від'ємна нижня межа неможлива, і це явна ознака, що скошені дані не нормальні.

Середні по 100 покупців. Уявімо, що аналітик бере 100 випадкових покупців, рахує їхнє середнє і повторює це багато разів. За центральною граничною теоремою ці середні розподілені приблизно нормально зі стандартною похибкою

SE=48100=4810=$4,80SE = \frac{48}{\sqrt{100}} = \frac{48}{10} = \$4{,}80

тож близько 95% вибіркових середніх потрапляють у межі 50±1,96×4,80=50±9,4150 \pm 1{,}96 \times 4{,}80 = 50 \pm 9{,}41, тобто від $40,59 до $59,41. Розкид зменшився вдесятеро, а форма стала симетричним «дзвоном».

Середні по 4 покупці. Тут SE = 48 / \sqrt{4} = \24, а один покупець на \240 у вибірці з чотирьох сам-один додає до її середнього $60, більше, ніж усе середнє генеральної сукупності. Такі середні досі помітно скошені праворуч: чотири — це не «достатньо великий» обсяг для настільки нерівних даних.

Типові помилки

  • Вважати, що теорема робить дані нормальними. Вона стосується розподілу вибіркових середніх, а окремі замовлення лишаються такими ж скошеними, як і були.
  • Сприймати n = 30 як магічну межу. Для даних про виручку з важкими хвостами 30 може бути замало; перевірте, наскільки зміщується середнє, якщо прибрати найбільші значення.
  • Забувати, що вибірки мають бути випадковими і незалежними. Теорема нічого не каже про вибірку із замовлень дня запуску чи про дані, де той самий покупець трапляється багато разів.
  • Переносити її на медіану чи максимум, ніби це середні. Інші статистики мають власний вибірковий розподіл, який часто стабілізується повільніше.
  • Виправдовувати нею відмову дивитися на дані. Гарний вибірковий розподіл не покаже ні помилки трекінгу, ні B2B-сегмента, що ховається в хвості.

Вивчити в курсі