Перейти до змісту
КурсиУвійти
← Глосарій статистики

нормальний розподіл

Симетричний дзвоноподібний розподіл; близько 68% значень лежать у межах 1 стандартного відхилення від середнього і близько 95% у межах 2.

Нормальний розподіл — це класична дзвоноподібна крива: симетрична, з одним піком посередині і тонкими хвостами, що згасають з обох боків. Її повністю задають два числа: середнє μ\mu визначає, де пік, а стандартне відхилення σ\sigma — наскільки широкий «дзвін». Середнє, медіана і мода збігаються в центрі. Формула кривої така:

f(x)=1σ2π e−(x−μ)22σ2f(x) = \frac{1}{\sigma\sqrt{2\pi}}\, e^{-\frac{(x-\mu)^2}{2\sigma^2}}

але на практиці вона майже не знадобиться. Знадобиться її наслідок — правило 68–95–99,7: близько 68% значень лежать у межах μ±σ\mu \pm \sigma, близько 95% — у межах μ±2σ\mu \pm 2\sigma і близько 99,7% — у межах μ±3σ\mu \pm 3\sigma. (Точна межа для 95% — 1,96σ1{,}96\sigma; саме це число стоїть за більшістю довірчих інтервалів.) Переведіть будь-яке значення в z-оцінку — і одна стандартна таблиця підійде для будь-якої нормальної величини.

Де він трапляється? У величинах, на які впливає багато дрібних незалежних чинників: вага наповненого пакета корму, похибка вимірювання. Для продакта важливіше інше місце: завдяки центральній граничній теоремі вибіркові середні й коефіцієнти конверсії з досить великих вибірок розподілені майже нормально, навіть коли самі дані — ні. Саме тому z-критерій, t-критерій і довірчі інтервали спираються на дзвоноподібну криву.

А от що зазвичай не є нормальним: виручка на покупця, сума замовлення, тривалість сесії — усе, що обмежене нулем знизу і має довгий правий хвіст. Не вгадуйте форму, а перевірте її на гістограмі.

Приклад

Фабрика Котокорму фасує стандартні пакети по 2 кг. Вага наповнення розподілена майже нормально із середнім μ=2000\mu = 2000 г і стандартним відхиленням σ=10\sigma = 10 г.

За правилом 68–95–99,7:

Діапазон
Вага
Частка пакетів
μ±1σ\mu \pm 1\sigma
1990–2010 г
близько 68%
μ±2σ\mu \pm 2\sigma
1980–2020 г
близько 95%
μ±3σ\mu \pm 3\sigma
1970–2030 г
близько 99,7%

На етикетці обіцяно щонайменше 1980 г. Скільки пакетів із партії в 5000 штук не дотягують? 1980 г — це рівно 2σ2\sigma нижче від середнього. Близько 95% пакетів лежать у межах ±2σ\pm 2\sigma, тож решта 5% порівну діляться між двома хвостами: приблизно 2,5% пакетів замалі. Точне табличне значення для z=−2z = -2 — 2,28%, тобто 0,0228×5000≈1140{,}0228 \times 5000 \approx 114 пакетів.

Тепер припустімо, що фасувальна машина почала працювати менш точно: σ\sigma зросло до 15 г, а середнє лишилося 2000 г. Ті самі 1980 г тепер дають z=(1980−2000)/15≈−1,33z = (1980 - 2000) / 15 \approx -1{,}33, і нижче від цієї межі опиняються близько 9,1% пакетів, тобто приблизно 456 із 5000. Середнє не зрушило ні на грам, а недоважених пакетів стало вчетверо більше. У нормальних даних розкид важить не менше, ніж середнє.

Типові помилки

  • Вважати виручку чи суму замовлення нормально розподіленою. Грошові метрики зазвичай мають правосторонню асиметрію, і дзвоноподібна крива недооцінить, як часто трапляються великі замовлення.
  • Думати, що будь-який критерій вимагає нормальних сирих даних. Для середніх з великих вибірок це забезпечує центральна гранична теорема; нормальність самих даних важлива переважно на малих вибірках.
  • Шукати викиди за правилом 68–95–99,7 у скошених даних. Правило працює лише для даних у формі «дзвона».
  • Сприймати «нормальний» як «здоровий» чи «звичайний». Це назва форми розподілу, а не оцінка вашої метрики.
  • Довіряти формальній перевірці нормальності на величезній вибірці. На 100 000 рядків вона відкине нормальність через нешкідливі дрібниці; дивіться на гістограму і питайте себе, чи змінює це відхилення ваше рішення.

Вивчити в курсі