нормальний розподіл
Симетричний дзвоноподібний розподіл; близько 68% значень лежать у межах 1 стандартного відхилення від середнього і близько 95% у межах 2.
Нормальний розподіл — це класична дзвоноподібна крива: симетрична, з одним піком посередині і тонкими хвостами, що згасають з обох боків. Її повністю задають два числа: середнє визначає, де пік, а стандартне відхилення — наскільки широкий «дзвін». Середнє, медіана і мода збігаються в центрі. Формула кривої така:
але на практиці вона майже не знадобиться. Знадобиться її наслідок — правило 68–95–99,7: близько 68% значень лежать у межах , близько 95% — у межах і близько 99,7% — у межах . (Точна межа для 95% — ; саме це число стоїть за більшістю довірчих інтервалів.) Переведіть будь-яке значення в z-оцінку — і одна стандартна таблиця підійде для будь-якої нормальної величини.
Де він трапляється? У величинах, на які впливає багато дрібних незалежних чинників: вага наповненого пакета корму, похибка вимірювання. Для продакта важливіше інше місце: завдяки центральній граничній теоремі вибіркові середні й коефіцієнти конверсії з досить великих вибірок розподілені майже нормально, навіть коли самі дані — ні. Саме тому z-критерій, t-критерій і довірчі інтервали спираються на дзвоноподібну криву.
А от що зазвичай не є нормальним: виручка на покупця, сума замовлення, тривалість сесії — усе, що обмежене нулем знизу і має довгий правий хвіст. Не вгадуйте форму, а перевірте її на гістограмі.
Приклад
Фабрика Котокорму фасує стандартні пакети по 2 кг. Вага наповнення розподілена майже нормально із середнім г і стандартним відхиленням г.
За правилом 68–95–99,7:
На етикетці обіцяно щонайменше 1980 г. Скільки пакетів із партії в 5000 штук не дотягують? 1980 г — це рівно нижче від середнього. Близько 95% пакетів лежать у межах , тож решта 5% порівну діляться між двома хвостами: приблизно 2,5% пакетів замалі. Точне табличне значення для — 2,28%, тобто пакетів.
Тепер припустімо, що фасувальна машина почала працювати менш точно: зросло до 15 г, а середнє лишилося 2000 г. Ті самі 1980 г тепер дають , і нижче від цієї межі опиняються близько 9,1% пакетів, тобто приблизно 456 із 5000. Середнє не зрушило ні на грам, а недоважених пакетів стало вчетверо більше. У нормальних даних розкид важить не менше, ніж середнє.
Типові помилки
- Вважати виручку чи суму замовлення нормально розподіленою. Грошові метрики зазвичай мають правосторонню асиметрію, і дзвоноподібна крива недооцінить, як часто трапляються великі замовлення.
- Думати, що будь-який критерій вимагає нормальних сирих даних. Для середніх з великих вибірок це забезпечує центральна гранична теорема; нормальність самих даних важлива переважно на малих вибірках.
- Шукати викиди за правилом 68–95–99,7 у скошених даних. Правило працює лише для даних у формі «дзвона».
- Сприймати «нормальний» як «здоровий» чи «звичайний». Це назва форми розподілу, а не оцінка вашої метрики.
- Довіряти формальній перевірці нормальності на величезній вибірці. На 100 000 рядків вона відкине нормальність через нешкідливі дрібниці; дивіться на гістограму і питайте себе, чи змінює це відхилення ваше рішення.
Вивчити в курсі
- Вибірки, генеральні сукупності та нормальний розподіл · Чому ми вивчаємо вибірки, щоб дізнатися про всіх користувачів, і чому дзвоноподібна крива трапляється всюди.
- Довірчі інтервали · Діапазон правдоподібних значень замість одного числа.