Перейти до змісту
КурсиУвійти
← Глосарій статистики

стандартне відхилення

Квадратний корінь із дисперсії; розкид у тих самих одиницях, що й дані.

Стандартне відхилення показує, наскільки далеко від середнього арифметичного зазвичай лежать значення. Мале стандартне відхилення означає, що значення щільно згруповані навколо середнього, велике — що вони розкидані. На відміну від дисперсії, воно вимірюється в тих самих одиницях, що й дані (години, долари, замовлення), тому саме його й наводять у звітах: «доставка триває 24 ± 8 годин».

Покроково для вибірки з nn значень:

  1. Обчисліть середнє xˉ\bar{x}.
  2. Відніміть його від кожного значення — це відхилення xi−xˉx_i - \bar{x}. Їхня сума завжди дорівнює нулю, тож просто усереднити їх не вийде.
  3. Піднесіть кожне відхилення до квадрата й додайте квадрати.
  4. Поділіть на n−1n - 1. Це вибіркова дисперсія s2s^2.
  5. Добудьте квадратний корінь.

s=∑i=1n(xi−xˉ)2n−1s = \sqrt{\frac{\sum_{i=1}^{n}(x_i - \bar{x})^2}{n - 1}}

Якщо ваші дані — уся генеральна сукупність, а не вибірка, ділять на nn. У продуктовій аналітиці майже завжди маємо вибірку, тож n−1n - 1 — варіант за замовчуванням: STDEV.S у Sheets чи Excel, а не STDEV.P.

Для даних, що мають форму приблизно симетричного «дзвона» (див. нормальний розподіл), близько 68% значень лежать у межах одного стандартного відхилення від середнього і близько 95% — у межах двох. На скошених даних це правило не працює, а оскільки відхилення підносять до квадрата, кілька викидів здатні сильно роздути стандартне відхилення. Там надійніший партнер медіани — міжквартильний розмах. Щоб порівняти розкид метрик різного масштабу, поділіть стандартне відхилення на середнє й отримаєте коефіцієнт варіації. І не плутайте стандартне відхилення (розкид окремих значень) зі стандартною похибкою (невизначеністю оцінки середнього).

Приклад

Щоденні замовлення Котокорму з реклами в соцмережах за п'ять днів: 32, 24, 34, 28, 32.

  1. Середнє: xˉ=(32+24+34+28+32)/5=150/5=30\bar{x} = (32 + 24 + 34 + 28 + 32) / 5 = 150 / 5 = 30 замовлень.
  2. Відхилення: +2,−6,+4,−2,+2+2, -6, +4, -2, +2 (сума: 0).
  3. Квадрати: 4,36,16,4,44, 36, 16, 4, 4; сума квадратів =64= 64.
  4. Вибіркова дисперсія: s2=64/(5−1)=16s^2 = 64 / (5 - 1) = 16 замовлень².
  5. Стандартне відхилення: s=16=4s = \sqrt{16} = 4 замовлення.

У звіті це 30 ± 4 замовлення на день: типовий день відходить від 30 приблизно на 4 замовлення. Якби ці п'ять днів були всією генеральною сукупністю, яка вас цікавить, ділили б на 5: 64/5=12,8≈3,58\sqrt{64 / 5} = \sqrt{12{,}8} \approx 3{,}58. На п'яти значеннях версія для генеральної сукупності виходить приблизно на 11% меншою, тому важливо знати, яку функцію використовує ваш дашборд.

Типові помилки

  • Плутати стандартне відхилення зі стандартною похибкою. Перше описує, як різняться окремі дні чи замовлення; друга — наскільки точно ви знаєте середнє, і вона зменшується зі зростанням nn.
  • Застосовувати правило 68/95 до скошених даних. У нових клієнтів Котокорму середні витрати за 90 днів — $50, а стандартне відхилення — близько $47,7, тож «середнє ± 2 стандартні відхилення» сягає приблизно −$45, а таких витрат не буває.
  • Плутати STDEV.S і STDEV.P. На малих вибірках версія для генеральної сукупності помітно менша. Беріть вибіркову, якщо у вас справді не всі спостереження.
  • Показувати середнє без стандартного відхилення. Дві кур'єрські служби можуть обидві в середньому доставляти за 24 години, хоча в однієї розкид від 14 до 38. Пишіть «24 ± 8 годин», а не просто «24».
  • Порівнювати сирі стандартні відхилення метрик різного масштабу. $150 у витратах на рекламу і 9 у замовленнях напряму не порівняти; для цього є коефіцієнт варіації.

Вивчити в курсі