Перейти до змісту
КурсиУвійти
← Глосарій статистики

стандартна похибка

Стандартне відхилення вибіркового розподілу статистики; для середнього дорівнює SD / √n.

Стандартна похибка показує, наскільки статистика (вибіркове середнє, коефіцієнт конверсії) коливалася б, якби ми повторили те саме дослідження на новій вибірці. Формально це стандартне відхилення вибіркового розподілу цієї статистики. Для середнього:

SE=snSE = \frac{s}{\sqrt{n}}

де ss — вибіркове стандартне відхилення, а nn — обсяг вибірки. Для частки pp (наприклад, коефіцієнта конверсії) SE=p(1−p)/nSE = \sqrt{p(1-p)/n}.

Головне — не плутати її зі стандартним відхиленням. Вони відповідають на різні запитання:

Стандартне відхилення (SD)
Стандартна похибка (SE)
Що описує
окремі значення (замовлення, покупців)
оцінку (середнє, частку, приріст)
Запитання
наскільки покупці різні між собою?
наскільки точно ми знаємо середнє?
Більше даних
наближається до справжнього значення, але не зменшується
зменшується пропорційно 1/n1/\sqrt{n}

Стандартне відхилення — властивість ваших покупців, стандартна похибка — властивість вашого вимірювання. Більша вибірка не робить покупців схожішими, зате точніше фіксує середнє.

Стандартна похибка — цеглинка всього статистичного висновку. 95% довірчий інтервал — це приблизно оцінка ±1,96×SE\pm 1{,}96 \times SE, а t- і z-статистики ділять спостережувану різницю саме на стандартну похибку. Через корінь, щоб зменшити стандартну похибку вдвічі, потрібно вчетверо більше даних, а не вдвічі.

Приклад

Аналітик Котокорму дивиться на 225 замовлень минулого тижня: середнє $50,00, стандартне відхилення $15,00.

SE=15225=1515=$1,00SE = \frac{15}{\sqrt{225}} = \frac{15}{15} = \$1{,}00

Ці два числа кажуть зовсім різне:

  • SD = $15: окремі замовлення дуже відрізняються. Чимало замовлень — близько $35 чи $65, просто так купують люди.
  • SE = $1: середнє відоме досить точно. 95% довірчий інтервал: 50±1,96×150 \pm 1{,}96 \times 1, тобто від $48,04 до $51,96.

Тепер команда збирає вчетверо більше замовлень, n=900n = 900, і стандартне відхилення знову виходить близько $15. Стандартна похибка стає 15 / \sqrt{900} = 15 / 30 = \0{,}50,аінтервалзвужуєтьсядо, а інтервал звужується до 50 \pm 0{,}98, тобто від \49,02 до $50,98. Покупці такі ж різні, як і були; покращилося лише наше знання про середнє, і щоб зменшити похибку вдвічі, знадобилося вчетверо більше даних.

Для частки логіка та сама: 60 оформлених замовлень на 1000 сесій — це коефіцієнт конверсії 6,0% зі стандартною похибкою 0,06×0,94/1000≈0,0075\sqrt{0{,}06 \times 0{,}94 / 1000} \approx 0{,}0075, тобто 0,75 відсоткового пункту.

Типові помилки

  • Подавати стандартну похибку так, ніби вона описує покупців. «Сума замовлення коливається на ±$1» — хибна фраза, коли стандартне відхилення $15: $1 — це невизначеність середнього, а не розкид замовлень.
  • Не підписувати, що саме показано на графіку. Планки похибок можуть показувати стандартне відхилення, стандартну похибку або 95% довірчий інтервал, і їхня довжина різниться в рази. Завжди підписуйте.
  • Чекати, що стандартне відхилення зменшиться з більшою кількістю даних. Зменшується лише стандартна похибка. Якщо стандартне відхилення падає разом зі зростанням вибірки, перевірте, як збирають дані.
  • Подвоювати вибірку, щоб удвічі зменшити невизначеність. Через n\sqrt{n} для вдвічі меншої стандартної похибки потрібна вчетверо більша вибірка.
  • Довіряти малій стандартній похибці зі зміщеної вибірки. Вона враховує лише випадкові коливання вибірки і нічого не каже про вибірку лише з користувачів застосунку чи лише з дня запуску.

Вивчити в курсі