Перейти до змісту
КурсиУвійти
← Глосарій статистики

медіана

Серединне значення впорядкованих даних (середнє двох серединних значень, якщо n парне); стійка до викидів.

Медіана — це серединне значення впорядкованих даних: половина спостережень не більша за неї, половина — не менша. Медіану цікавить лише порядок значень, а не те, наскільки великі крайні з них, тому одне величезне замовлення її майже не зсуває.

Щоб знайти медіану вибірки, відсортуйте nn значень від найменшого до найбільшого. Якщо nn непарне, беріть значення на позиції (n+1)/2(n + 1)/2. Якщо nn парне, серединних значень два — на позиціях n/2n/2 і n/2+1n/2 + 1, — і медіана дорівнює їхньому середньому:

Me={x((n+1)/2),n непарнеx(n/2)+x(n/2+1)2,n парне\text{Me} = \begin{cases} x_{((n+1)/2)}, & n \text{ непарне} \\[6pt] \dfrac{x_{(n/2)} + x_{(n/2+1)}}{2}, & n \text{ парне} \end{cases}

Тут x(k)x_{(k)} — kk-те значення після сортування. У Sheets чи Excel усе це робить =MEDIAN(діапазон).

Медіана потрібна, коли запитання звучить як «який вигляд має типовий покупець, замовлення чи сесія?», а дані скошені. Саме такі зазвичай суми замовлень, час до першої покупки, виручка на користувача й час завантаження сторінок. На відміну від середнього арифметичного, медіану не можна помножити на кількість і отримати суму, тож для прогнозу виручки лишайте середнє. Медіана — це також другий квартиль (Q2) і 50-й процентиль, а її природний партнер для опису розкиду — міжквартильний розмах. Великий розрив між середнім і медіаною — швидкий сигнал асиметрії чи викидів.

Приклад

Сім замовлень Котокорму за суботу в тому порядку, у якому їх вивантажила система: $31, $24, $284, $28, $35, $22, $18.

Непарна кількість. Спершу сортуємо: 18, 22, 24, 28, 31, 35, 284. Для n=7n = 7 медіана стоїть на позиції (7+1)/2=4(7 + 1)/2 = 4, тобто дорівнює $28. Середнє ж становить 442/7≈63,14442 / 7 \approx 63{,}14 долара: це більш ніж удвічі перевищує медіану через замовлення притулку на $284.

Парна кількість. Надходить восьме замовлення на $40. Після сортування: 18, 22, 24, 28, 31, 35, 40, 284. Тепер n=8n = 8, серединні позиції — 4-та і 5-та, і медіана дорівнює (28+31)/2=29,5(28 + 31) / 2 = 29{,}5 долара. Зверніть увагу: такого замовлення в даних немає.

Перевірка на стійкість. Якби притулок замовив не на $284, а на $2 840, медіана так і лишилася б $29,50, а середнє восьми замовлень підскочило б із 482/8=60,25482 / 8 = 60{,}25 до 3 038/8=379,753\,038 / 8 = 379{,}75 долара.

Типові помилки

  • Забути відсортувати. Середній рядок вивантаження, упорядкованого за датою чи ID, — це не медіана.
  • Брати одне з двох серединних значень, коли nn парне, замість їхнього середнього. Найсильніше це змінює відповідь на малих вибірках.
  • Множити медіану на кількість замовлень, щоб спрогнозувати виручку. Із сумою пов'язане лише середнє; медіана недооцінить виручку, якщо розподіл має правий хвіст.
  • Усереднювати медіани за днями чи сегментами. Медіана об'єднаних даних загалом не дорівнює середньому денних медіан. Перераховуйте її із сирих рядків.
  • Дозволяти медіані приховати хвіст. Вона свідомо ігнорує крайні значення, тож коли хвіст важливий (повільні доставки, невдалі оплати), показуйте поруч високий процентиль, наприклад p90.

Вивчити в курсі

  • Типове значення: середнє, медіана, мода · Середнє, медіана, мода й усічене середнє на правдоподібних замовленнях Котокорму: на яке запитання відповідає кожна міра, як одне оптове замовлення обманює середнє і чому не можна усереднювати середні.
  • Викиди та скошені дані · Чому продуктові метрики мають довгі хвости, як знаходити викиди за правилом IQR і що з ними робити: виправляти помилки, сегментувати інших покупців і ніколи бездумно не видаляти «китів».
  • Розкид: розмах, SD і квартилі · Дві кур'єрські служби з однаковим середнім часом доставки, і чому обіцянку виконує лише одна: розмах, дисперсія, стандартне відхилення, квартилі, IQR і коефіцієнт варіації.
  • Графіки: як обрати правильний · Гістограми, діаграми розмаху, стовпчикові, кругові, діаграми розсіювання й лінійні графіки: на яке запитання відповідає кожен, як ширина інтервалів і осі змінюють історію, і класичні способи, якими графіки вводять в оману.
  • Вибірки, генеральні сукупності та нормальний розподіл · Чому ми вивчаємо вибірки, щоб дізнатися про всіх користувачів, і чому дзвоноподібна крива трапляється всюди.