Перейти до змісту
Увійти
← Глосарій статистики

генеральна сукупність

Уся група, про яку ми хочемо робити висновки, наприклад усі теперішні та майбутні відвідувачі магазину.

Генеральна сукупність — це усі, про кого ваш висновок: усі активні підписники, усі відвідувачі сторінки оформлення замовлення за квартал, усі користувачі, що зареєструвалися в березні. Вибірка — частина, яку ви фактично спостерігаєте.

Точно назвати сукупність — перший крок будь-якого опитування чи експерименту, бо від цього залежить, кого можна запрошувати і на кого можна поширювати результат. «Наші користувачі» — не сукупність; «клієнти, які зробили хоча б одне замовлення за останні 90 днів» — так.

Її розмір важить менше, ніж здається. Для великої сукупності точність оцінки залежить від кількості відповідей, а не від частки охоплених людей: 385 відповідей дають близько ±5 пунктів, хай клієнтів 50 000 чи 5 мільйонів. Лише коли сукупність мала і ви охоплюєте помітну її частину, її розмір зменшує потрібну кількість (поправка на скінченну сукупність).

В експериментах сукупність часто не є фіксованим списком, а потоком майбутніх відвідувачів. Вибірка, на якій ви тестуєте цього місяця, представляє людей, які прийдуть пізніше, і це працює, лише якщо місяць типовий.

Приклад

Котокорм хоче дізнатися, скільки підписників перейшли б на вечірню доставку. Сукупність — «2000 підписників з активним тарифом сьогодні», а не «усі, хто колись замовляв».

Для ±5 пунктів і 95% величезній сукупності знадобилося б 385 відповідей. Оскільки в цій лише 2000 людей, поправка на скінченну сукупність зменшує число до 323. Якби в сукупності був 1 000 000 людей, відповідь була б 384, майже те саме, що 385.

Типові помилки

  • Опитувати одну групу, а звітувати про іншу. Відповіді читачів розсилки описують читачів розсилки, а не всіх клієнтів.
  • Думати, що велика сукупність потребує великої вибірки. Понад приблизно 100 000 людей потрібна кількість відповідей майже не зростає.
  • Залишати сукупність розмитою. Без чіткого визначення не видно, кого бракувало у вибірці.
  • Вважати, що місяць тесту представляє кожен місяць. Сезонність і кампанії змінюють, хто приходить.

Вивчити в курсі

  • Вибірки, генеральні сукупності та нормальний розподіл · Чому ми вивчаємо вибірки, щоб дізнатися про всіх користувачів, і чому дзвоноподібна крива трапляється всюди.
  • Розкид: розмах, SD і квартилі · Дві кур'єрські служби з однаковим середнім часом доставки, і чому обіцянку виконує лише одна: розмах, дисперсія, стандартне відхилення, квартилі, IQR і коефіцієнт варіації.
  • Викиди та скошені дані · Чому продуктові метрики мають довгі хвости, як знаходити викиди за правилом IQR і що з ними робити: виправляти помилки, сегментувати інших покупців і ніколи бездумно не видаляти «китів».
  • Довірчі інтервали · Діапазон правдоподібних значень замість одного числа.
  • ANOVA: порівняння багатьох груп · Перевірка трьох і більше варіантів одночасно без зростання хибнопозитивних результатів.