Перейти до змісту
Увійти

Калькулятор розміру вибірки для опитування

Дізнайтеся, скільки відповідей потрібно для опитування, скільки людей запросити і наскільки точні відповіді, які ви вже маєте.

Порівнюєте дві версії сторінки чи листа? Скористайтеся калькулятором розміру вибірки для A/B-тесту

Не зрозуміло, як кілька сотень відповідей можуть описати тисячі людей? Безкоштовний урок пояснює, що таке вибірка і генеральна сукупність. Дізнатися, як працюють вибірка і генеральна сукупність

Ваше опитування

Рівень довіри

Зазвичай обирають 95%.

Наскільки ваш результат може відрізнятися від справжньої частки.

Скільки всього людей ви могли б опитати. Залиште порожнім, якщо їх дуже багато або число невідоме.

Додаткові параметриОчікувана частка 50%, частка відповідей 20%

Ваше найкраще припущення про частку такої відповіді. Якщо не впевнені, залиште 50%: це найбезпечніше (найбільше) число.

Яка частка запрошених, на вашу думку, відповість. Додає кількість запрошень, які треба надіслати.

Що вводити в ці поля
Рівень довіри
Як часто діапазони, побудовані цим методом, містили б справжню частку, якби ви провели опитування багато разів. 99% обережніше і потребує більше відповідей; 90% потребує менше, але частіше помиляється.
Допустима похибка (± відсоткових пунктів)
± навколо частки, яку ви покажете в звіті. ±5 відсоткових пунктів означає, що результат 40% відповідає справжній частці десь між 35% і 45%. Від 0,1 до 25 і менше за очікувану частку та за 100% мінус неї.
Розмір генеральної сукупності
Усі, кого має описувати результат, наприклад усі 2000 активних підписників. Ціле число від 2 до 1 000 000 000. Понад приблизно 100 000 людей воно майже не змінює відповідь.
Очікувана частка (%)
Частка людей, які, як ви очікуєте, дадуть потрібну вам відповідь, від 1% до 99%. Для 50% потрібно найбільше відповідей, тож план із нею годиться для кожного запитання «так/ні» в опитуванні.
Очікувана частка відповідей (%)
Необов'язково, від 0,1% до 100%. Візьміть частку з ваших попередніх опитувань. Типового значення ми не наводимо: воно надто залежить від аудиторії та каналу.

323 відповіді · 1 615 запрошень

Результат

Оновлюється під час введення

Потрібно відповідей
323 відповіді
для ±5 в. п. з рівнем довіри 95%, очікувана частка 50%, генеральна сукупність 2 000

Надішліть приблизно 1 615 запрошень, якщо відповість 20%

  • Розмір генеральної сукупності зменшив це число (поправка на скінченну сукупність).

Інші значення похибки

Той самий рівень довіри (95%), очікувана частка (50%) і генеральна сукупність (2 000) з меншою або більшою похибкою.

  • ±3 в. п.

    697 відповідей

  • ±5 в. п.ваша похибка

    323 відповіді

  • ±10 в. п.

    92 відповіді

Як це читати

  • Це кількість заповнених відповідей, а не запрошених людей. Похибка стосується всієї вибірки: для її частини вона ширша.
  • Це число захищає від невдачі в тому, хто саме випадково відповів, але не від зміщеного списку чи людей, які вирішили не відповідати. Прочитайте застереження, перш ніж надсилати
Результат: 323 відповіді.

Як читати результат

«Потрібно відповідей» — це кількість заповнених відповідей, за якої результат не вийде за обрану похибку з обраним рівнем довіри. Для ±5 відсоткових пунктів і 95% результат 40% означає, що справжня частка серед усіх, найімовірніше, між 35% і 45%.

Частка відповідей перетворює це число на кількість запрошень. Це припущення, тому запрошення — другий рядок, а не головний результат: якщо відповідей менше, ніж очікували, тримайте опитування відкритим або надішліть нагадування, доки не наберете потрібну кількість, а не знижуйте планку.

Вкладка «Похибка для моєї вибірки» працює навпаки: відповіді у вас уже є, і вона показує, наскільки виміряна частка може відрізнятися від частки серед усіх.

Приклад

Котокорм, онлайн-магазин кормів для тварин, має 2000 активних підписників і хоче дізнатися, яка частка з них перейшла б на вечірню доставку. Команда хоче похибку ±5 відсоткових пунктів із рівнем довіри 95% і очікує, що відповідять приблизно 20% запрошених.

Для великої сукупності знадобилося б 385 відповідей. Оскільки вся група — лише 2000 людей, поправка на скінченну сукупність зменшує це число до 323 відповідей. За частки відповідей 20% це означає приблизно 1615 запрошень.

Перевірте в іншій вкладці: 323 відповіді з 2000 за частки 50% дають похибку 4,994 відсоткового пункта (після округлення ±5,0), тобто в межах обіцяних 5. З 322 відповідями було б 5,004: саме округлення вгору дотримує обіцянки.

Перш ніж надсилати опитування

Формула враховує лише один вид помилки: випадковість у тому, хто потрапив у вибірку. Ці п'ять речей важать щонайменше стільки ж.

  1. Похибка враховує випадковість, а не зміщення. Формула припускає, що ті, хто відповів, — випадкова вибірка з усіх. Якщо відповіли 20%, а 80% мовчать, відповіді можуть бути від найзадоволеніших (або найсердитіших) клієнтів. Більша вибірка цього не виправить: вона лише зробить зміщене число точнішим на вигляд. Що допомагає: запрошувати випадковий список, а не тих, хто під рукою, надіслати одне нагадування, порівняти ранні й пізні відповіді та вказувати частку відповідей поруч із результатом. Репрезентативна вибірка — це про те, хто відповідає, а не скільки. Як вибірка представляє генеральну сукупність
  2. Посилання в спільноті — це не вибірка. Відповіді за посиланням у розсилці, дописі в соцмережах чи банері в застосунку дають люди, які самі вирішили відповісти. Немає сукупності, яку вони представляють, тож похибка вибірки до них не застосовна. Сприймайте такі відповіді як якісні дані: вони показують, що думають деякі люди, а не скільки людей так думає. З ким саме розмовляти
  3. Похибка стосується всієї вибірки, а не сегментів. Якщо відповіли 323 людини, а 60 з них мають річний тариф, похибка для «підписників на річному тарифі» — це похибка для 60 відповідей: перевірте її в другій вкладці. Порівняння двох сегментів між собою — це запитання про дві групи. Сплануйте порівняння двох груп у калькуляторі розміру вибірки для A/B-тесту
  4. Запитання про майбутнє вимірюють ввічливість. «Чи користувалися б ви вечірньою доставкою?» збирає оптимістичні припущення, а точна оцінка припущення — все одно припущення. Де можливо, питайте про те, що люди робили нещодавно. Чому відповіді про майбутнє вводять в оману
  5. Багато запитань, одна похибка. Значення 50% за замовчуванням тримає похибку в межах для всіх запитань «так/ні» в опитуванні одночасно. Якщо ви плануєте з 20%, а ключове запитання дасть близько 50%, його похибка буде ширшою за заплановану. Як ширина діапазону залежить від частки

Метод і формули

Калькулятор використовує нормальне наближення, яке зазвичай застосовують сервіси опитувань, тож наші числа можна з ними порівняти. q — квантиль нормального розподілу для рівня довіри (1,645, 1,960 або 2,576), p — очікувана частка, e — похибка, обидві як частки від одиниці:

n₀ = q² × p(1 − p) / e²
n  = n₀ / (1 + (n₀ − 1) / N)
responses   = ⌈n⌉
invitations = ⌈responses / r⌉
margin = q × √(p(1 − p) / n) × √((N − n) / (N − 1))

Поправка на скінченну сукупність (другий рядок) зменшує число, коли сукупність невелика: для 2000 людей 385 стає 323, для 1 000 000 — 384 замість 385. Кількість відповідей округлюється вгору, щоб обіцяна похибка справджувалася, а запрошення рахуються від уже округленої кількості відповідей.

Без генеральної сукупності перший рядок — та сама формула, що й на вкладці «Спланувати точність» калькулятора довірчого інтервалу, тож обидва інструменти дають однакове число. Вкладка похибки використовує звичну для опитувань похибку з тією самою поправкою. Біля 0% чи 100% або коли відповідей з одного боку мало, ця похибка працює погано; інтервал Вілсона в калькуляторі довірчого інтервалу залишається між 0% і 100%.

Запитання і відповіді

Чому так часто виходить 385?
Це число для найпоширеніших налаштувань: рівень довіри 95%, ±5 відсоткових пунктів, очікувана частка 50% і велика сукупність. 1,96² × 0,5 × 0,5 / 0,05² = 384,1, з округленням угору — 385.
Чи важливий розмір генеральної сукупності?
Понад приблизно 100 000 людей — майже ні: мільйону людей потрібно 384 відповіді проти 385 для невідомої великої групи. Для малих груп — дуже: 2000 людям потрібно 323 відповіді, а 100 людям — 80. Точність залежить від кількості відповідей, а не від частки сукупності, яку ви охопили.
Навіщо брати 50%, якщо я очікую інше?
Похибка найширша, коли частка дорівнює 50%, тож 50% дає найбільше, найбезпечніше число. В опитуванні багато запитань, і план із 50% тримає в межах похибки кожне запитання «так/ні». Власне припущення беріть лише тоді, коли важливе одне запитання і ви досить упевнені в його діапазоні.
Чим рівень довіри відрізняється від похибки?
Похибка — це ширина: наскільки результат може відрізнятися від правди (±5 пунктів). Рівень довіри (у соціології кажуть «довірча ймовірність») — як часто діапазони, побудовані цим методом, містили б правду, якби ви повторювали опитування (95%). Посилення будь-якого з них потребує більше відповідей.
На яку частку відповідей розраховувати?
Орієнтира ми не даємо: частка залежить від аудиторії, каналу, винагороди та довжини опитування, і будь-яке одне число вводило б в оману. Візьміть частку з ваших попередніх опитувань. Якщо таких немає, плануйте низьку частку, надішліть одне нагадування і тримайте опитування відкритим, доки не наберете потрібну кількість.
Чи можна використати калькулятор для опитування, опублікованого в соцмережах?
Ні. Люди, які самі вирішили відповісти на публічний допис, не є випадковою вибіркою з жодної сукупності, тож похибка вибірки їх не описує. Читайте такі відповіді як якісні дані.
Чим це відрізняється від калькулятора розміру вибірки для A/B-тесту?
Цей калькулятор планує точність однієї частки в одній групі, а невелика сукупність зменшує число. Калькулятор для A/B-тесту планує, скільки людей потрібно кожній із двох груп, щоб помітити різницю між ними зі статистичною потужністю, і зазвичай вимагає значно більше людей.
Похибка завелика. Що робити?
Зберіть більше відповідей для всієї вибірки: щоб зменшити похибку вдвічі, потрібно приблизно вчетверо більше. Діліть результати на менше сегментів, бо кожен сегмент має власну, ширшу похибку. Або прийміть ширшу похибку для другорядних запитань і плануйте вибірку під одне найважливіше запитання.

Дізнатися більше

Порівнюєте дві групи?

Щоб перевірити, чи справді відрізняються відповіді двох груп, наприклад чоловіків і жінок або двох тарифів: калькулятор статистичної значущості

Терміни на цій сторінці