Диагностика Mock-интервью
Главная · Статистика для ML

Выборка, ЦПТ и стандартная ошибка

Почему средние по выборкам ложатся в колокол: центральная предельная теорема, стандартная ошибка σ/√n и правило 68–95–99.7 — с симулятором, где выборки набираются на глазах.

Интуиция

Ты замерил латентность модели на 50 запросах: в среднем 118 мс. Коллега замерил на других 50 — у него 123 мс. Кто прав? Оба и никто: вы смотрите на разные выборки (sample) из одной генеральной совокупности (population) — всех запросов, которые модель когда-либо получит. Совокупность целиком мы не видим никогда: ни всех пользователей, ни всех тестовых примеров, ни всех доставок пиццы. Мы видим кусочек и по нему судим о целом.

Отсюда главный сдвиг в мышлении: выборочное среднее (sample mean) — само случайная величина. Возьми другую выборку — получишь другое число. Вопрос статистики не «чему равно среднее», а «насколько сильно оно скачет от выборки к выборке». Если скачет на ±1 мс — разница между 118 и 123 реальна. Если на ±10 — это шум.

Как это работает

Представь, что мы повторили замер тысячу раз и построили гистограмму тысячи средних. Это выборочное распределение (sampling distribution) среднего. Про него известны две вещи, и вместе они составляют центральную предельную теорему (central limit theorem, ЦПТ):

Ширина этого колокола называется стандартной ошибкой (standard error, SE):

SE = σ / √n

где σ — стандартное отклонение (standard deviation, SD) отдельных наблюдений, а n — размер выборки. Корень — самая важная деталь формулы: чтобы уменьшить ошибку вдвое, нужно вчетверо больше данных; чтобы в десять раз — в сто раз больше. Точность растёт с данными, но медленно.

А раз распределение нормальное, работает правило 68–95–99.7: в 68 % выборок среднее ляжет в пределах ±1 SE от μ, в 95 % — в пределах ±2 SE (точнее 1,96), в 99,7 % — ±3 SE. Именно отсюда вырастут доверительные интервалы и p-value: обе конструкции — просто способы читать этот колокол.

Вернёмся к латентности: если σ ≈ 30 мс, то при n = 50 имеем SE ≈ 4,2 мс. Разница 118 против 123 — чуть больше одной стандартной ошибки; такое сплошь и рядом случается при одной и той же модели. Чтобы уверенно ловить разницу в 5 мс, выборки нужны на сотни запросов.

💡 Ключевая мысль Любое среднее по выборке — accuracy на тесте, латентность, конверсия — это одна реализация случайной величины с разбросом σ/√n. Пока не прикинул этот разброс, ты не знаешь, сравниваешь модели или шум.

Когда ЦПТ подводит

Магическое «n ≥ 30» из учебников — эвристика, а не закон. Сколько наблюдений нужно, зависит от формы данных: для симметричных распределений колокол появляется уже при n = 5–10, для сильно скошенных (латентность с редкими многосекундными таймаутами, доходы, длины текстов) — при сотнях. Поиграй с n в интерактиве на скошенном распределении: при n = 3 гистограмма средних ещё заметно перекошена вправо, при n = 30 от перекоса не остаётся следа.

Три ситуации, где формула SE = σ/√n врёт всерьёз:

Где это прячется в ML

⚠️ Подводный камень Стандартное отклонение и стандартная ошибка — разные вещи. SD описывает разброс отдельных наблюдений и с ростом n не уменьшается; SE описывает точность оценки среднего и падает как 1/√n. Запись «accuracy 0,87 ± 0,02» бессмысленна, пока не сказано, что стоит после ±: SD по фолдам, SE среднего или доверительный интервал.
🎤 На собеседовании
  • «Сформулируй ЦПТ» — среднее по выборке из n независимых наблюдений с конечной дисперсией распределено примерно нормально с центром μ и разбросом σ/√n, какой бы ни была форма исходного распределения.
  • «Чем стандартная ошибка отличается от стандартного отклонения?» — SD про данные, SE про оценку; SE = SD/√n и уменьшается с ростом выборки.
  • «Модель A дала 0,91, модель B — 0,92 на тесте из 500 примеров. Какая лучше?» — прикинь SE ≈ √(0,9·0,1/500) ≈ 1,3 п.п.: разница в 1 п.п. в пределах шума, нужен парный тест или больше данных.
  • «Во сколько раз увеличить выборку, чтобы вдвое сузить разброс оценки?» — вчетверо, из-за корня в формуле.