Диагностика Mock-интервью
Главная · Статистика для ML

Доверительные интервалы

Доверительный интервал — честный ответ вместо точечной оценки: формула x̄ ± t·s/√n, что на самом деле значат «95 %», интервалы для долей и бутстреп, симуляция ста интервалов и калькулятор.

Интуиция

«Accuracy модели — 0,87». Звучит как факт, но это оценка по одному тесту: другой тест того же размера дал бы 0,85 или 0,89. Точечная оценка (point estimate) врёт с уверенным лицом. Доверительный интервал (confidence interval, ДИ) врёт честно: «0,87, а на самом деле где-то между 0,83 и 0,91». Чем меньше данных, тем интервал шире — и это правильно: он показывает не только что мы знаем, но и сколько.

Метафора: ты кидаешь кольцо на колышек. Колышек (истинное значение μ) стоит на месте, а кольцо (интервал) каждый бросок ложится по-разному. «95-процентный» — это кольцо такого размера, что накрывает колышек в 95 бросках из 100. Свойство принадлежит методу броска, а не одному конкретному кольцу: уже брошенное кольцо либо накрыло колышек, либо нет.

Как это работает

Из ЦПТ известно: среднее по выборке отклоняется от истинного μ примерно нормально с разбросом SE = σ/√n, и в 95 % случаев отклонение не превышает 1,96 SE. Переворачиваем утверждение: если отступить от на 1,96 SE в обе стороны, в 95 % случаев μ окажется внутри:

ДИ = x̄ ± z · σ/√n,   z = 1,645 (90 %), 1,96 (95 %), 2,576 (99 %)

Величину z·SE называют погрешностью (margin of error) — это полуширина интервала. В формуле две ручки: уровень доверия (confidence level) и объём данных. Хочешь надёжнее — интервал шире; хочешь уже — собирай данные, причём вдвое уже стоит вчетверо больше наблюдений.

Истинную σ мы не знаем и подставляем выборочное стандартное отклонение s. Но s по маленькой выборке само шумит, и если делать вид, что это точная σ, интервалы получатся слишком узкими — они будут промахиваться чаще обещанного. Поправку вносит t-распределение Стьюдента (Student's t-distribution) с n − 1 степенями свободы: его хвосты тяжелее нормальных, критическое значение больше, интервал шире. При n = 5 для 95 % берём t = 2,78 вместо 1,96; при n = 30 — 2,05; при n → ∞ t совпадает с z.

ДИ = x̄ ± tn−1 · s/√n

Для долей (accuracy, конверсия, доля успешных запросов) наблюдения — нули и единицы, и σ = √(p(1−p)). Простейший интервал Вальда (Wald interval) — p̂ ± z·√(p̂(1−p̂)/n) — ломается на краях: при 0 успехах из 20 он даёт [0; 0], хотя по 20 наблюдениям нельзя утверждать, что вероятность успеха ровно ноль. Интервал Уилсона (Wilson score interval) сдвигает центр к 0,5 и на краях ведёт себя правильно; именно его считает калькулятор ниже.

💡 Ключевая мысль «95 %» — надёжность процедуры, а не вероятность для конкретного интервала: если строить интервалы по такому рецепту много раз, около 95 % из них накроют истину. Один готовый интервал либо накрыл её, либо нет — мы просто не знаем, что случилось на этот раз.

Калькулятор

Два типовых случая. Среднее: латентность, длина ответа, средний чек — нужны n, x̄ и s, интервал строится через t-распределение. Доля: accuracy, конверсия, recall — нужны число успехов k и число испытаний n, считается интервал Уилсона (для сравнения показан и Вальда). Подставь свои цифры и сравни: 87 правильных из 100 и 870 из 1000 — одна и та же accuracy, но интервалы отличаются по ширине втрое.

Интервалы в ML на практике

⚠️ Подводный камень Перекрывающиеся интервалы двух моделей — A: [0,80; 0,86], B: [0,84; 0,90] — не доказывают, что разницы нет. Два интервала могут перекрываться, а интервал для разницы B − A — не содержать ноль, особенно если модели оценены на одном и том же тесте. Сравнивай разницу, а не картинки.
🎤 На собеседовании
  • «Что значит 95-процентный доверительный интервал?» — при многократном повторении процедуры 95 % построенных интервалов накроют истинное значение; говорить «вероятность 95 %» про конкретный интервал некорректно.
  • «Почему t-распределение, а не нормальное?» — σ оценена по выборке и сама случайна; t с n − 1 степенями свободы учитывает эту неопределённость, а при больших n сходится к z.
  • «Как получить интервал для AUC или NDCG?» — бутстреп по тестовой выборке: ресэмплинг с возвращением, перцентили распределения метрики.
  • «Как сузить интервал вдвое?» — вчетверо больше данных; снижение уровня доверия тоже сужает интервал, но ценой надёжности.