# Доверительные интервалы

> Доверительный интервал — честный ответ вместо точечной оценки: формула x̄ ± t·s/√n, что на самом деле значат «95 %», интервалы для долей и бутстреп, симуляция ста интервалов и калькулятор.

Раздел: [Статистика для ML](https://ml-book.com/s/statistics/) · Страница темы: https://ml-book.com/t/confidence-intervals/ · Обновлено: 2026-09-16 · Источник: ml-book.com, учебник делается сообществом

## Интуиция

«Accuracy модели — 0,87». Звучит как факт, но это оценка по одному тесту: другой тест того же размера дал бы 0,85 или 0,89. **Точечная оценка** (point estimate) врёт с уверенным лицом. **Доверительный интервал** (confidence interval, ДИ) врёт честно: «0,87, а на самом деле где-то между 0,83 и 0,91». Чем меньше данных, тем интервал шире — и это правильно: он показывает не только *что* мы знаем, но и *сколько*.

Метафора: ты кидаешь кольцо на колышек. Колышек (истинное значение μ) стоит на месте, а кольцо (интервал) каждый бросок ложится по-разному. «95-процентный» — это кольцо такого размера, что накрывает колышек в 95 бросках из 100. Свойство принадлежит *методу броска*, а не одному конкретному кольцу: уже брошенное кольцо либо накрыло колышек, либо нет.

## Как это работает

Из [ЦПТ](https://ml-book.com/t/sampling-clt/) известно: среднее по выборке x̄ отклоняется от истинного μ примерно нормально с разбросом SE = σ/√n, и в 95 % случаев отклонение не превышает 1,96 SE. Переворачиваем утверждение: если отступить от x̄ на 1,96 SE в обе стороны, в 95 % случаев μ окажется внутри:

`ДИ = x̄ ± z · σ/√n, z = 1,645 (90 %), 1,96 (95 %), 2,576 (99 %)`

Величину z·SE называют **погрешностью** (margin of error) — это полуширина интервала. В формуле две ручки: **уровень доверия** (confidence level) и объём данных. Хочешь надёжнее — интервал шире; хочешь уже — собирай данные, причём вдвое уже стоит вчетверо больше наблюдений.

Истинную σ мы не знаем и подставляем выборочное стандартное отклонение s. Но s по маленькой выборке само шумит, и если делать вид, что это точная σ, интервалы получатся слишком узкими — они будут промахиваться чаще обещанного. Поправку вносит **t-распределение Стьюдента** (Student's t-distribution) с n − 1 степенями свободы: его хвосты тяжелее нормальных, критическое значение больше, интервал шире. При n = 5 для 95 % берём t = 2,78 вместо 1,96; при n = 30 — 2,05; при n → ∞ t совпадает с z.

`ДИ = x̄ ± t_{n−1} · s/√n`

**Для долей** (accuracy, конверсия, доля успешных запросов) наблюдения — нули и единицы, и σ = √(p(1−p)). Простейший интервал Вальда (Wald interval) — p̂ ± z·√(p̂(1−p̂)/n) — ломается на краях: при 0 успехах из 20 он даёт [0; 0], хотя по 20 наблюдениям нельзя утверждать, что вероятность успеха ровно ноль. Интервал Уилсона (Wilson score interval) сдвигает центр к 0,5 и на краях ведёт себя правильно; именно его считает калькулятор ниже.

> **💡 Ключевая мысль**
>
> «95 %» — надёжность процедуры, а не вероятность для конкретного интервала: если строить интервалы по такому рецепту много раз, около 95 % из них накроют истину. Один готовый интервал либо накрыл её, либо нет — мы просто не знаем, что случилось на этот раз.

> 🎛 Интерактивная визуализация — на странице темы: https://ml-book.com/t/confidence-intervals/

## Калькулятор

Два типовых случая. **Среднее**: латентность, длина ответа, средний чек — нужны n, x̄ и s, интервал строится через t-распределение. **Доля**: accuracy, конверсия, recall — нужны число успехов k и число испытаний n, считается интервал Уилсона (для сравнения показан и Вальда). Подставь свои цифры и сравни: 87 правильных из 100 и 870 из 1000 — одна и та же accuracy, но интервалы отличаются по ширине втрое.

> 🎛 Интерактивная визуализация — на странице темы: https://ml-book.com/t/confidence-intervals/

## Интервалы в ML на практике

- **Метрики на тесте.** Любую долю (accuracy, precision, recall, pass@1) сопровождай интервалом Уилсона. При 100 примерах его полуширина — 6–7 п.п.; сравнивать модели по разнице в один пункт на такой выборке бессмысленно.
- **Сложные метрики — бутстреп.** Для AUC, F1, NDCG, BLEU готовой формулы нет. **Бутстреп** (bootstrap) обходит это в лоб: из тестовой выборки много раз (1000+) вытаскиваем с возвращением выборку того же размера, каждый раз считаем метрику и берём 2,5-й и 97,5-й перцентили полученных значений. Ту же процедуру применяют к LLM-бенчмаркам.
- **Сравнение двух моделей.** Строй интервал для *разницы* метрик на одних и тех же примерах (парный бутстреп), а не два отдельных интервала: парный интервал уже, потому что «трудные» примеры одинаково трудны для обеих моделей.
- **Байесовская альтернатива.** Байесовский credible interval действительно означает «с вероятностью 95 % параметр здесь» — но при заданном априорном распределении. Частотный ДИ обходится без априорных предположений и потому формулируется осторожнее.

> **⚠️ Подводный камень**
>
> Перекрывающиеся интервалы двух моделей — A: [0,80; 0,86], B: [0,84; 0,90] — не доказывают, что разницы нет. Два интервала могут перекрываться, а интервал для разницы B − A — не содержать ноль, особенно если модели оценены на одном и том же тесте. Сравнивай разницу, а не картинки.

> **🎤 На собеседовании**
>
> - «Что значит 95-процентный доверительный интервал?» — при многократном повторении процедуры 95 % построенных интервалов накроют истинное значение; говорить «вероятность 95 %» про конкретный интервал некорректно.
> - «Почему t-распределение, а не нормальное?» — σ оценена по выборке и сама случайна; t с n − 1 степенями свободы учитывает эту неопределённость, а при больших n сходится к z.
> - «Как получить интервал для AUC или NDCG?» — бутстреп по тестовой выборке: ресэмплинг с возвращением, перцентили распределения метрики.
> - «Как сузить интервал вдвое?» — вчетверо больше данных; снижение уровня доверия тоже сужает интервал, но ценой надёжности.

## Связанные темы

- [Выборка, ЦПТ и стандартная ошибка](https://ml-book.com/t/sampling-clt/)
- [P-value и проверка гипотез](https://ml-book.com/t/p-value/)
- [A/B-тесты и продуктовые метрики](https://ml-book.com/t/ab-testing/)
- [Метрики качества](https://ml-book.com/t/metrics/)

---

Интерактив, тест из 12 вопросов и карточки терминов — на странице темы: https://ml-book.com/t/confidence-intervals/
Весь учебник в markdown: https://ml-book.com/llms-full.txt · Оглавление для агентов: https://ml-book.com/llms.txt
