Доверительные интервалы
Доверительный интервал — честный ответ вместо точечной оценки: формула x̄ ± t·s/√n, что на самом деле значат «95 %», интервалы для долей и бутстреп, симуляция ста интервалов и калькулятор.
Интуиция
«Accuracy модели — 0,87». Звучит как факт, но это оценка по одному тесту: другой тест того же размера дал бы 0,85 или 0,89. Точечная оценка (point estimate) врёт с уверенным лицом. Доверительный интервал (confidence interval, ДИ) врёт честно: «0,87, а на самом деле где-то между 0,83 и 0,91». Чем меньше данных, тем интервал шире — и это правильно: он показывает не только что мы знаем, но и сколько.
Метафора: ты кидаешь кольцо на колышек. Колышек (истинное значение μ) стоит на месте, а кольцо (интервал) каждый бросок ложится по-разному. «95-процентный» — это кольцо такого размера, что накрывает колышек в 95 бросках из 100. Свойство принадлежит методу броска, а не одному конкретному кольцу: уже брошенное кольцо либо накрыло колышек, либо нет.
Как это работает
Из ЦПТ известно: среднее по выборке x̄ отклоняется от истинного μ примерно нормально с разбросом SE = σ/√n, и в 95 % случаев отклонение не превышает 1,96 SE. Переворачиваем утверждение: если отступить от x̄ на 1,96 SE в обе стороны, в 95 % случаев μ окажется внутри:
Величину z·SE называют погрешностью (margin of error) — это полуширина интервала. В формуле две ручки: уровень доверия (confidence level) и объём данных. Хочешь надёжнее — интервал шире; хочешь уже — собирай данные, причём вдвое уже стоит вчетверо больше наблюдений.
Истинную σ мы не знаем и подставляем выборочное стандартное отклонение s. Но s по маленькой выборке само шумит, и если делать вид, что это точная σ, интервалы получатся слишком узкими — они будут промахиваться чаще обещанного. Поправку вносит t-распределение Стьюдента (Student's t-distribution) с n − 1 степенями свободы: его хвосты тяжелее нормальных, критическое значение больше, интервал шире. При n = 5 для 95 % берём t = 2,78 вместо 1,96; при n = 30 — 2,05; при n → ∞ t совпадает с z.
Для долей (accuracy, конверсия, доля успешных запросов) наблюдения — нули и единицы, и σ = √(p(1−p)). Простейший интервал Вальда (Wald interval) — p̂ ± z·√(p̂(1−p̂)/n) — ломается на краях: при 0 успехах из 20 он даёт [0; 0], хотя по 20 наблюдениям нельзя утверждать, что вероятность успеха ровно ноль. Интервал Уилсона (Wilson score interval) сдвигает центр к 0,5 и на краях ведёт себя правильно; именно его считает калькулятор ниже.
Калькулятор
Два типовых случая. Среднее: латентность, длина ответа, средний чек — нужны n, x̄ и s, интервал строится через t-распределение. Доля: accuracy, конверсия, recall — нужны число успехов k и число испытаний n, считается интервал Уилсона (для сравнения показан и Вальда). Подставь свои цифры и сравни: 87 правильных из 100 и 870 из 1000 — одна и та же accuracy, но интервалы отличаются по ширине втрое.
Интервалы в ML на практике
- Метрики на тесте. Любую долю (accuracy, precision, recall, pass@1) сопровождай интервалом Уилсона. При 100 примерах его полуширина — 6–7 п.п.; сравнивать модели по разнице в один пункт на такой выборке бессмысленно.
- Сложные метрики — бутстреп. Для AUC, F1, NDCG, BLEU готовой формулы нет. Бутстреп (bootstrap) обходит это в лоб: из тестовой выборки много раз (1000+) вытаскиваем с возвращением выборку того же размера, каждый раз считаем метрику и берём 2,5-й и 97,5-й перцентили полученных значений. Ту же процедуру применяют к LLM-бенчмаркам.
- Сравнение двух моделей. Строй интервал для разницы метрик на одних и тех же примерах (парный бутстреп), а не два отдельных интервала: парный интервал уже, потому что «трудные» примеры одинаково трудны для обеих моделей.
- Байесовская альтернатива. Байесовский credible interval действительно означает «с вероятностью 95 % параметр здесь» — но при заданном априорном распределении. Частотный ДИ обходится без априорных предположений и потому формулируется осторожнее.
- «Что значит 95-процентный доверительный интервал?» — при многократном повторении процедуры 95 % построенных интервалов накроют истинное значение; говорить «вероятность 95 %» про конкретный интервал некорректно.
- «Почему t-распределение, а не нормальное?» — σ оценена по выборке и сама случайна; t с n − 1 степенями свободы учитывает эту неопределённость, а при больших n сходится к z.
- «Как получить интервал для AUC или NDCG?» — бутстреп по тестовой выборке: ресэмплинг с возвращением, перцентили распределения метрики.
- «Как сузить интервал вдвое?» — вчетверо больше данных; снижение уровня доверия тоже сужает интервал, но ценой надёжности.