Глоссарий: Статистика для ML
24 термина раздела «Статистика для ML» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.
- Альтернативная гипотезаalternative hypothesis, H1
- Утверждение, принимаемое при отвержении нулевой: эффект есть, среднее больше заявленного. Задаётся до просмотра данных; её направление определяет, одно- или двусторонним будет тест.Разбор: P-value и проверка гипотез
- Выборкаsample
- Наблюдаемая часть генеральной совокупности, по которой оценивают её свойства. Любая статистика по выборке — среднее, accuracy, конверсия — случайна и меняется от выборки к выборке.Разбор: Выборка, ЦПТ и стандартная ошибка
- Выборочное распределениеsampling distribution
- Распределение статистики (например, среднего) при многократном повторении выборки того же размера. Его ширина показывает, насколько оценке можно доверять.Разбор: Выборка, ЦПТ и стандартная ошибка
- Генеральная совокупностьpopulation
- Всё множество объектов, о котором мы хотим сделать вывод: все запросы к модели, все пользователи, все возможные тестовые примеры. Целиком её никогда не наблюдают — судят по выборке.Разбор: Выборка, ЦПТ и стандартная ошибка
- Доверительный интервалconfidence interval, CI
- Диапазон вокруг оценки, построенный так, что при многократном повторении эксперимента заданная доля таких интервалов (обычно 95 %) накрывает истинное значение. Для среднего: x̄ ± t·s/√n.Разбор: Доверительные интервалы
- Закон больших чиселlaw of large numbers
- Среднее по выборке сходится к истинному среднему совокупности с ростом числа наблюдений. Говорит, куда сходится оценка; как быстро и с каким разбросом — уточняет ЦПТ.Разбор: Выборка, ЦПТ и стандартная ошибка
- Интервал УилсонаWilson score interval
- Доверительный интервал для доли (accuracy, конверсии), который корректно ведёт себя при малых n и долях около 0 или 1, в отличие от простого интервала Вальда p̂ ± z·√(p̂(1−p̂)/n).Разбор: Доверительные интервалы
- Множественные сравненияmultiple comparisons
- Проверка многих гипотез сразу, из-за которой часть «значимых» результатов оказывается случайной: из 20 тестов на уровне 0,05 один в среднем ложный. Лечится поправкой Бонферрони или контролем FDR.Разбор: P-value и проверка гипотез
- Мощностьstatistical power
- Вероятность эксперимента обнаружить эффект, когда он действительно есть; обычно целятся в 80%. При маленькой выборке и слабом эффекте реальное улучшение утонет в шуме.Разбор: A/B-тесты и продуктовые метрики · P-value и проверка гипотез
- Нормальное распределениеnormal distribution
- Симметричное колоколообразное распределение, заданное средним μ и стандартным отклонением σ. По ЦПТ к нему стремятся выборочные средние, поэтому на нём построены интервалы и тесты.Разбор: Выборка, ЦПТ и стандартная ошибка
- Нулевая гипотезаnull hypothesis, H0
- «Скучное» объяснение данных, которое проверяет тест: эффекта нет, среднее равно заявленному, модели не различаются. P-value измеряет, насколько данные с ней несовместимы.Разбор: P-value и проверка гипотез
- Ошибка I родаtype I error
- Отвержение верной нулевой гипотезы — ложная тревога: «увидели эффект, которого нет». Её вероятность задаётся уровнем значимости α.Разбор: P-value и проверка гипотез
- Ошибка II родаtype II error
- Пропуск реального эффекта: нулевая гипотеза ложна, но данных не хватило её отвергнуть. Её вероятность β; мощность теста равна 1 − β и растёт с размером выборки.Разбор: P-value и проверка гипотез
- Погрешностьmargin of error
- Полуширина доверительного интервала: критическое значение, умноженное на стандартную ошибку. Уменьшается как корень из объёма данных — вдвое уже стоит вчетверо больше наблюдений.Разбор: Доверительные интервалы
- Правило 68–95–99.768-95-99.7 rule
- Для нормального распределения около 68 % значений лежат в пределах ±1σ от среднего, 95 % — в пределах ±2σ (точнее 1,96σ), 99,7 % — в пределах ±3σ.Разбор: Выборка, ЦПТ и стандартная ошибка
- Стандартная ошибкаstandard error, SE
- Стандартное отклонение оценки (обычно среднего) от выборки к выборке: SE = σ/√n. В отличие от стандартного отклонения данных, уменьшается с ростом выборки, но только как корень из n.Разбор: Выборка, ЦПТ и стандартная ошибка
- Стандартное отклонениеstandard deviation, SD
- Мера разброса отдельных наблюдений вокруг среднего — корень из дисперсии. Свойство самих данных: от размера выборки не зависит, в отличие от стандартной ошибки.Разбор: Выборка, ЦПТ и стандартная ошибка
- Статистическая значимостьstatistical significance
- Результат, при котором p-value не превышает уровня значимости и нулевая гипотеза отвергается. Не означает практической важности: при большом n значимым становится любое отклонение.Разбор: P-value и проверка гипотез
- Точечная оценкаpoint estimate
- Одно число, оценивающее параметр совокупности по выборке: выборочное среднее, accuracy на тесте, доля конверсий. Без интервала не показывает, насколько ей можно верить.Разбор: Доверительные интервалы
- Уровень доверияconfidence level
- Надёжность процедуры построения интервалов: доля интервалов, накрывающих истину при повторениях. Выше уровень — шире интервал; 95 % соответствует критическому z = 1,96.Разбор: Доверительные интервалы
- Уровень значимостиsignificance level, alpha
- Порог для p-value, выбранный до эксперимента (обычно 0,05): при p ≤ α нулевую гипотезу отвергают. Равен допустимой частоте ложных тревог — ошибок I рода.Разбор: P-value и проверка гипотез
- Центральная предельная теоремаcentral limit theorem, CLT
- Среднее по выборке из n независимых наблюдений с конечной дисперсией распределено приближённо нормально с центром μ и разбросом σ/√n, какой бы ни была форма исходного распределения.Разбор: Выборка, ЦПТ и стандартная ошибка
- P-valuep-value
- Вероятность увидеть такую или ещё более экстремальную разницу между группами, если на самом деле эффекта нет. Это не вероятность того, что эффекта нет, — частая ловушка на собеседовании.Разбор: A/B-тесты и продуктовые метрики · P-value и проверка гипотез
- t-распределение СтьюдентаStudent's t-distribution
- Распределение с более тяжёлыми хвостами, чем у нормального, используемое вместо него, когда σ оценена по выборке. Задаётся числом степеней свободы n − 1; при больших n совпадает с нормальным.Разбор: Доверительные интервалы