Статистика для ML
Статистика, без которой нельзя честно сравнивать модели: выборки и центральная предельная теорема, стандартная ошибка, доверительные интервалы с калькулятором, p-value и проверка гипотез.
3 темы, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.
1. Выборка, ЦПТ и стандартная ошибка
Почему средние по выборкам ложатся в колокол: центральная предельная теорема, стандартная ошибка σ/√n и правило 68–95–99.7 — с симулятором, где выборки набираются на глазах.
На собеседовании спросят: «Сформулируй ЦПТ»
2. Доверительные интервалы
Доверительный интервал — честный ответ вместо точечной оценки: формула x̄ ± t·s/√n, что на самом деле значат «95 %», интервалы для долей и бутстреп, симуляция ста интервалов и калькулятор.
На собеседовании спросят: «Что значит 95-процентный доверительный интервал?»
3. P-value и проверка гипотез
P-value простыми словами: нулевая гипотеза, уровень значимости 0,05, ошибки I и II рода, одно- и двусторонние тесты — и почему p = 0,03 не значит «эффект есть с вероятностью 97 %». С интерактивом.
На собеседовании спросят: «Что такое p-value?»