Диагностика Mock-интервью
Главная · Раздел

Статистика для ML

Статистика, без которой нельзя честно сравнивать модели: выборки и центральная предельная теорема, стандартная ошибка, доверительные интервалы с калькулятором, p-value и проверка гипотез.

3 темы, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.

1. Выборка, ЦПТ и стандартная ошибка

Почему средние по выборкам ложатся в колокол: центральная предельная теорема, стандартная ошибка σ/√n и правило 68–95–99.7 — с симулятором, где выборки набираются на глазах.

На собеседовании спросят: «Сформулируй ЦПТ»

2. Доверительные интервалы

Доверительный интервал — честный ответ вместо точечной оценки: формула x̄ ± t·s/√n, что на самом деле значат «95 %», интервалы для долей и бутстреп, симуляция ста интервалов и калькулятор.

На собеседовании спросят: «Что значит 95-процентный доверительный интервал?»

3. P-value и проверка гипотез

P-value простыми словами: нулевая гипотеза, уровень значимости 0,05, ошибки I и II рода, одно- и двусторонние тесты — и почему p = 0,03 не значит «эффект есть с вероятностью 97 %». С интерактивом.

На собеседовании спросят: «Что такое p-value?»