Основы машинного обучения
Фундамент: как модель учится на данных, линейная и логистическая регрессия, градиентный спуск, переобучение и регуляризация, метрики, деревья и ансамбли, кластеризация и снижение размерности.
18 тем, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.
1. Что такое машинное обучение
Стартовая тема курса: чем машинное обучение отличается от классического программирования, какие бывают парадигмы обучения, зачем данные режут на три части и что такое обобщение — понятие, ради которого всё и затевается.
На собеседовании спросят: «Чем ML отличается от классического программирования?»
2. Типы обучения: с учителем, без и с подкреплением
Все алгоритмы ML отличает один вопрос: откуда берётся обучающий сигнал — то, по чему модель понимает, что она права или ошибается. Разберём пять источников такого сигнала: от дорогой ручной разметки до бесплатной разметки, спрятанной в самих данных, — именно последняя двигает современные LLM.
На собеседовании спросят: «Чем self-supervised отличается от unsupervised?»
3. Линейная регрессия
Линейная регрессия простыми словами: MSE, нормальное уравнение, градиентный спуск и типичные вопросы ML-собеседования с интерактивом.
На собеседовании спросят: «Почему MSE, а не MAE?»
4. Градиентный спуск
Градиентный спуск для собеседования: шаг, learning rate, локальные минимумы, batch/SGD и почему алгоритм обучает от регрессии до нейросетей.
На собеседовании спросят: «Почему шаг делается против градиента?»
5. Логистическая регрессия и классификация
Логистическая регрессия и классификация: сигмоида, кросс-энтропия, решающая граница и разбор типичных вопросов на ML-интервью.
На собеседовании спросят: «Почему для классификации не годится линейная регрессия с порогом?»
6. Теорема Байеса и наивный Байес
Теорема Байеса — правило пересчёта вероятностей при появлении улик: prior, likelihood и posterior на примере медицинского теста. Наивный Байес (Naive Bayes) — классификатор на её основе: спам-фильтр, сглаживание Лапласа и классика собеседований про генеративные и дискриминативные модели.
На собеседовании спросят: «Болезнь у 1%, тест точен на 95%, тест положительный»
7. Переобучение и регуляризация
Переобучение и регуляризация: train/val кривые, L1/L2, dropout, early stopping — как диагностировать и что отвечать на собеседовании.
На собеседовании спросят: «Как отличить переобучение от недообучения?»
8. Bias–variance: разложение ошибки
Bias–variance tradeoff простыми словами: смещение, разброс, шум; почему простые модели недообучаются, а сложные переобучаются.
На собеседовании спросят: «Что такое bias-variance trade-off?»
9. Метрики качества
Метрики качества модели: accuracy vs precision/recall, F1, ROC-AUC, когда какая нужна и как не обмануть себя на собеседовании.
На собеседовании спросят: «Классы 1:100, accuracy 0.99»
10. Кросс-валидация и подбор гиперпараметров
Кросс-валидация (k-fold, nested CV) и подбор гиперпараметров: grid vs random search — как не завысить метрику на собеседовании.
На собеседовании спросят: «Зачем нужна валидация, если есть тест?»
11. Деревья решений и ансамбли
Деревья решений и ансамбли: RF vs градиентный бустинг, overfitting деревьев и что спрашивают про табличные модели на собеседовании.
На собеседовании спросят: «Чем Random Forest отличается от бэггинга?»
12. SVM и kernel trick
SVM (метод опорных векторов) — классификатор максимального зазора: границу определяют только опорные векторы, а kernel trick разделяет линейно неразделимое. Разбираем margin, параметры C и gamma, RBF-ядро — вечную классику собеседований.
На собеседовании спросят: «Что такое опорные векторы?»
13. kNN и кластеризация
Два способа опереться на расстояния между объектами: kNN предсказывает по ближайшим соседям с метками, а k-means находит группы там, где меток нет вовсе. Обе идеи просты, и именно на их подводных камнях любят ловить на собеседованиях.
На собеседовании спросят: «Почему kNN называют ленивым?»
14. EM-алгоритм и смеси гауссиан (GMM)
Мягкая вероятностная кластеризация: вместо «эта точка в кластере №2» — «эта точка на 70% во втором и на 30% в третьем». Смесь гауссиан (GMM) описывает кластеры эллипсами разной формы и наклона, а EM-алгоритм подгоняет их к данным, шаг за шагом наращивая правдоподобие.
На собеседовании спросят: «Чем GMM лучше k-means?»
15. Снижение размерности и PCA
Реальные данные живут в сотнях и тысячах измерений, но полезная структура почти всегда умещается в нескольких. PCA — главный инструмент, чтобы сжать пространство признаков, сохранив максимум информации, — и любимый теоретический вопрос на собеседованиях.
На собеседовании спросят: «Что максимизирует PCA?»
16. Фичи и утечки данных (data leakage)
На табличных данных признаки (features) решают больше, чем выбор модели. Разбираем преобразования фичей, target encoding и утечку данных (data leakage) — из-за неё AUC 0.99 оффлайн превращается в 0.6 в проде.
На собеседовании спросят: «AUC 0.99 оффлайн, 0.6 в проде»
17. Временные ряды и прогнозирование
Временные ряды (time series): декомпозиция на тренд и сезонность, наивные бейзлайны, лаговые фичи, walk-forward валидация и почему random split для рядов — утечка данных.
На собеседовании спросят: «Как валидировать модель прогноза продаж?»
18. Обучение с подкреплением: Q-learning и PPO
Как научить агента действовать в среде, где никто не показывает правильный ход, а есть лишь редкая награда. Разбираем MDP, дилемму «исследование против использования», два семейства методов — Q-learning и PPO — и мост к RLHF, на котором держится выравнивание современных LLM.
На собеседовании спросят: «Что такое Q-learning и уравнение Беллмана?»