Диагностика Mock-интервью
Главная · Раздел

Основы машинного обучения

Фундамент: как модель учится на данных, линейная и логистическая регрессия, градиентный спуск, переобучение и регуляризация, метрики, деревья и ансамбли, кластеризация и снижение размерности.

18 тем, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.

1. Что такое машинное обучение

Стартовая тема курса: чем машинное обучение отличается от классического программирования, какие бывают парадигмы обучения, зачем данные режут на три части и что такое обобщение — понятие, ради которого всё и затевается.

На собеседовании спросят: «Чем ML отличается от классического программирования?»

2. Типы обучения: с учителем, без и с подкреплением

Все алгоритмы ML отличает один вопрос: откуда берётся обучающий сигнал — то, по чему модель понимает, что она права или ошибается. Разберём пять источников такого сигнала: от дорогой ручной разметки до бесплатной разметки, спрятанной в самих данных, — именно последняя двигает современные LLM.

На собеседовании спросят: «Чем self-supervised отличается от unsupervised?»

3. Линейная регрессия

Линейная регрессия простыми словами: MSE, нормальное уравнение, градиентный спуск и типичные вопросы ML-собеседования с интерактивом.

На собеседовании спросят: «Почему MSE, а не MAE?»

4. Градиентный спуск

Градиентный спуск для собеседования: шаг, learning rate, локальные минимумы, batch/SGD и почему алгоритм обучает от регрессии до нейросетей.

На собеседовании спросят: «Почему шаг делается против градиента?»

5. Логистическая регрессия и классификация

Логистическая регрессия и классификация: сигмоида, кросс-энтропия, решающая граница и разбор типичных вопросов на ML-интервью.

На собеседовании спросят: «Почему для классификации не годится линейная регрессия с порогом?»

6. Теорема Байеса и наивный Байес

Теорема Байеса — правило пересчёта вероятностей при появлении улик: prior, likelihood и posterior на примере медицинского теста. Наивный Байес (Naive Bayes) — классификатор на её основе: спам-фильтр, сглаживание Лапласа и классика собеседований про генеративные и дискриминативные модели.

На собеседовании спросят: «Болезнь у 1%, тест точен на 95%, тест положительный»

7. Переобучение и регуляризация

Переобучение и регуляризация: train/val кривые, L1/L2, dropout, early stopping — как диагностировать и что отвечать на собеседовании.

На собеседовании спросят: «Как отличить переобучение от недообучения?»

8. Bias–variance: разложение ошибки

Bias–variance tradeoff простыми словами: смещение, разброс, шум; почему простые модели недообучаются, а сложные переобучаются.

На собеседовании спросят: «Что такое bias-variance trade-off?»

9. Метрики качества

Метрики качества модели: accuracy vs precision/recall, F1, ROC-AUC, когда какая нужна и как не обмануть себя на собеседовании.

На собеседовании спросят: «Классы 1:100, accuracy 0.99»

10. Кросс-валидация и подбор гиперпараметров

Кросс-валидация (k-fold, nested CV) и подбор гиперпараметров: grid vs random search — как не завысить метрику на собеседовании.

На собеседовании спросят: «Зачем нужна валидация, если есть тест?»

11. Деревья решений и ансамбли

Деревья решений и ансамбли: RF vs градиентный бустинг, overfitting деревьев и что спрашивают про табличные модели на собеседовании.

На собеседовании спросят: «Чем Random Forest отличается от бэггинга?»

12. SVM и kernel trick

SVM (метод опорных векторов) — классификатор максимального зазора: границу определяют только опорные векторы, а kernel trick разделяет линейно неразделимое. Разбираем margin, параметры C и gamma, RBF-ядро — вечную классику собеседований.

На собеседовании спросят: «Что такое опорные векторы?»

13. kNN и кластеризация

Два способа опереться на расстояния между объектами: kNN предсказывает по ближайшим соседям с метками, а k-means находит группы там, где меток нет вовсе. Обе идеи просты, и именно на их подводных камнях любят ловить на собеседованиях.

На собеседовании спросят: «Почему kNN называют ленивым?»

14. EM-алгоритм и смеси гауссиан (GMM)

Мягкая вероятностная кластеризация: вместо «эта точка в кластере №2» — «эта точка на 70% во втором и на 30% в третьем». Смесь гауссиан (GMM) описывает кластеры эллипсами разной формы и наклона, а EM-алгоритм подгоняет их к данным, шаг за шагом наращивая правдоподобие.

На собеседовании спросят: «Чем GMM лучше k-means?»

15. Снижение размерности и PCA

Реальные данные живут в сотнях и тысячах измерений, но полезная структура почти всегда умещается в нескольких. PCA — главный инструмент, чтобы сжать пространство признаков, сохранив максимум информации, — и любимый теоретический вопрос на собеседованиях.

На собеседовании спросят: «Что максимизирует PCA?»

16. Фичи и утечки данных (data leakage)

На табличных данных признаки (features) решают больше, чем выбор модели. Разбираем преобразования фичей, target encoding и утечку данных (data leakage) — из-за неё AUC 0.99 оффлайн превращается в 0.6 в проде.

На собеседовании спросят: «AUC 0.99 оффлайн, 0.6 в проде»

17. Временные ряды и прогнозирование

Временные ряды (time series): декомпозиция на тренд и сезонность, наивные бейзлайны, лаговые фичи, walk-forward валидация и почему random split для рядов — утечка данных.

На собеседовании спросят: «Как валидировать модель прогноза продаж?»

18. Обучение с подкреплением: Q-learning и PPO

Как научить агента действовать в среде, где никто не показывает правильный ход, а есть лишь редкая награда. Разбираем MDP, дилемму «исследование против использования», два семейства методов — Q-learning и PPO — и мост к RLHF, на котором держится выравнивание современных LLM.

На собеседовании спросят: «Что такое Q-learning и уравнение Беллмана?»