Глоссарий: Основы машинного обучения
125 терминов раздела «Основы машинного обучения» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.
- Ансамбльensemble
- Объединение многих моделей, чьи ответы усредняются или голосуют. Разные модели ошибаются по-разному, ошибки частично гасятся — вместе они точнее любой по отдельности.Разбор: Деревья решений и ансамбли
- Апостериорная вероятностьposterior
- Обновлённая вероятность гипотезы после учёта улик — результат применения теоремы Байеса: приор, умноженный на правдоподобие, с нормировкой.Разбор: Теорема Байеса и наивный Байес
- Байесовская оптимизацияBayesian optimization
- Подбор гиперпараметров через суррогатную модель «настройки → качество»: следующую пробу выбирают по ожидаемому улучшению, балансируя исследование и использование. Основа Optuna (TPE) и Hyperopt.Разбор: Кросс-валидация и подбор гиперпараметров
- Биннингbinning
- Разбиение непрерывного признака на корзины-интервалы, чтобы линейная модель смогла поймать нелинейную зависимость.Разбор: Фичи и утечки данных (data leakage)
- Бутстрепbootstrap
- Случайная выборка с возвращением того же размера, что исходная. Основа бэггинга, а также универсальный способ получить доверительный интервал для любой метрики: пересчитать её на тысяче ресэмплов и взять перцентили.Разбор: Доверительные интервалы · Деревья решений и ансамбли
- Бэггингbagging
- Обучение множества моделей на бутстреп-выборках с последующим усреднением ответов. Снижает разброс нестабильных моделей вроде глубоких деревьев, почти не меняя смещение.Разбор: Деревья решений и ансамбли
- Валидационная выборкаvalidation set
- Часть данных, отложенная для подбора гиперпараметров и отслеживания момента, когда модель начинает переобучаться. Модель на ней не обучается, но решения под неё подстраиваются.Разбор: Что такое машинное обучение
- Вложенная кросс-валидацияnested cross-validation
- Схема с двумя циклами: внешний честно оценивает пайплайн, внутренний на каждой его итерации отдельно подбирает гиперпараметры. Убирает завышение оценки, вызванное самим фактом выбора лучшего варианта.Разбор: Кросс-валидация и подбор гиперпараметров
- Временной рядtime series
- Наблюдения, упорядоченные во времени: продажи по дням, нагрузка по минутам. Порядок важен, а соседние точки зависимы — это меняет и подготовку признаков, и валидацию.Разбор: Временные ряды и прогнозирование
- Выбор числа компонентmodel selection, BIC/AIC
- Задача подбора числа гауссиан k: правдоподобие растёт с k само по себе, поэтому используют критерии BIC и AIC, которые штрафуют лишние параметры и ищут баланс между качеством подгонки и сложностью.Разбор: EM-алгоритм и смеси гауссиан (GMM)
- Выбросoutlier
- Аномальная точка, сильно выбивающаяся из общей закономерности данных. Из-за квадрата ошибки в MSE даже один выброс может заметно развернуть линейную модель.Разбор: Линейная регрессия
- Выпуклая функцияconvex function
- Функция с единственной «долиной»: любой локальный минимум является глобальным, поэтому градиентный спуск гарантированно находит оптимум. Поверхности потерь нейросетей невыпуклы.Разбор: Градиентный спуск
- Генеративная модельgenerative model
- Модель, которая учит совместное распределение данных и меток — «как выглядят объекты каждого класса» — и выводит ответ через теорему Байеса. Пример — наивный Байес.Разбор: Теорема Байеса и наивный Байес · VAE и GAN: генерация до диффузии
- Гиперпараметрыhyperparameters
- Настройки модели и процесса обучения, которые задаёт человек (сложность модели, скорость обучения), в отличие от параметров, которые модель подбирает сама. Выбираются по валидационной выборке.Разбор: Что такое машинное обучение
- Главная компонентаprincipal component
- Направление в пространстве признаков, вдоль которого дисперсия проекций максимальна; каждая следующая ортогональна предыдущим. Математически — собственные векторы ковариационной матрицы.Разбор: Снижение размерности и PCA
- Градиентgradient
- Вектор производных функции по всем параметрам; указывает направление наискорейшего роста функции. Чтобы уменьшать ошибку, шаг оптимизации делают против градиента.Разбор: Градиентный спуск
- Градиентный бустингgradient boosting
- Ансамбль, где неглубокие деревья строятся последовательно и каждое исправляет ошибки предыдущих, приближая антиградиент лосса. Чемпион на табличных данных: XGBoost, LightGBM, CatBoost.Разбор: Деревья решений и ансамбли
- Градиентный спускgradient descent
- Итеративный алгоритм оптимизации: на каждом шаге параметры сдвигаются против градиента функции потерь — в сторону наискорейшего убывания ошибки. Им обучают почти всё, от регрессии до LLM.Разбор: Градиентный спуск
- Двойной спускdouble descent
- Феномен, при котором ошибка сильно перепараметризованных моделей после пика у точки интерполяции снова падает, нарушая классическую U-образную картину. Объясняет успех больших нейросетей.Разбор: Bias–variance: разложение ошибки
- Декомпозиция рядаdecomposition
- Разложение временного ряда на тренд (медленное движение уровня), сезонность (повторяющийся узор) и остаток (необъяснённый шум). Хорошая модель ловит первые две компоненты и не учит третью.Разбор: Временные ряды и прогнозирование
- Дерево решенийdecision tree
- Модель из последовательных вопросов «признак больше порога?», разрезающих пространство признаков на прямоугольные области. Интерпретируема, но нестабильна и на большой глубине переобучается.Разбор: Деревья решений и ансамбли
- Дисбаланс классовclass imbalance
- Ситуация, когда классов сильно не поровну, например один больной на сто здоровых. Делает accuracy и ROC-AUC обманчивыми; честнее смотреть precision, recall и PR-AUC.Разбор: Метрики качества
- Дискриминативная модельdiscriminative model
- Модель, которая сразу учит вероятность класса при данном входе — границу между классами, не тратя силы на моделирование самих данных. Пример — логистическая регрессия.Разбор: Теорема Байеса и наивный Байес
- Доля объяснённой дисперсииexplained variance ratio
- Часть общей дисперсии данных, приходящаяся на главную компоненту. По накопленной доле выбирают число компонент — обычно столько, чтобы суммарно объяснить 90–95% дисперсии.Разбор: Снижение размерности и PCA
- Доля правильных ответовaccuracy
- Доля объектов, для которых модель угадала класс. Обманчива при дисбалансе классов: константа «все здоровы» даёт 99% на выборке, где болен один из ста.Разбор: Метрики качества
- Зазорmargin
- Расстояние от разделяющей границы до ближайших точек классов. SVM его максимизирует: чем шире «улица» между классами, тем устойчивее классификация слегка сдвинутых новых точек.Разбор: SVM и kernel trick
- Индекс ДжиниGini impurity
- Мера «грязности» узла дерева: ноль, когда в узле объекты одного класса, максимум при равной смеси. Дерево жадно выбирает разрезы, сильнее всего снижающие эту грязность.Разбор: Деревья решений и ансамбли
- Инерцияinertia
- Сумма квадратов расстояний от точек до центров их кластеров — величина, которую минимизирует k-means. Монотонно падает с ростом числа кластеров, поэтому по ней одной число кластеров не выбрать.Разбор: kNN и кластеризация
- Инженерия признаковfeature engineering
- Придумывание и преобразование признаков — перевод знаний о задаче на язык чисел, понятный модели. На табличных данных удачная фича даёт больше, чем смена алгоритма.Разбор: Фичи и утечки данных (data leakage)
- Исследование против использованияexploration vs exploitation
- Ключевая дилемма обучения с подкреплением: пробовать новые действия ради потенциально большей награды или эксплуатировать уже найденную хорошую стратегию.Разбор: Типы обучения: с учителем, без и с подкреплением · Обучение с подкреплением: Q-learning и PPO
- Кернел-трюкkernel trick
- Приём, неявно переводящий данные в пространство большей размерности, где они линейно разделимы: ядро дёшево считает там скалярные произведения, не строя само отображение.Разбор: SVM и kernel trick
- Классификацияclassification
- Задача предсказания дискретного класса объекта: спам или нет, кошка или собака. Отличается от регрессии, где предсказывается непрерывное число.Разбор: Что такое машинное обучение
- Кластеризацияclustering
- Задача обучения без учителя: сгруппировать похожие объекты без готовых меток — сегменты клиентов, темы документов, дубликаты данных.Разбор: kNN и кластеризация
- Компромисс смещения и разбросаbias-variance trade-off
- Правило, по которому рост сложности модели снижает смещение, но раздувает разброс. Их сумма образует U-образную кривую ошибки; лучшее качество — на её дне.Разбор: Bias–variance: разложение ошибки · Переобучение и регуляризация
- Кросс-валидацияcross-validation
- Оценка качества по k разбиениям: данные делят на k частей, k раз обучаются на всех, кроме одной, и валидируются на оставшейся, метрики усредняют. Надёжнее одного сплита на малых данных.Разбор: Переобучение и регуляризация
- Кросс-энтропияcross-entropy
- Функция потерь для классификации, сравнивающая предсказанные вероятности с истинными метками. Почти бесконечно наказывает уверенные ошибки; с сигмоидой даёт выпуклую задачу, в отличие от MSE.Разбор: Логистическая регрессия и классификация · Распознавание цифр из пикселей
- Лаговые признакиlag features
- Значения ряда в прошлые моменты — вчера, неделю назад, — поданные модели как признаки. Превращают прогноз ряда в обычную табличную задачу, например для градиентного бустинга.Разбор: Временные ряды и прогнозирование
- Латентная переменнаяlatent variable
- Скрытая, не наблюдаемая величина, которую модель домысливает. В GMM это номер гауссианы, породившей точку: мы его не знаем, а EM оценивает вероятности каждого варианта.Разбор: EM-алгоритм и смеси гауссиан (GMM)
- Ленивое обучениеlazy learning
- Подход без фазы обучения: модель просто запоминает выборку, а все вычисления откладывает до момента предсказания. Классический пример — kNN с его дорогим поиском соседей на каждый запрос.Разбор: kNN и кластеризация
- Линейная разделимостьlinear separability
- Свойство данных, при котором классы можно идеально разделить прямой или гиперплоскостью. При полной разделимости веса логистической регрессии без регуляризации раздуваются бесконечно.Разбор: Логистическая регрессия и классификация · От нейрона к многослойному перцептрону
- Линейная регрессияlinear regression
- Модель, предсказывающая число как взвешенную сумму признаков плюс сдвиг. Обучение — подбор весов, при которых средняя ошибка на обучающих данных минимальна. Фундамент, на котором строится весь ML.Разбор: Линейная регрессия
- Логистическая регрессияlogistic regression
- Линейная модель классификации: считает взвешенную сумму признаков и пропускает её через сигмоиду, получая вероятность класса. Обучается минимизацией кросс-энтропии.Разбор: Логистическая регрессия и классификация
- Локальный минимумlocal minimum
- Точка, где функция потерь меньше, чем во всех соседних, но не обязательно минимальна глобально. Чисто градиентным шагом из такой «долины» не выбраться; помогают шум SGD и момент.Разбор: Градиентный спуск
- Матрица ошибокconfusion matrix
- Таблица четырёх исходов бинарной классификации: истинно и ложно положительные, истинно и ложно отрицательные. Из этих четырёх чисел собираются precision, recall и другие метрики.Разбор: Метрики качества
- Машинное обучениеmachine learning
- Подход, при котором программа не следует написанным вручную правилам, а выводит их из данных: подбирает параметры модели так, чтобы качество на задаче росло с накоплением опыта.Разбор: Что такое машинное обучение
- Метод локтяelbow method
- Способ выбрать число кластеров: рисуют зависимость инерции от k и ищут излом, после которого добавление кластера почти ничего не улучшает.Разбор: kNN и кластеризация
- Метод k-среднихk-means
- Алгоритм кластеризации: чередует приписывание точек к ближайшим центроидам и пересчёт центроидов как средних. Сходится всегда, но лишь к локальному минимуму; число кластеров задаётся заранее.Разбор: kNN и кластеризация
- Мультиколлинеарностьmulticollinearity
- Сильная корреляция между признаками, из-за которой отдельные веса линейной модели становятся нестабильными и теряют интерпретируемость. Лечится регуляризацией или отбором признаков.Разбор: Линейная регрессия
- Мягкий зазорsoft margin
- Версия SVM для зашумлённых данных: отдельным точкам разрешают нарушать зазор за штраф. Компромисс между шириной улицы и числом нарушений регулирует гиперпараметр C.Разбор: SVM и kernel trick
- Мягкое отнесениеsoft assignment, responsibility
- Вероятность принадлежности точки каждому кластеру: вместо жёсткого «этот» точка получает набор долей, сумма которых равна 1. Точки на границе честно делятся между кластерами, а не приписываются одному силой.Разбор: EM-алгоритм и смеси гауссиан (GMM)
- Награда и отдачаreward and return
- Награда — скалярный отклик среды на шаг. Отдача — сумма будущих наград с дисконтом γ: G=r+γ·r′+γ²·r″+…. Агент максимизирует именно отдачу, а не сиюминутную награду.Разбор: Обучение с подкреплением: Q-learning и PPO
- Наивный Байесnaive Bayes
- Классификатор на теореме Байеса с «наивным» допущением, что признаки условно независимы при данном классе. Обучается подсчётом частот за один проход; классика текстов и быстрый бейзлайн.Разбор: Теорема Байеса и наивный Байес
- Наивный прогнозnaive forecast
- Бейзлайн «завтра = сегодня» или «завтра = неделю назад» (сезонная версия). Обязательная планка качества: модель, не бьющая сезонный наивный прогноз, не даёт ценности.Разбор: Временные ряды и прогнозирование
- Недообучениеunderfitting
- Модель слишком проста, чтобы уловить закономерность: ошибка высока и на обучающих, и на новых данных. Лечится более выразительной моделью или лучшими признаками.Разбор: Переобучение и регуляризация
- Неустранимый шумirreducible error
- Дисперсия σ² случайности в самих данных — нижний предел ошибки, который не победить ни сложностью модели, ни объёмом данных. Ошибка на новых данных не опускается ниже него.Разбор: Bias–variance: разложение ошибки
- Нормальное уравнениеnormal equation
- Аналитическое решение линейной регрессии: оптимальные веса считаются одной матричной формулой без итераций. Непрактично при большом числе признаков из-за дорогого обращения матрицы.Разбор: Линейная регрессия
- Обобщениеgeneralization
- Способность модели правильно работать на данных, которых она не видела при обучении, — главная цель ML. Разрыв между качеством на обучающей и новых выборках — основной диагностический сигнал.Разбор: Что такое машинное обучение
- Обучение без учителяunsupervised learning
- Обучение без меток: сигналом служит сама структура данных. Модель группирует похожие объекты, сжимает признаки, находит аномалии — описывает, как устроены данные, а не проверяет ответы.Разбор: Типы обучения: с учителем, без и с подкреплением
- Обучение с подкреплениемreinforcement learning
- Обучение через действия: агент не получает правильных ответов, а действует в среде и получает награду, иногда отложенную. Методом проб и ошибок он учится действовать так, чтобы награды было больше.Разбор: Типы обучения: с учителем, без и с подкреплением · Обучение с подкреплением: Q-learning и PPO
- Обучение с учителемsupervised learning
- Обучение на парах «вход — правильный ответ»: модель минимизирует ошибку между своим предсказанием и меткой. Даёт точность, но требует дорогой ручной разметки данных.Разбор: Типы обучения: с учителем, без и с подкреплением
- Опорные векторыsupport vectors
- Точки обучающей выборки, лежащие на краю зазора: только они определяют положение границы SVM. Остальные объекты можно удалить — граница не изменится.Разбор: SVM и kernel trick
- Переобучениеoverfitting
- Модель заучивает обучающие данные вместе с шумом вместо закономерности: почти нулевая ошибка на трейне и большая на новых данных. Признак — заметный разрыв между train- и validation-ошибкой.Разбор: Переобучение и регуляризация
- Политикаpolicy
- Правило поведения агента — отображение состояния в действие (или в распределение действий). Именно политику RL и оптимизирует; при выученной Q-функции она сводится к выбору действия с максимальным Q.Разбор: Обучение с подкреплением: Q-learning и PPO
- Полнотаrecall
- Доля найденных моделью положительных объектов среди всех настоящих положительных: «скольких больных мы поймали». Важна, когда дороже всего пропуск.Разбор: Метрики качества
- Порог классификацииdecision threshold
- Значение скора, выше которого модель относит объект к положительному классу. Понижение порога растит полноту, но роняет точность; положение порога диктует цена ошибок в бизнесе.Разбор: Метрики качества
- Правдоподобиеlikelihood
- Вероятность наблюдаемых данных при текущих параметрах модели. EM максимизирует лог-правдоподобие и гарантированно не уменьшает его на каждом шаге, но сходится лишь к локальному оптимуму.Разбор: EM-алгоритм и смеси гауссиан (GMM) · Теорема Байеса и наивный Байес
- Приорprior
- Априорная вероятность гипотезы — вера в неё до появления улик, например базовая частота болезни в популяции. Один из двух множителей в теореме Байеса.Разбор: Теорема Байеса и наивный Байес
- Проклятие размерностиcurse of dimensionality
- Эффект высоких размерностей: расстояния между всеми парами точек становятся почти одинаковыми, и «ближайший сосед» теряет смысл. Ломает kNN и k-means; лечится снижением размерности.Разбор: Снижение размерности и PCA
- Разбросvariance
- Чувствительность модели к конкретной обучающей выборке: насколько её предсказания меняются от выборки к выборке. Велик у слишком гибких моделей, которые цепляются за шум и переобучаются.Разбор: Bias–variance: разложение ошибки
- Разложение ошибкиbias-variance decomposition
- Представление ожидаемой квадратичной ошибки модели как суммы трёх слагаемых: смещение² + разброс + неустранимый шум. Основной язык для анализа недо- и переобучения.Разбор: Bias–variance: разложение ошибки
- Разрежённая наградаsparse reward
- Ситуация, когда награда приходит редко — обычно лишь в конце длинной цепочки действий (мат, победа). Обучающего сигнала почти нет; частично лечится reward shaping, но с ним легко научить агента не тому.Разбор: Обучение с подкреплением: Q-learning и PPO
- Ранняя остановкаearly stopping
- Остановка обучения в момент минимума ошибки на валидационной выборке — до того, как модель перейдёт от выучивания закономерности к запоминанию шума.Разбор: Переобучение и регуляризация · Практика обучения: батчи, dropout, batchnorm
- Регуляризацияregularization
- Штраф за большие веса, добавляемый к функции потерь, чтобы ограничить сложность модели и снизить переобучение, не упрощая саму модель. Сила штрафа управляется отдельным коэффициентом.Разбор: Переобучение и регуляризация
- Решающая границаdecision boundary
- Поверхность в пространстве признаков, разделяющая области, где модель предсказывает разные классы. У логистической регрессии граница всегда линейна, несмотря на нелинейную сигмоиду.Разбор: Логистическая регрессия и классификация
- Сглаживание ЛапласаLaplace smoothing
- Добавление виртуального счётчика +1 при оценке частот в наивном Байесе, чтобы слово, не встречавшееся в классе, не давало нулевую вероятность и не зануляло всё произведение.Разбор: Теорема Байеса и наивный Байес
- Седловая точкаsaddle point
- Точка с почти нулевым градиентом, не являющаяся минимумом: по одним направлениям функция растёт, по другим убывает. В высоких размерностях именно сёдла чаще всего тормозят обучение.Разбор: Градиентный спуск
- Сигмоидаsigmoid
- Гладкая S-образная функция, сжимающая любое число в интервал от 0 до 1. Превращает линейный скор в вероятность класса в логистической регрессии и нейросетях.Разбор: Логистическая регрессия и классификация · Функции активации
- Скорость обученияlearning rate
- Множитель, задающий длину шага градиентного спуска. Слишком маленький — обучение мучительно медленное, слишком большой — ошибка начинает расти и процесс расходится.Разбор: Градиентный спуск · Оптимизаторы: SGD, Momentum, Adam
- Случайный лесrandom forest
- Бэггинг над глубокими деревьями плюс случайное подмножество признаков в каждом узле: деревья разнообразнее, усреднение сильнее гасит разброс. Крепкий бейзлайн на табличных данных.Разбор: Деревья решений и ансамбли
- Смесь гауссианGaussian Mixture Model, GMM
- Вероятностная модель кластеризации: данные считаются смесью нескольких гауссиан, каждая со своим центром, ковариацией (форма и наклон эллипса) и весом. В отличие от k-means умеет вытянутые и наклонённые кластеры разного размера.Разбор: EM-алгоритм и смеси гауссиан (GMM)
- Смещениеbias
- Систематическая ошибка модели: отклонение её усреднённого по выборкам предсказания от истины. Велико у слишком простых моделей — они не способны поймать закономерность и недообучаются.Разбор: Bias–variance: разложение ошибки · От нейрона к многослойному перцептрону
- Снижение размерностиdimensionality reduction
- Сжатие пространства признаков с сохранением главной структуры данных — ради визуализации, скорости, борьбы с шумом и проклятием размерности.Разбор: Снижение размерности и PCA
- Стандартизацияstandardization
- Приведение признака к нулевому среднему и единичному разбросу. Обязательна перед методами на расстояниях и регуляризацией; параметры считаются только по обучающей выборке.Разбор: Фичи и утечки данных (data leakage)
- Стратифицированная k-foldstratified k-fold
- Разбиение на фолды, сохраняющее долю классов в каждом фолде. Нужно при несбалансированных классах, иначе редкий класс может целиком провалиться в один фолд и оценка станет нестабильной.Разбор: Кросс-валидация и подбор гиперпараметров
- Таргет-кодированиеtarget encoding
- Замена категории средним значением целевой переменной по ней. Компактно и мощно, но без out-of-fold-схемы редкие категории запоминают свой таргет — получается микро-утечка.Разбор: Фичи и утечки данных (data leakage)
- Теорема БайесаBayes' theorem
- Правило пересчёта вероятности гипотезы при появлении новых данных: апостериорная вероятность пропорциональна приору, умноженному на правдоподобие улик.Разбор: Теорема Байеса и наивный Байес
- Тестовая выборкаtest set
- «Неприкосновенная» часть данных, которую трогают один раз в самом конце — для честной итоговой оценки модели. Многократная подстройка решений под тест завышает оценку качества.Разбор: Что такое машинное обучение
- Точностьprecision
- Доля действительно положительных среди всех объектов, которые модель назвала положительными: «сколько из наших тревог — настоящие». Важна, когда дорога ложная тревога.Разбор: Метрики качества · Видеокарты и VRAM: железо для нейросетей
- Трансферное обучениеtransfer learning
- Перенос знаний с одной задачи на другую: берут модель, обученную на большой выборке, и дообучают на своей задаче. Позволяет учиться на малых данных быстрее и точнее, чем с нуля.Разбор: Типы обучения: с учителем, без и с подкреплением
- Уравнение БеллманаBellman equation
- Рекурсия, связывающая ценность действия сейчас с ценностью следующего шага: Q(s,a)=r+γ·max Q(s′,·). Q-learning подгоняет оценки Q к этому равенству на опыте, минимизируя TD-ошибку.Разбор: Обучение с подкреплением: Q-learning и PPO
- Утечка данныхdata leakage
- Попадание в признаки информации, которой в момент предсказания ещё нет: поля, заполненные после события, предобработка до сплита, будущее в трейне. Симптом — блестящая оффлайн-метрика и провал в проде.Разбор: Фичи и утечки данных (data leakage)
- Утечка при подбореtuning data leakage
- Подбор гиперпараметров по тестовой выборке или подготовка признаков по всем данным до разбиения. Информация из проверки просачивается в обучение и завышает оценку качества.Разбор: Кросс-валидация и подбор гиперпараметров
- Функция потерьloss function
- Число, измеряющее, насколько предсказания модели плохи на данных. Обучение любой модели — поиск параметров, при которых функция потерь минимальна.Разбор: Линейная регрессия
- Центроидcentroid
- Центр кластера — среднее всех его точек. В k-means центроиды пересчитываются на каждой итерации, а точки приписываются к ближайшему из них.Разбор: kNN и кластеризация
- Частичное обучениеsemi-supervised learning
- Комбинация малого числа размеченных примеров и большого объёма неразмеченных: модель учится структуре на неразмеченных данных и уточняет ответы по редким меткам.Разбор: Типы обучения: с учителем, без и с подкреплением
- Экспоненциальное сглаживаниеexponential smoothing
- Прогноз как взвешенное среднее прошлых значений ряда, где свежие точки весят больше. Версии с трендом и сезонностью известны как метод Холта-Уинтерса.Разбор: Временные ряды и прогнозирование
- Ядроkernel
- Функция от пары объектов, равная скалярному произведению их образов в спрямляющем пространстве, — по сути мера похожести. Позволяет SVM строить нелинейные границы.Разбор: SVM и kernel trick
- ARIMAautoregressive integrated moving average
- Классическая модель прогнозирования: следующая точка — линейная комбинация прошлых значений ряда и прошлых ошибок после устранения тренда разностями. Ряд объясняется собственным прошлым.Разбор: Временные ряды и прогнозирование
- AUCarea under curve
- Площадь под ROC-кривой: вероятность того, что случайный положительный объект получит скор выше случайного отрицательного. 0.5 — уровень монетки, 1 — идеальное ранжирование.Разбор: Метрики качества
- DBSCANdensity-based spatial clustering of applications with noise
- Плотностная кластеризация: растит кластеры из плотных областей, сама определяет их число и помечает выбросы как шум. Справляется с невыпуклыми формами, на которых k-means ломается.Разбор: kNN и кластеризация
- E-шагExpectation step
- Шаг EM, на котором при текущих параметрах модели для каждой точки пересчитываются ответственности — мягкие вероятности её принадлежности каждому кластеру.Разбор: EM-алгоритм и смеси гауссиан (GMM)
- EM-алгоритмExpectation-Maximization
- Итеративная схема обучения моделей со скрытыми переменными: E-шаг при фиксированных параметрах считает ответственности, M-шаг при фиксированных ответственностях обновляет параметры. Каждый цикл не уменьшает правдоподобие.Разбор: EM-алгоритм и смеси гауссиан (GMM)
- F1-мераf1 score
- Гармоническое среднее precision и recall: сворачивает обе метрики в одно число и жёстко штрафует сильный перекос в любую из сторон.Разбор: Метрики качества
- Grid searchgrid search
- Подбор гиперпараметров полным перебором по заданной сетке значений. Прост и воспроизводим, но число комбинаций растёт экспоненциально с числом гиперпараметров.Разбор: Кросс-валидация и подбор гиперпараметров
- k-fold кросс-валидацияk-fold cross-validation
- Данные делят на k частей и k раз обучаются на k−1 из них, проверяясь на оставшейся. Итог — среднее метрик и их разброс; каждая точка ровно один раз побывает в валидации.Разбор: Кросс-валидация и подбор гиперпараметров
- kNNk-nearest neighbors
- Метод k ближайших соседей: класс нового объекта определяется голосованием меток k самых близких точек обучающей выборки, для регрессии значения усредняются. Обязательна нормализация признаков.Разбор: kNN и кластеризация
- L1-регуляризацияlasso
- Штраф в виде суммы модулей весов: из-за «острого угла» модуля в нуле выталкивает часть весов ровно в ноль, за счёт чего работает как встроенный отбор признаков.Разбор: Переобучение и регуляризация
- L2-регуляризацияridge
- Штраф в виде суммы квадратов весов: равномерно прижимает все веса к нулю, не обнуляя их. Гладкая и удобная для оптимизации, стабилизирует модель при скоррелированных признаках.Разбор: Переобучение и регуляризация
- Leave-one-outleave-one-out (LOO)
- Крайний случай кросс-валидации, где число фолдов равно числу объектов: каждый объект по очереди служит валидацией. Оценка почти несмещённая, но вычислительно дорогая и с большим разбросом.Разбор: Кросс-валидация и подбор гиперпараметров
- M-шагMaximization step
- Шаг EM, на котором при зафиксированных ответственностях обновляются параметры кластеров: центры, ковариации и веса пересчитываются как взвешенные средние по всем точкам.Разбор: EM-алгоритм и смеси гауссиан (GMM)
- MAPEmean absolute percentage error
- Средняя абсолютная ошибка в процентах от фактического значения — удобно сравнивать ряды разного масштаба. Взрывается на рядах около нуля; тогда берут MAE или sMAPE.Разбор: Временные ряды и прогнозирование
- MSEmean squared error
- Среднеквадратичная ошибка: средний квадрат разницы между предсказанием и правдой. Гладкая и удобная для оптимизации, сильнее штрафует большие промахи, поэтому чувствительна к выбросам.Разбор: Линейная регрессия
- One-hot кодированиеone-hot encoding
- Кодирование категориального признака набором бинарных колонок — по одной на каждое возможное значение. Просто и безопасно, но взрывается на признаках с тысячами категорий.Разбор: Фичи и утечки данных (data leakage)
- PCAprincipal component analysis
- Метод главных компонент: поворачивает систему координат так, чтобы максимум дисперсии собрался в первых осях, и отбрасывает остальные. Лучшее линейное сжатие по среднеквадратичной ошибке.Разбор: Снижение размерности и PCA
- Policy gradientpolicy gradient
- Семейство методов, напрямую параметризующих политику π_θ и сдвигающих её веса в сторону большей отдачи. Базовый REINFORCE повышает вероятности действий из удачных эпизодов; актор-критик снижает дисперсию опорой.Разбор: Обучение с подкреплением: Q-learning и PPO
- Q-learningQ-learning
- Метод на основе ценности: учит Q(s,a) обновлением Q ← Q+α·[r+γ·max Q(s′,·)−Q] к цели Беллмана. Off-policy — обновляется по лучшему следующему действию, даже если реально сходил наугад.Разбор: Обучение с подкреплением: Q-learning и PPO
- R²coefficient of determination
- Доля дисперсии целевой переменной, которую объясняет модель: единица — идеальное предсказание, ноль — не лучше, чем всегда предсказывать среднее значение.Разбор: Линейная регрессия
- Random searchrandom search
- Подбор гиперпараметров случайными пробами из заданных диапазонов. При том же бюджете пробует больше разных значений важного параметра, чем сетка, — эффективнее в многомерном пространстве (Бергстра, Бенжио).Разбор: Кросс-валидация и подбор гиперпараметров
- RBF-ядроradial basis function
- Самое популярное ядро SVM: похожесть, экспоненциально падающая с расстоянием между точками. Параметр gamma задаёт радиус влияния точки; слишком большой — переобучение «островками».Разбор: SVM и kernel trick
- ROC-криваяreceiver operating characteristic curve
- График доли пойманных позитивов против доли ложных тревог при всех порогах сразу. Идеальная модель прижимается к левому верхнему углу, случайная идёт по диагонали.Разбор: Метрики качества
- SGDstochastic gradient descent
- Стохастический градиентный спуск: градиент оценивается не по всему датасету, а по одному примеру или небольшому мини-батчу. Шаги шумные, но дешёвые; шум помогает выскакивать из плохих минимумов.Разбор: Градиентный спуск · Оптимизаторы: SGD, Momentum, Adam
- Softmaxsoftmax
- Обобщение сигмоиды на много классов: превращает произвольные числа-скоры в распределение вероятностей — все положительны и в сумме дают единицу. Стоит в выходном слое классификаторов и LLM.Разбор: Логистическая регрессия и классификация · Функции активации
- SVMsupport vector machine
- Метод опорных векторов — классификатор, проводящий границу с максимальным зазором до ближайших точек обоих классов. Широкий зазор даёт запас прочности и лучшее обобщение.Разбор: SVM и kernel trick
- t-SNEt-distributed stochastic neighbor embedding
- Нелинейный метод визуализации: вкладывает данные в 2D, сохраняя локальные окрестности точек. Расстояния между кластерами на картинке не интерпретируются — инструмент разглядывания, а не измерения.Разбор: Снижение размерности и PCA
- Walk-forward валидацияwalk-forward validation
- Валидация рядов расширяющимся окном: обучение на данных до точки, прогноз следующего отрезка, сдвиг границы и усреднение ошибок. Честная замена random split, который подсматривает в будущее.Разбор: Временные ряды и прогнозирование