Диагностика Mock-интервью
Главная · Глоссарий · Основы машинного обучения

Глоссарий: Основы машинного обучения

125 терминов раздела «Основы машинного обучения» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.

Ансамбльensemble
Объединение многих моделей, чьи ответы усредняются или голосуют. Разные модели ошибаются по-разному, ошибки частично гасятся — вместе они точнее любой по отдельности.Разбор: Деревья решений и ансамбли
Апостериорная вероятностьposterior
Обновлённая вероятность гипотезы после учёта улик — результат применения теоремы Байеса: приор, умноженный на правдоподобие, с нормировкой.Разбор: Теорема Байеса и наивный Байес
Байесовская оптимизацияBayesian optimization
Подбор гиперпараметров через суррогатную модель «настройки → качество»: следующую пробу выбирают по ожидаемому улучшению, балансируя исследование и использование. Основа Optuna (TPE) и Hyperopt.Разбор: Кросс-валидация и подбор гиперпараметров
Биннингbinning
Разбиение непрерывного признака на корзины-интервалы, чтобы линейная модель смогла поймать нелинейную зависимость.Разбор: Фичи и утечки данных (data leakage)
Бутстрепbootstrap
Случайная выборка с возвращением того же размера, что исходная. Основа бэггинга, а также универсальный способ получить доверительный интервал для любой метрики: пересчитать её на тысяче ресэмплов и взять перцентили.Разбор: Доверительные интервалы · Деревья решений и ансамбли
Бэггингbagging
Обучение множества моделей на бутстреп-выборках с последующим усреднением ответов. Снижает разброс нестабильных моделей вроде глубоких деревьев, почти не меняя смещение.Разбор: Деревья решений и ансамбли
Валидационная выборкаvalidation set
Часть данных, отложенная для подбора гиперпараметров и отслеживания момента, когда модель начинает переобучаться. Модель на ней не обучается, но решения под неё подстраиваются.Разбор: Что такое машинное обучение
Вложенная кросс-валидацияnested cross-validation
Схема с двумя циклами: внешний честно оценивает пайплайн, внутренний на каждой его итерации отдельно подбирает гиперпараметры. Убирает завышение оценки, вызванное самим фактом выбора лучшего варианта.Разбор: Кросс-валидация и подбор гиперпараметров
Временной рядtime series
Наблюдения, упорядоченные во времени: продажи по дням, нагрузка по минутам. Порядок важен, а соседние точки зависимы — это меняет и подготовку признаков, и валидацию.Разбор: Временные ряды и прогнозирование
Выбор числа компонентmodel selection, BIC/AIC
Задача подбора числа гауссиан k: правдоподобие растёт с k само по себе, поэтому используют критерии BIC и AIC, которые штрафуют лишние параметры и ищут баланс между качеством подгонки и сложностью.Разбор: EM-алгоритм и смеси гауссиан (GMM)
Выбросoutlier
Аномальная точка, сильно выбивающаяся из общей закономерности данных. Из-за квадрата ошибки в MSE даже один выброс может заметно развернуть линейную модель.Разбор: Линейная регрессия
Выпуклая функцияconvex function
Функция с единственной «долиной»: любой локальный минимум является глобальным, поэтому градиентный спуск гарантированно находит оптимум. Поверхности потерь нейросетей невыпуклы.Разбор: Градиентный спуск
Генеративная модельgenerative model
Модель, которая учит совместное распределение данных и меток — «как выглядят объекты каждого класса» — и выводит ответ через теорему Байеса. Пример — наивный Байес.Разбор: Теорема Байеса и наивный Байес · VAE и GAN: генерация до диффузии
Гиперпараметрыhyperparameters
Настройки модели и процесса обучения, которые задаёт человек (сложность модели, скорость обучения), в отличие от параметров, которые модель подбирает сама. Выбираются по валидационной выборке.Разбор: Что такое машинное обучение
Главная компонентаprincipal component
Направление в пространстве признаков, вдоль которого дисперсия проекций максимальна; каждая следующая ортогональна предыдущим. Математически — собственные векторы ковариационной матрицы.Разбор: Снижение размерности и PCA
Градиентgradient
Вектор производных функции по всем параметрам; указывает направление наискорейшего роста функции. Чтобы уменьшать ошибку, шаг оптимизации делают против градиента.Разбор: Градиентный спуск
Градиентный бустингgradient boosting
Ансамбль, где неглубокие деревья строятся последовательно и каждое исправляет ошибки предыдущих, приближая антиградиент лосса. Чемпион на табличных данных: XGBoost, LightGBM, CatBoost.Разбор: Деревья решений и ансамбли
Градиентный спускgradient descent
Итеративный алгоритм оптимизации: на каждом шаге параметры сдвигаются против градиента функции потерь — в сторону наискорейшего убывания ошибки. Им обучают почти всё, от регрессии до LLM.Разбор: Градиентный спуск
Двойной спускdouble descent
Феномен, при котором ошибка сильно перепараметризованных моделей после пика у точки интерполяции снова падает, нарушая классическую U-образную картину. Объясняет успех больших нейросетей.Разбор: Bias–variance: разложение ошибки
Декомпозиция рядаdecomposition
Разложение временного ряда на тренд (медленное движение уровня), сезонность (повторяющийся узор) и остаток (необъяснённый шум). Хорошая модель ловит первые две компоненты и не учит третью.Разбор: Временные ряды и прогнозирование
Дерево решенийdecision tree
Модель из последовательных вопросов «признак больше порога?», разрезающих пространство признаков на прямоугольные области. Интерпретируема, но нестабильна и на большой глубине переобучается.Разбор: Деревья решений и ансамбли
Дисбаланс классовclass imbalance
Ситуация, когда классов сильно не поровну, например один больной на сто здоровых. Делает accuracy и ROC-AUC обманчивыми; честнее смотреть precision, recall и PR-AUC.Разбор: Метрики качества
Дискриминативная модельdiscriminative model
Модель, которая сразу учит вероятность класса при данном входе — границу между классами, не тратя силы на моделирование самих данных. Пример — логистическая регрессия.Разбор: Теорема Байеса и наивный Байес
Доля объяснённой дисперсииexplained variance ratio
Часть общей дисперсии данных, приходящаяся на главную компоненту. По накопленной доле выбирают число компонент — обычно столько, чтобы суммарно объяснить 90–95% дисперсии.Разбор: Снижение размерности и PCA
Доля правильных ответовaccuracy
Доля объектов, для которых модель угадала класс. Обманчива при дисбалансе классов: константа «все здоровы» даёт 99% на выборке, где болен один из ста.Разбор: Метрики качества
Зазорmargin
Расстояние от разделяющей границы до ближайших точек классов. SVM его максимизирует: чем шире «улица» между классами, тем устойчивее классификация слегка сдвинутых новых точек.Разбор: SVM и kernel trick
Индекс ДжиниGini impurity
Мера «грязности» узла дерева: ноль, когда в узле объекты одного класса, максимум при равной смеси. Дерево жадно выбирает разрезы, сильнее всего снижающие эту грязность.Разбор: Деревья решений и ансамбли
Инерцияinertia
Сумма квадратов расстояний от точек до центров их кластеров — величина, которую минимизирует k-means. Монотонно падает с ростом числа кластеров, поэтому по ней одной число кластеров не выбрать.Разбор: kNN и кластеризация
Инженерия признаковfeature engineering
Придумывание и преобразование признаков — перевод знаний о задаче на язык чисел, понятный модели. На табличных данных удачная фича даёт больше, чем смена алгоритма.Разбор: Фичи и утечки данных (data leakage)
Исследование против использованияexploration vs exploitation
Ключевая дилемма обучения с подкреплением: пробовать новые действия ради потенциально большей награды или эксплуатировать уже найденную хорошую стратегию.Разбор: Типы обучения: с учителем, без и с подкреплением · Обучение с подкреплением: Q-learning и PPO
Кернел-трюкkernel trick
Приём, неявно переводящий данные в пространство большей размерности, где они линейно разделимы: ядро дёшево считает там скалярные произведения, не строя само отображение.Разбор: SVM и kernel trick
Классификацияclassification
Задача предсказания дискретного класса объекта: спам или нет, кошка или собака. Отличается от регрессии, где предсказывается непрерывное число.Разбор: Что такое машинное обучение
Кластеризацияclustering
Задача обучения без учителя: сгруппировать похожие объекты без готовых меток — сегменты клиентов, темы документов, дубликаты данных.Разбор: kNN и кластеризация
Компромисс смещения и разбросаbias-variance trade-off
Правило, по которому рост сложности модели снижает смещение, но раздувает разброс. Их сумма образует U-образную кривую ошибки; лучшее качество — на её дне.Разбор: Bias–variance: разложение ошибки · Переобучение и регуляризация
Кросс-валидацияcross-validation
Оценка качества по k разбиениям: данные делят на k частей, k раз обучаются на всех, кроме одной, и валидируются на оставшейся, метрики усредняют. Надёжнее одного сплита на малых данных.Разбор: Переобучение и регуляризация
Кросс-энтропияcross-entropy
Функция потерь для классификации, сравнивающая предсказанные вероятности с истинными метками. Почти бесконечно наказывает уверенные ошибки; с сигмоидой даёт выпуклую задачу, в отличие от MSE.Разбор: Логистическая регрессия и классификация · Распознавание цифр из пикселей
Лаговые признакиlag features
Значения ряда в прошлые моменты — вчера, неделю назад, — поданные модели как признаки. Превращают прогноз ряда в обычную табличную задачу, например для градиентного бустинга.Разбор: Временные ряды и прогнозирование
Латентная переменнаяlatent variable
Скрытая, не наблюдаемая величина, которую модель домысливает. В GMM это номер гауссианы, породившей точку: мы его не знаем, а EM оценивает вероятности каждого варианта.Разбор: EM-алгоритм и смеси гауссиан (GMM)
Ленивое обучениеlazy learning
Подход без фазы обучения: модель просто запоминает выборку, а все вычисления откладывает до момента предсказания. Классический пример — kNN с его дорогим поиском соседей на каждый запрос.Разбор: kNN и кластеризация
Линейная разделимостьlinear separability
Свойство данных, при котором классы можно идеально разделить прямой или гиперплоскостью. При полной разделимости веса логистической регрессии без регуляризации раздуваются бесконечно.Разбор: Логистическая регрессия и классификация · От нейрона к многослойному перцептрону
Линейная регрессияlinear regression
Модель, предсказывающая число как взвешенную сумму признаков плюс сдвиг. Обучение — подбор весов, при которых средняя ошибка на обучающих данных минимальна. Фундамент, на котором строится весь ML.Разбор: Линейная регрессия
Логистическая регрессияlogistic regression
Линейная модель классификации: считает взвешенную сумму признаков и пропускает её через сигмоиду, получая вероятность класса. Обучается минимизацией кросс-энтропии.Разбор: Логистическая регрессия и классификация
Локальный минимумlocal minimum
Точка, где функция потерь меньше, чем во всех соседних, но не обязательно минимальна глобально. Чисто градиентным шагом из такой «долины» не выбраться; помогают шум SGD и момент.Разбор: Градиентный спуск
Матрица ошибокconfusion matrix
Таблица четырёх исходов бинарной классификации: истинно и ложно положительные, истинно и ложно отрицательные. Из этих четырёх чисел собираются precision, recall и другие метрики.Разбор: Метрики качества
Машинное обучениеmachine learning
Подход, при котором программа не следует написанным вручную правилам, а выводит их из данных: подбирает параметры модели так, чтобы качество на задаче росло с накоплением опыта.Разбор: Что такое машинное обучение
Метод локтяelbow method
Способ выбрать число кластеров: рисуют зависимость инерции от k и ищут излом, после которого добавление кластера почти ничего не улучшает.Разбор: kNN и кластеризация
Метод k-среднихk-means
Алгоритм кластеризации: чередует приписывание точек к ближайшим центроидам и пересчёт центроидов как средних. Сходится всегда, но лишь к локальному минимуму; число кластеров задаётся заранее.Разбор: kNN и кластеризация
Мультиколлинеарностьmulticollinearity
Сильная корреляция между признаками, из-за которой отдельные веса линейной модели становятся нестабильными и теряют интерпретируемость. Лечится регуляризацией или отбором признаков.Разбор: Линейная регрессия
Мягкий зазорsoft margin
Версия SVM для зашумлённых данных: отдельным точкам разрешают нарушать зазор за штраф. Компромисс между шириной улицы и числом нарушений регулирует гиперпараметр C.Разбор: SVM и kernel trick
Мягкое отнесениеsoft assignment, responsibility
Вероятность принадлежности точки каждому кластеру: вместо жёсткого «этот» точка получает набор долей, сумма которых равна 1. Точки на границе честно делятся между кластерами, а не приписываются одному силой.Разбор: EM-алгоритм и смеси гауссиан (GMM)
Награда и отдачаreward and return
Награда — скалярный отклик среды на шаг. Отдача — сумма будущих наград с дисконтом γ: G=r+γ·r′+γ²·r″+…. Агент максимизирует именно отдачу, а не сиюминутную награду.Разбор: Обучение с подкреплением: Q-learning и PPO
Наивный Байесnaive Bayes
Классификатор на теореме Байеса с «наивным» допущением, что признаки условно независимы при данном классе. Обучается подсчётом частот за один проход; классика текстов и быстрый бейзлайн.Разбор: Теорема Байеса и наивный Байес
Наивный прогнозnaive forecast
Бейзлайн «завтра = сегодня» или «завтра = неделю назад» (сезонная версия). Обязательная планка качества: модель, не бьющая сезонный наивный прогноз, не даёт ценности.Разбор: Временные ряды и прогнозирование
Недообучениеunderfitting
Модель слишком проста, чтобы уловить закономерность: ошибка высока и на обучающих, и на новых данных. Лечится более выразительной моделью или лучшими признаками.Разбор: Переобучение и регуляризация
Неустранимый шумirreducible error
Дисперсия σ² случайности в самих данных — нижний предел ошибки, который не победить ни сложностью модели, ни объёмом данных. Ошибка на новых данных не опускается ниже него.Разбор: Bias–variance: разложение ошибки
Нормальное уравнениеnormal equation
Аналитическое решение линейной регрессии: оптимальные веса считаются одной матричной формулой без итераций. Непрактично при большом числе признаков из-за дорогого обращения матрицы.Разбор: Линейная регрессия
Обобщениеgeneralization
Способность модели правильно работать на данных, которых она не видела при обучении, — главная цель ML. Разрыв между качеством на обучающей и новых выборках — основной диагностический сигнал.Разбор: Что такое машинное обучение
Обучение без учителяunsupervised learning
Обучение без меток: сигналом служит сама структура данных. Модель группирует похожие объекты, сжимает признаки, находит аномалии — описывает, как устроены данные, а не проверяет ответы.Разбор: Типы обучения: с учителем, без и с подкреплением
Обучение с подкреплениемreinforcement learning
Обучение через действия: агент не получает правильных ответов, а действует в среде и получает награду, иногда отложенную. Методом проб и ошибок он учится действовать так, чтобы награды было больше.Разбор: Типы обучения: с учителем, без и с подкреплением · Обучение с подкреплением: Q-learning и PPO
Обучение с учителемsupervised learning
Обучение на парах «вход — правильный ответ»: модель минимизирует ошибку между своим предсказанием и меткой. Даёт точность, но требует дорогой ручной разметки данных.Разбор: Типы обучения: с учителем, без и с подкреплением
Опорные векторыsupport vectors
Точки обучающей выборки, лежащие на краю зазора: только они определяют положение границы SVM. Остальные объекты можно удалить — граница не изменится.Разбор: SVM и kernel trick
Переобучениеoverfitting
Модель заучивает обучающие данные вместе с шумом вместо закономерности: почти нулевая ошибка на трейне и большая на новых данных. Признак — заметный разрыв между train- и validation-ошибкой.Разбор: Переобучение и регуляризация
Политикаpolicy
Правило поведения агента — отображение состояния в действие (или в распределение действий). Именно политику RL и оптимизирует; при выученной Q-функции она сводится к выбору действия с максимальным Q.Разбор: Обучение с подкреплением: Q-learning и PPO
Полнотаrecall
Доля найденных моделью положительных объектов среди всех настоящих положительных: «скольких больных мы поймали». Важна, когда дороже всего пропуск.Разбор: Метрики качества
Порог классификацииdecision threshold
Значение скора, выше которого модель относит объект к положительному классу. Понижение порога растит полноту, но роняет точность; положение порога диктует цена ошибок в бизнесе.Разбор: Метрики качества
Правдоподобиеlikelihood
Вероятность наблюдаемых данных при текущих параметрах модели. EM максимизирует лог-правдоподобие и гарантированно не уменьшает его на каждом шаге, но сходится лишь к локальному оптимуму.Разбор: EM-алгоритм и смеси гауссиан (GMM) · Теорема Байеса и наивный Байес
Приорprior
Априорная вероятность гипотезы — вера в неё до появления улик, например базовая частота болезни в популяции. Один из двух множителей в теореме Байеса.Разбор: Теорема Байеса и наивный Байес
Проклятие размерностиcurse of dimensionality
Эффект высоких размерностей: расстояния между всеми парами точек становятся почти одинаковыми, и «ближайший сосед» теряет смысл. Ломает kNN и k-means; лечится снижением размерности.Разбор: Снижение размерности и PCA
Разбросvariance
Чувствительность модели к конкретной обучающей выборке: насколько её предсказания меняются от выборки к выборке. Велик у слишком гибких моделей, которые цепляются за шум и переобучаются.Разбор: Bias–variance: разложение ошибки
Разложение ошибкиbias-variance decomposition
Представление ожидаемой квадратичной ошибки модели как суммы трёх слагаемых: смещение² + разброс + неустранимый шум. Основной язык для анализа недо- и переобучения.Разбор: Bias–variance: разложение ошибки
Разрежённая наградаsparse reward
Ситуация, когда награда приходит редко — обычно лишь в конце длинной цепочки действий (мат, победа). Обучающего сигнала почти нет; частично лечится reward shaping, но с ним легко научить агента не тому.Разбор: Обучение с подкреплением: Q-learning и PPO
Ранняя остановкаearly stopping
Остановка обучения в момент минимума ошибки на валидационной выборке — до того, как модель перейдёт от выучивания закономерности к запоминанию шума.Разбор: Переобучение и регуляризация · Практика обучения: батчи, dropout, batchnorm
Регуляризацияregularization
Штраф за большие веса, добавляемый к функции потерь, чтобы ограничить сложность модели и снизить переобучение, не упрощая саму модель. Сила штрафа управляется отдельным коэффициентом.Разбор: Переобучение и регуляризация
Решающая границаdecision boundary
Поверхность в пространстве признаков, разделяющая области, где модель предсказывает разные классы. У логистической регрессии граница всегда линейна, несмотря на нелинейную сигмоиду.Разбор: Логистическая регрессия и классификация
Сглаживание ЛапласаLaplace smoothing
Добавление виртуального счётчика +1 при оценке частот в наивном Байесе, чтобы слово, не встречавшееся в классе, не давало нулевую вероятность и не зануляло всё произведение.Разбор: Теорема Байеса и наивный Байес
Седловая точкаsaddle point
Точка с почти нулевым градиентом, не являющаяся минимумом: по одним направлениям функция растёт, по другим убывает. В высоких размерностях именно сёдла чаще всего тормозят обучение.Разбор: Градиентный спуск
Сигмоидаsigmoid
Гладкая S-образная функция, сжимающая любое число в интервал от 0 до 1. Превращает линейный скор в вероятность класса в логистической регрессии и нейросетях.Разбор: Логистическая регрессия и классификация · Функции активации
Скорость обученияlearning rate
Множитель, задающий длину шага градиентного спуска. Слишком маленький — обучение мучительно медленное, слишком большой — ошибка начинает расти и процесс расходится.Разбор: Градиентный спуск · Оптимизаторы: SGD, Momentum, Adam
Случайный лесrandom forest
Бэггинг над глубокими деревьями плюс случайное подмножество признаков в каждом узле: деревья разнообразнее, усреднение сильнее гасит разброс. Крепкий бейзлайн на табличных данных.Разбор: Деревья решений и ансамбли
Смесь гауссианGaussian Mixture Model, GMM
Вероятностная модель кластеризации: данные считаются смесью нескольких гауссиан, каждая со своим центром, ковариацией (форма и наклон эллипса) и весом. В отличие от k-means умеет вытянутые и наклонённые кластеры разного размера.Разбор: EM-алгоритм и смеси гауссиан (GMM)
Смещениеbias
Систематическая ошибка модели: отклонение её усреднённого по выборкам предсказания от истины. Велико у слишком простых моделей — они не способны поймать закономерность и недообучаются.Разбор: Bias–variance: разложение ошибки · От нейрона к многослойному перцептрону
Снижение размерностиdimensionality reduction
Сжатие пространства признаков с сохранением главной структуры данных — ради визуализации, скорости, борьбы с шумом и проклятием размерности.Разбор: Снижение размерности и PCA
Стандартизацияstandardization
Приведение признака к нулевому среднему и единичному разбросу. Обязательна перед методами на расстояниях и регуляризацией; параметры считаются только по обучающей выборке.Разбор: Фичи и утечки данных (data leakage)
Стратифицированная k-foldstratified k-fold
Разбиение на фолды, сохраняющее долю классов в каждом фолде. Нужно при несбалансированных классах, иначе редкий класс может целиком провалиться в один фолд и оценка станет нестабильной.Разбор: Кросс-валидация и подбор гиперпараметров
Таргет-кодированиеtarget encoding
Замена категории средним значением целевой переменной по ней. Компактно и мощно, но без out-of-fold-схемы редкие категории запоминают свой таргет — получается микро-утечка.Разбор: Фичи и утечки данных (data leakage)
Теорема БайесаBayes' theorem
Правило пересчёта вероятности гипотезы при появлении новых данных: апостериорная вероятность пропорциональна приору, умноженному на правдоподобие улик.Разбор: Теорема Байеса и наивный Байес
Тестовая выборкаtest set
«Неприкосновенная» часть данных, которую трогают один раз в самом конце — для честной итоговой оценки модели. Многократная подстройка решений под тест завышает оценку качества.Разбор: Что такое машинное обучение
Точностьprecision
Доля действительно положительных среди всех объектов, которые модель назвала положительными: «сколько из наших тревог — настоящие». Важна, когда дорога ложная тревога.Разбор: Метрики качества · Видеокарты и VRAM: железо для нейросетей
Трансферное обучениеtransfer learning
Перенос знаний с одной задачи на другую: берут модель, обученную на большой выборке, и дообучают на своей задаче. Позволяет учиться на малых данных быстрее и точнее, чем с нуля.Разбор: Типы обучения: с учителем, без и с подкреплением
Уравнение БеллманаBellman equation
Рекурсия, связывающая ценность действия сейчас с ценностью следующего шага: Q(s,a)=r+γ·max Q(s′,·). Q-learning подгоняет оценки Q к этому равенству на опыте, минимизируя TD-ошибку.Разбор: Обучение с подкреплением: Q-learning и PPO
Утечка данныхdata leakage
Попадание в признаки информации, которой в момент предсказания ещё нет: поля, заполненные после события, предобработка до сплита, будущее в трейне. Симптом — блестящая оффлайн-метрика и провал в проде.Разбор: Фичи и утечки данных (data leakage)
Утечка при подбореtuning data leakage
Подбор гиперпараметров по тестовой выборке или подготовка признаков по всем данным до разбиения. Информация из проверки просачивается в обучение и завышает оценку качества.Разбор: Кросс-валидация и подбор гиперпараметров
Функция потерьloss function
Число, измеряющее, насколько предсказания модели плохи на данных. Обучение любой модели — поиск параметров, при которых функция потерь минимальна.Разбор: Линейная регрессия
Центроидcentroid
Центр кластера — среднее всех его точек. В k-means центроиды пересчитываются на каждой итерации, а точки приписываются к ближайшему из них.Разбор: kNN и кластеризация
Частичное обучениеsemi-supervised learning
Комбинация малого числа размеченных примеров и большого объёма неразмеченных: модель учится структуре на неразмеченных данных и уточняет ответы по редким меткам.Разбор: Типы обучения: с учителем, без и с подкреплением
Экспоненциальное сглаживаниеexponential smoothing
Прогноз как взвешенное среднее прошлых значений ряда, где свежие точки весят больше. Версии с трендом и сезонностью известны как метод Холта-Уинтерса.Разбор: Временные ряды и прогнозирование
Ядроkernel
Функция от пары объектов, равная скалярному произведению их образов в спрямляющем пространстве, — по сути мера похожести. Позволяет SVM строить нелинейные границы.Разбор: SVM и kernel trick
ARIMAautoregressive integrated moving average
Классическая модель прогнозирования: следующая точка — линейная комбинация прошлых значений ряда и прошлых ошибок после устранения тренда разностями. Ряд объясняется собственным прошлым.Разбор: Временные ряды и прогнозирование
AUCarea under curve
Площадь под ROC-кривой: вероятность того, что случайный положительный объект получит скор выше случайного отрицательного. 0.5 — уровень монетки, 1 — идеальное ранжирование.Разбор: Метрики качества
DBSCANdensity-based spatial clustering of applications with noise
Плотностная кластеризация: растит кластеры из плотных областей, сама определяет их число и помечает выбросы как шум. Справляется с невыпуклыми формами, на которых k-means ломается.Разбор: kNN и кластеризация
E-шагExpectation step
Шаг EM, на котором при текущих параметрах модели для каждой точки пересчитываются ответственности — мягкие вероятности её принадлежности каждому кластеру.Разбор: EM-алгоритм и смеси гауссиан (GMM)
EM-алгоритмExpectation-Maximization
Итеративная схема обучения моделей со скрытыми переменными: E-шаг при фиксированных параметрах считает ответственности, M-шаг при фиксированных ответственностях обновляет параметры. Каждый цикл не уменьшает правдоподобие.Разбор: EM-алгоритм и смеси гауссиан (GMM)
F1-мераf1 score
Гармоническое среднее precision и recall: сворачивает обе метрики в одно число и жёстко штрафует сильный перекос в любую из сторон.Разбор: Метрики качества
k-fold кросс-валидацияk-fold cross-validation
Данные делят на k частей и k раз обучаются на k−1 из них, проверяясь на оставшейся. Итог — среднее метрик и их разброс; каждая точка ровно один раз побывает в валидации.Разбор: Кросс-валидация и подбор гиперпараметров
kNNk-nearest neighbors
Метод k ближайших соседей: класс нового объекта определяется голосованием меток k самых близких точек обучающей выборки, для регрессии значения усредняются. Обязательна нормализация признаков.Разбор: kNN и кластеризация
L1-регуляризацияlasso
Штраф в виде суммы модулей весов: из-за «острого угла» модуля в нуле выталкивает часть весов ровно в ноль, за счёт чего работает как встроенный отбор признаков.Разбор: Переобучение и регуляризация
L2-регуляризацияridge
Штраф в виде суммы квадратов весов: равномерно прижимает все веса к нулю, не обнуляя их. Гладкая и удобная для оптимизации, стабилизирует модель при скоррелированных признаках.Разбор: Переобучение и регуляризация
Leave-one-outleave-one-out (LOO)
Крайний случай кросс-валидации, где число фолдов равно числу объектов: каждый объект по очереди служит валидацией. Оценка почти несмещённая, но вычислительно дорогая и с большим разбросом.Разбор: Кросс-валидация и подбор гиперпараметров
M-шагMaximization step
Шаг EM, на котором при зафиксированных ответственностях обновляются параметры кластеров: центры, ковариации и веса пересчитываются как взвешенные средние по всем точкам.Разбор: EM-алгоритм и смеси гауссиан (GMM)
MAPEmean absolute percentage error
Средняя абсолютная ошибка в процентах от фактического значения — удобно сравнивать ряды разного масштаба. Взрывается на рядах около нуля; тогда берут MAE или sMAPE.Разбор: Временные ряды и прогнозирование
MSEmean squared error
Среднеквадратичная ошибка: средний квадрат разницы между предсказанием и правдой. Гладкая и удобная для оптимизации, сильнее штрафует большие промахи, поэтому чувствительна к выбросам.Разбор: Линейная регрессия
One-hot кодированиеone-hot encoding
Кодирование категориального признака набором бинарных колонок — по одной на каждое возможное значение. Просто и безопасно, но взрывается на признаках с тысячами категорий.Разбор: Фичи и утечки данных (data leakage)
PCAprincipal component analysis
Метод главных компонент: поворачивает систему координат так, чтобы максимум дисперсии собрался в первых осях, и отбрасывает остальные. Лучшее линейное сжатие по среднеквадратичной ошибке.Разбор: Снижение размерности и PCA
Policy gradientpolicy gradient
Семейство методов, напрямую параметризующих политику π_θ и сдвигающих её веса в сторону большей отдачи. Базовый REINFORCE повышает вероятности действий из удачных эпизодов; актор-критик снижает дисперсию опорой.Разбор: Обучение с подкреплением: Q-learning и PPO
Q-learningQ-learning
Метод на основе ценности: учит Q(s,a) обновлением Q ← Q+α·[r+γ·max Q(s′,·)−Q] к цели Беллмана. Off-policy — обновляется по лучшему следующему действию, даже если реально сходил наугад.Разбор: Обучение с подкреплением: Q-learning и PPO
coefficient of determination
Доля дисперсии целевой переменной, которую объясняет модель: единица — идеальное предсказание, ноль — не лучше, чем всегда предсказывать среднее значение.Разбор: Линейная регрессия
RBF-ядроradial basis function
Самое популярное ядро SVM: похожесть, экспоненциально падающая с расстоянием между точками. Параметр gamma задаёт радиус влияния точки; слишком большой — переобучение «островками».Разбор: SVM и kernel trick
ROC-криваяreceiver operating characteristic curve
График доли пойманных позитивов против доли ложных тревог при всех порогах сразу. Идеальная модель прижимается к левому верхнему углу, случайная идёт по диагонали.Разбор: Метрики качества
SGDstochastic gradient descent
Стохастический градиентный спуск: градиент оценивается не по всему датасету, а по одному примеру или небольшому мини-батчу. Шаги шумные, но дешёвые; шум помогает выскакивать из плохих минимумов.Разбор: Градиентный спуск · Оптимизаторы: SGD, Momentum, Adam
Softmaxsoftmax
Обобщение сигмоиды на много классов: превращает произвольные числа-скоры в распределение вероятностей — все положительны и в сумме дают единицу. Стоит в выходном слое классификаторов и LLM.Разбор: Логистическая регрессия и классификация · Функции активации
SVMsupport vector machine
Метод опорных векторов — классификатор, проводящий границу с максимальным зазором до ближайших точек обоих классов. Широкий зазор даёт запас прочности и лучшее обобщение.Разбор: SVM и kernel trick
t-SNEt-distributed stochastic neighbor embedding
Нелинейный метод визуализации: вкладывает данные в 2D, сохраняя локальные окрестности точек. Расстояния между кластерами на картинке не интерпретируются — инструмент разглядывания, а не измерения.Разбор: Снижение размерности и PCA
Walk-forward валидацияwalk-forward validation
Валидация рядов расширяющимся окном: обучение на данных до точки, прогноз следующего отрезка, сдвиг границы и усреднение ошибок. Честная замена random split, который подсматривает в будущее.Разбор: Временные ряды и прогнозирование