Глоссарий: Продакшн и качество
42 термина раздела «Продакшн и качество» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.
- Бейзлайнbaseline
- Простое стартовое решение: правила, логистическая регрессия, «рекомендуем популярное». Даёт точку отсчёта, проверяет пайплайн данных и честно отвечает, нужен ли здесь ML вообще.Разбор: Дизайн ML-систем на собеседовании · Распознавание цифр из пикселей
- Джейлбрейкjailbreak
- Попытка самого пользователя уговорить модель нарушить её правила. Отличается от prompt injection, где вредоносные инструкции спрятаны в читаемых моделью данных, а пользователь — жертва.Разбор: Безопасность: guardrails и prompt injection
- Дрифт данныхdata drift, covariate shift
- Изменение распределения входных данных при прежней связи входов с целевой переменной: модель смотрит на данные, не похожие на обучающие, но продолжает уверенно предсказывать.Разбор: Мониторинг и дрифт данных
- Дрифт концепцииconcept drift
- Изменение самой связи между входами и целевой переменной — например, мошенники сменили схему. Самый коварный вид дрифта: входы могут выглядеть как раньше, и мониторинг распределений молчит.Разбор: Мониторинг и дрифт данных
- Дрифт лейбловlabel drift, prior shift
- Изменение распределения целевой переменной: доля спама выросла с 5% до 20%, и откалиброванные пороги модели поплыли.Разбор: Мониторинг и дрифт данных
- Единица рандомизацииrandomization unit
- Кто попадает в группу эксперимента целиком — обычно пользователь, а не сессия или запрос. Иначе один человек увидит обе версии, и эффекты смешаются.Разбор: A/B-тесты и продуктовые метрики
- Интерливингinterleaving
- Чувствительный способ сравнить два ранкера: их результаты перемешиваются в одну выдачу, и по кликам видно, чьи документы предпочитают. Каждый пользователь сравнивает обе модели сразу.Разбор: A/B-тесты и продуктовые метрики
- Коллаборативная фильтрацияcollaborative filtering
- Рекомендации по поведению: люди с похожими вкусами любят похожее. Признаки контента не нужны — только история взаимодействий; варианты user-based и item-based.Разбор: Рекомендательные системы
- Контентная фильтрацияcontent-based filtering
- Рекомендации по признакам самого объекта: жанр, текст описания, эмбеддинг обложки. Работает даже для объектов, которые ещё никто не видел, — спасение при холодном старте.Разбор: Рекомендательные системы
- Матричное разложениеmatrix factorization
- Приближение разреженной матрицы «пользователи × объекты» произведением двух узких матриц: у каждого пользователя и объекта появляется латентный вектор, предсказание — их скалярное произведение.Разбор: Рекомендательные системы
- Многорукие бандитыmulti-armed bandits
- Алгоритмы баланса разведки и эксплуатации: часть трафика тратится на исследование новых вариантов, остальное — на проверенно лучшие. Формализуют разведку в рекомендациях и экспериментах.Разбор: Рекомендательные системы
- Наименьшие привилегииleast privilege
- Принцип: у инструмента агента ровно те права, что нужны задаче — читать одну папку, а не всю почту; создать черновик, а не отправить письмо. Лишние полномочия атакующий найдёт как применить.Разбор: Безопасность: guardrails и prompt injection
- Неявный фидбекimplicit feedback
- Сигналы вместо явных оценок: клики, просмотры, дочитывания, покупки. Отсутствие клика не значит «не нравится» — объект могли просто не показать, поэтому пропуски взвешивают осторожно.Разбор: Рекомендательные системы
- Петля обратной связиfeedback loop
- Модель учится на кликах по собственным рекомендациям: что показали, то и кликают, и лог всё меньше отражает истинные вкусы. Без разведки и поправок на позицию система застревает в самоподтверждении.Разбор: Рекомендательные системы
- Подглядываниеpeeking
- Ежедневная проверка p-value с остановкой теста при первом значимом результате. Раздувает долю ложных срабатываний с 5% до десятков процентов; длительность фиксируют до запуска.Разбор: A/B-тесты и продуктовые метрики
- Признаки запрос-документquery-document features
- Входы LTR-модели: лексические совпадения (BM25, TF-IDF), семантическая близость эмбеддингов, свежесть, авторитетность, историческая кликабельность. Модель работает с ними, а не с сырым текстом.Разбор: Ранжирование: learning-to-rank
- Прокси-сигналыproxy metrics
- Наблюдаемые сразу показатели вместо запаздывающих лейблов: дрифт входных фичей, распределение предсказаний, доля пропусков и отказов. Качество модели в проде напрямую не видно — мониторят входы и выходы.Разбор: Мониторинг и дрифт данных
- Рекомендательная системаrecommender system
- Система, предсказывающая, что понравится пользователю, и отбирающая для него десяток объектов из каталога в миллионы за десятки миллисекунд.Разбор: Рекомендательные системы
- Ретрейнингretraining
- Обновление модели на свежих данных: по расписанию (просто, но модель стареет между циклами) или по триггеру от дрифт-алертов (экономнее, но требует зрелой автоматики).Разбор: Мониторинг и дрифт данных
- Смертельная триадаlethal trifecta
- Опасное сочетание у агента: доступ к приватным данным, обработка недоверенного контента и возможность внешних действий. Когда есть все три, утечка — вопрос времени; убирайте хотя бы один угол.Разбор: Безопасность: guardrails и prompt injection
- Смещение позицииposition bias
- Верхние документы кликают чаще из-за самой позиции, а не большей релевантности. Обучаясь на сырых кликах, LTR-модель консервирует старый порядок. Лечится IPW и моделями клика.Разбор: Ранжирование: learning-to-rank
- Сплит по времениtime-based split
- Валидация моделей на временных данных: обучение на прошлом, тест на будущем. Случайное перемешивание подсовывает модели будущее — метрики завышены, в проде провал.Разбор: Дизайн ML-систем на собеседовании
- Фолбэкfallback
- Запасное поведение продукта при отказе ML-сервиса: правила, кэш или «популярное». План на отказ — обязательная часть дизайна системы; ответ «лента будет пустой» не принимается.Разбор: Дизайн ML-систем на собеседовании
- Холодный стартcold start
- Проблема нового объекта или пользователя без истории взаимодействий. Лечится контентными признаками, показом популярного, онбордингом и разведочными показами.Разбор: Рекомендательные системы
- Цена ошибкиcost of fp vs fn
- Соотношение ущерба от ложного срабатывания и от пропуска, определяющее метрики и пороги системы. Во фроде ложное срабатывание — заблокированный честный клиент, пропуск — украденные деньги.Разбор: Дизайн ML-систем на собеседовании
- Человек в контуреhuman-in-the-loop
- Требование явного подтверждения человеком для необратимых и внешних действий агента: отправки письма, платежа, удаления данных. Граница, которую prompt injection обойти не может.Разбор: Безопасность: guardrails и prompt injection
- Экзфильтрация данныхdata exfiltration
- Вывод приватных данных наружу через действия скомпрометированного агента: инъекция в письме заставляет агента с доступом к почте самому переслать переписку атакующему.Разбор: Безопасность: guardrails и prompt injection
- Эшелонированная оборонаdefense in depth
- Несколько независимых слоёв защиты: валидация входов и выходов, разметка границ данных, ограничение прав, подтверждения человека. Пропущенное одним слоем ловит следующий.Разбор: Безопасность: guardrails и prompt injection
- A/B-тестa/b testing
- Контролируемый эксперимент: пользователи случайно делятся на контроль и тест, и различие метрик можно приписать изменению продукта, а не составу групп. Единственный честный судья онлайн-эффекта.Разбор: A/B-тесты и продуктовые метрики
- DCGdiscounted cumulative gain
- Сумма выигрышей документов топ-k с дисконтом по позиции: чем ниже позиция, тем больше делитель log2(i+1), поэтому релевантное внизу приносит мало пользы.Разбор: Ранжирование: learning-to-rank
- Guardrail-метрикиguardrail metrics
- Метрики-предохранители эксперимента, которые не должны просесть: латентность, жалобы, отток. Рост конверсии ценой удвоившейся задержки — не победа.Разбор: A/B-тесты и продуктовые метрики
- Guardrailsguardrails
- Защитные механизмы вокруг LLM-приложения: модерационные классификаторы, валидация схем входов и выходов, ограничение тем и полномочий. Главное — что агент может сделать, а не что сказать.Разбор: Безопасность: guardrails и prompt injection
- Learning-to-ranklearning to rank, LTR
- Обучение модели упорядочивать документы под запрос. В отличие от регрессии, важен относительный порядок внутри запроса, а не абсолютная величина скора.Разбор: Ранжирование: learning-to-rank
- Listwise-подходlistwise
- Семейство LTR, оптимизирующее метрику всего списка целиком. LambdaMART (бустинг плюс лямбды под NDCG) — рабочая лошадка индустрии; ListNet сравнивает распределения перестановок.Разбор: Ранжирование: learning-to-rank
- ML system designml system design
- Дисциплина и тип интервью: довести ML от продуктовой цели до работающей системы. Порядок — цель, метрики, данные, бейзлайн, модель, валидация, деплой, мониторинг; модель лишь пятый шаг из восьми.Разбор: Дизайн ML-систем на собеседовании
- Pairwise-подходpairwise
- Семейство LTR, где модель учится для пары документов определять, какой релевантнее, минимизируя число инверсий. Классика — RankNet и LambdaRank.Разбор: Ранжирование: learning-to-rank
- Pointwise-подходpointwise
- Семейство LTR, где релевантность каждого документа предсказывается по отдельности обычной регрессией или классификацией, а список сортируется по предсказанию. Просто, но лосс игнорирует порядок.Разбор: Ранжирование: learning-to-rank
- Prompt injectionprompt injection
- Вредоносные инструкции, спрятанные в данных — письме, веб-странице, результате вызова инструмента, — которые перехватывают управление моделью. Пользователь при этом жертва, атакует автор контента.Разбор: Безопасность: guardrails и prompt injection
- PSIpopulation stability index
- Классическая метрика сдвига распределения: значения фичи разбивают на корзины и сравнивают доли в проде и в обучении. Ориентиры из кредитного скоринга: меньше 0.1 — спокойно, больше 0.2 — распределение уехало.Разбор: Мониторинг и дрифт данных
- Shadow modeshadow mode
- Теневой запуск: новая модель получает реальный трафик и пишет предсказания в лог, но пользователям их не показывает. Позволяет сравнить поведение моделей без риска перед A/B-тестом.Разбор: Мониторинг и дрифт данных
- SRMsample ratio mismatch
- Расхождение фактического деления трафика с ожидаемым — 52/48 вместо 50/50. Значит, рандомизация сломана (баг трекинга, фильтрация ботов), и результатам верить нельзя при любом p-value.Разбор: A/B-тесты и продуктовые метрики
- Two-towertwo-tower model
- Модель retrieval-этапа рекомендаций: две «башни»-энкодера кодируют пользователя и объект в общее векторное пространство. Векторы объектов предвычислены и лежат в ANN-индексе — отбор за миллисекунды.Разбор: Рекомендательные системы