Диагностика Mock-интервью
Главная · Глоссарий · Продакшн и качество

Глоссарий: Продакшн и качество

42 термина раздела «Продакшн и качество» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.

Бейзлайнbaseline
Простое стартовое решение: правила, логистическая регрессия, «рекомендуем популярное». Даёт точку отсчёта, проверяет пайплайн данных и честно отвечает, нужен ли здесь ML вообще.Разбор: Дизайн ML-систем на собеседовании · Распознавание цифр из пикселей
Джейлбрейкjailbreak
Попытка самого пользователя уговорить модель нарушить её правила. Отличается от prompt injection, где вредоносные инструкции спрятаны в читаемых моделью данных, а пользователь — жертва.Разбор: Безопасность: guardrails и prompt injection
Дрифт данныхdata drift, covariate shift
Изменение распределения входных данных при прежней связи входов с целевой переменной: модель смотрит на данные, не похожие на обучающие, но продолжает уверенно предсказывать.Разбор: Мониторинг и дрифт данных
Дрифт концепцииconcept drift
Изменение самой связи между входами и целевой переменной — например, мошенники сменили схему. Самый коварный вид дрифта: входы могут выглядеть как раньше, и мониторинг распределений молчит.Разбор: Мониторинг и дрифт данных
Дрифт лейбловlabel drift, prior shift
Изменение распределения целевой переменной: доля спама выросла с 5% до 20%, и откалиброванные пороги модели поплыли.Разбор: Мониторинг и дрифт данных
Единица рандомизацииrandomization unit
Кто попадает в группу эксперимента целиком — обычно пользователь, а не сессия или запрос. Иначе один человек увидит обе версии, и эффекты смешаются.Разбор: A/B-тесты и продуктовые метрики
Интерливингinterleaving
Чувствительный способ сравнить два ранкера: их результаты перемешиваются в одну выдачу, и по кликам видно, чьи документы предпочитают. Каждый пользователь сравнивает обе модели сразу.Разбор: A/B-тесты и продуктовые метрики
Коллаборативная фильтрацияcollaborative filtering
Рекомендации по поведению: люди с похожими вкусами любят похожее. Признаки контента не нужны — только история взаимодействий; варианты user-based и item-based.Разбор: Рекомендательные системы
Контентная фильтрацияcontent-based filtering
Рекомендации по признакам самого объекта: жанр, текст описания, эмбеддинг обложки. Работает даже для объектов, которые ещё никто не видел, — спасение при холодном старте.Разбор: Рекомендательные системы
Матричное разложениеmatrix factorization
Приближение разреженной матрицы «пользователи × объекты» произведением двух узких матриц: у каждого пользователя и объекта появляется латентный вектор, предсказание — их скалярное произведение.Разбор: Рекомендательные системы
Многорукие бандитыmulti-armed bandits
Алгоритмы баланса разведки и эксплуатации: часть трафика тратится на исследование новых вариантов, остальное — на проверенно лучшие. Формализуют разведку в рекомендациях и экспериментах.Разбор: Рекомендательные системы
Наименьшие привилегииleast privilege
Принцип: у инструмента агента ровно те права, что нужны задаче — читать одну папку, а не всю почту; создать черновик, а не отправить письмо. Лишние полномочия атакующий найдёт как применить.Разбор: Безопасность: guardrails и prompt injection
Неявный фидбекimplicit feedback
Сигналы вместо явных оценок: клики, просмотры, дочитывания, покупки. Отсутствие клика не значит «не нравится» — объект могли просто не показать, поэтому пропуски взвешивают осторожно.Разбор: Рекомендательные системы
Петля обратной связиfeedback loop
Модель учится на кликах по собственным рекомендациям: что показали, то и кликают, и лог всё меньше отражает истинные вкусы. Без разведки и поправок на позицию система застревает в самоподтверждении.Разбор: Рекомендательные системы
Подглядываниеpeeking
Ежедневная проверка p-value с остановкой теста при первом значимом результате. Раздувает долю ложных срабатываний с 5% до десятков процентов; длительность фиксируют до запуска.Разбор: A/B-тесты и продуктовые метрики
Признаки запрос-документquery-document features
Входы LTR-модели: лексические совпадения (BM25, TF-IDF), семантическая близость эмбеддингов, свежесть, авторитетность, историческая кликабельность. Модель работает с ними, а не с сырым текстом.Разбор: Ранжирование: learning-to-rank
Прокси-сигналыproxy metrics
Наблюдаемые сразу показатели вместо запаздывающих лейблов: дрифт входных фичей, распределение предсказаний, доля пропусков и отказов. Качество модели в проде напрямую не видно — мониторят входы и выходы.Разбор: Мониторинг и дрифт данных
Рекомендательная системаrecommender system
Система, предсказывающая, что понравится пользователю, и отбирающая для него десяток объектов из каталога в миллионы за десятки миллисекунд.Разбор: Рекомендательные системы
Ретрейнингretraining
Обновление модели на свежих данных: по расписанию (просто, но модель стареет между циклами) или по триггеру от дрифт-алертов (экономнее, но требует зрелой автоматики).Разбор: Мониторинг и дрифт данных
Смертельная триадаlethal trifecta
Опасное сочетание у агента: доступ к приватным данным, обработка недоверенного контента и возможность внешних действий. Когда есть все три, утечка — вопрос времени; убирайте хотя бы один угол.Разбор: Безопасность: guardrails и prompt injection
Смещение позицииposition bias
Верхние документы кликают чаще из-за самой позиции, а не большей релевантности. Обучаясь на сырых кликах, LTR-модель консервирует старый порядок. Лечится IPW и моделями клика.Разбор: Ранжирование: learning-to-rank
Сплит по времениtime-based split
Валидация моделей на временных данных: обучение на прошлом, тест на будущем. Случайное перемешивание подсовывает модели будущее — метрики завышены, в проде провал.Разбор: Дизайн ML-систем на собеседовании
Фолбэкfallback
Запасное поведение продукта при отказе ML-сервиса: правила, кэш или «популярное». План на отказ — обязательная часть дизайна системы; ответ «лента будет пустой» не принимается.Разбор: Дизайн ML-систем на собеседовании
Холодный стартcold start
Проблема нового объекта или пользователя без истории взаимодействий. Лечится контентными признаками, показом популярного, онбордингом и разведочными показами.Разбор: Рекомендательные системы
Цена ошибкиcost of fp vs fn
Соотношение ущерба от ложного срабатывания и от пропуска, определяющее метрики и пороги системы. Во фроде ложное срабатывание — заблокированный честный клиент, пропуск — украденные деньги.Разбор: Дизайн ML-систем на собеседовании
Человек в контуреhuman-in-the-loop
Требование явного подтверждения человеком для необратимых и внешних действий агента: отправки письма, платежа, удаления данных. Граница, которую prompt injection обойти не может.Разбор: Безопасность: guardrails и prompt injection
Экзфильтрация данныхdata exfiltration
Вывод приватных данных наружу через действия скомпрометированного агента: инъекция в письме заставляет агента с доступом к почте самому переслать переписку атакующему.Разбор: Безопасность: guardrails и prompt injection
Эшелонированная оборонаdefense in depth
Несколько независимых слоёв защиты: валидация входов и выходов, разметка границ данных, ограничение прав, подтверждения человека. Пропущенное одним слоем ловит следующий.Разбор: Безопасность: guardrails и prompt injection
A/B-тестa/b testing
Контролируемый эксперимент: пользователи случайно делятся на контроль и тест, и различие метрик можно приписать изменению продукта, а не составу групп. Единственный честный судья онлайн-эффекта.Разбор: A/B-тесты и продуктовые метрики
DCGdiscounted cumulative gain
Сумма выигрышей документов топ-k с дисконтом по позиции: чем ниже позиция, тем больше делитель log2(i+1), поэтому релевантное внизу приносит мало пользы.Разбор: Ранжирование: learning-to-rank
Guardrail-метрикиguardrail metrics
Метрики-предохранители эксперимента, которые не должны просесть: латентность, жалобы, отток. Рост конверсии ценой удвоившейся задержки — не победа.Разбор: A/B-тесты и продуктовые метрики
Guardrailsguardrails
Защитные механизмы вокруг LLM-приложения: модерационные классификаторы, валидация схем входов и выходов, ограничение тем и полномочий. Главное — что агент может сделать, а не что сказать.Разбор: Безопасность: guardrails и prompt injection
Learning-to-ranklearning to rank, LTR
Обучение модели упорядочивать документы под запрос. В отличие от регрессии, важен относительный порядок внутри запроса, а не абсолютная величина скора.Разбор: Ранжирование: learning-to-rank
Listwise-подходlistwise
Семейство LTR, оптимизирующее метрику всего списка целиком. LambdaMART (бустинг плюс лямбды под NDCG) — рабочая лошадка индустрии; ListNet сравнивает распределения перестановок.Разбор: Ранжирование: learning-to-rank
ML system designml system design
Дисциплина и тип интервью: довести ML от продуктовой цели до работающей системы. Порядок — цель, метрики, данные, бейзлайн, модель, валидация, деплой, мониторинг; модель лишь пятый шаг из восьми.Разбор: Дизайн ML-систем на собеседовании
Pairwise-подходpairwise
Семейство LTR, где модель учится для пары документов определять, какой релевантнее, минимизируя число инверсий. Классика — RankNet и LambdaRank.Разбор: Ранжирование: learning-to-rank
Pointwise-подходpointwise
Семейство LTR, где релевантность каждого документа предсказывается по отдельности обычной регрессией или классификацией, а список сортируется по предсказанию. Просто, но лосс игнорирует порядок.Разбор: Ранжирование: learning-to-rank
Prompt injectionprompt injection
Вредоносные инструкции, спрятанные в данных — письме, веб-странице, результате вызова инструмента, — которые перехватывают управление моделью. Пользователь при этом жертва, атакует автор контента.Разбор: Безопасность: guardrails и prompt injection
PSIpopulation stability index
Классическая метрика сдвига распределения: значения фичи разбивают на корзины и сравнивают доли в проде и в обучении. Ориентиры из кредитного скоринга: меньше 0.1 — спокойно, больше 0.2 — распределение уехало.Разбор: Мониторинг и дрифт данных
Shadow modeshadow mode
Теневой запуск: новая модель получает реальный трафик и пишет предсказания в лог, но пользователям их не показывает. Позволяет сравнить поведение моделей без риска перед A/B-тестом.Разбор: Мониторинг и дрифт данных
SRMsample ratio mismatch
Расхождение фактического деления трафика с ожидаемым — 52/48 вместо 50/50. Значит, рандомизация сломана (баг трекинга, фильтрация ботов), и результатам верить нельзя при любом p-value.Разбор: A/B-тесты и продуктовые метрики
Two-towertwo-tower model
Модель retrieval-этапа рекомендаций: две «башни»-энкодера кодируют пользователя и объект в общее векторное пространство. Векторы объектов предвычислены и лежат в ANN-индексе — отбор за миллисекунды.Разбор: Рекомендательные системы