Диагностика Mock-интервью
Главная · Глоссарий · LLM: обучение и инференс

Глоссарий: LLM: обучение и инференс

73 термина раздела «LLM: обучение и инференс» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.

Бенчмаркbenchmark
Стандартный набор задач с проверяемыми ответами для сравнения моделей: MMLU (тесты по 57 предметам), GSM8K (математика), HumanEval (код с тестами). Дёшево и воспроизводимо, но грозят контаминация и насыщение.Разбор: Оценка LLM: бенчмарки и LLM-as-judge
Дедупликацияdeduplication
Удаление повторов из претрейн-данных: дубликаты заставляют модель заучивать тексты наизусть и завышают результаты на бенчмарках, утёкших в обучающую выборку.Разбор: Претрейнинг и scaling laws
Декомпозиция промптовprompt decomposition
Принцип «одна задача — один промпт»: цепочка маленьких промптов вместо монстра на десять задач. Каждое звено отлаживается и оценивается отдельно, а инструкции не конкурируют за внимание модели.Разбор: Промпт-паттерны и structured outputs
Дистилляция знанийknowledge distillation
Перенос качества большой модели-учителя в маленькую модель-ученика: ученик обучается воспроизводить предсказания учителя, а не только правильные ответы, и усваивает больше, чем из сырых данных.Разбор: Дистилляция и сжатие моделей
Жадная генерацияgreedy decoding
Стратегия, всегда берущая самый вероятный токен. На длинном открытом тексте вырождается: модель зацикливается и повторяет фразы, потому что локально вероятный токен не значит глобально хороший текст.Разбор: Сэмплирование: temperature, top-k, top-p
Каскад моделейmodel cascade
Продакшн-схема: дешёвая маленькая модель обрабатывает простые запросы, а роутер отправляет сложные к большой. Средняя цена запроса падает в разы при почти той же метрике качества.Разбор: Дистилляция и сжатие моделей
Катастрофическое забываниеcatastrophic forgetting
Потеря общих способностей модели после агрессивного дообучения на узкой задаче: новые веса «переписывают» старые навыки. Смягчается малым learning rate, подмешиванием общих данных и LoRA.Разбор: Fine-tuning: SFT, LoRA, PEFT
Квантизацияquantization
Сжатие весов модели в числа меньшей точности (fp16 → int8/int4): память падает в 2–4 раза, и генерация ускоряется почти пропорционально, потому что decode упирается в трафик памяти. Методы GPTQ и AWQ минимизируют потерю качества.Разбор: Инференс: KV-cache, квантизация, спекулятивный декодинг · Видеокарты и VRAM: железо для нейросетей
Контаминацияcontamination
Утечка задач бенчмарка в обучающие данные модели: она «помнит» ответы, а не решает. Красивая цифра на контаминированном бенчмарке ничего не говорит о реальных способностях.Разбор: Оценка LLM: бенчмарки и LLM-as-judge
Контекст-инжинирингcontext engineering
Сборка и разметка всего входа модели: роли, порядок блоков, разделители, бюджет токенов. Шире промпт-инжиниринга, который отвечает только за формулировку конкретной инструкции.Разбор: Работа с контекстом и разметка сообщений
Контекстное окноcontext window
Максимальная длина входа модели в токенах — жёсткий бюджет, который расходует каждый блок контекста: инструкции, примеры, документы, история. При переполнении приходится урезать наименее важное.Разбор: Работа с контекстом и разметка сообщений
Логитыlogits
Сырые числа, которые модель выдаёт для каждого токена словаря до нормализации; softmax превращает их в вероятности. Именно с логитами работают температура и другие параметры сэмплирования.Разбор: Сэмплирование: temperature, top-k, top-p · Архитектура трансформера
Мягкие меткиsoft labels
Полное распределение вероятностей учителя вместо one-hot ответа: «кошка 0.8, рысь 0.13, волк 0.01». Несут информацию об отношениях между классами — какие варианты почти верны, а какие абсурдны.Разбор: Дистилляция и сжатие моделей
Насыщение бенчмаркаbenchmark saturation
Состояние, когда топовые модели выбивают почти максимум, и бенчмарк перестаёт различать их между собой: разница тонет в шуме. Поэтому сообщество постоянно строит более трудные наборы задач.Разбор: Оценка LLM: бенчмарки и LLM-as-judge
Полный файнтюнfull fine-tuning
Дообучение, при котором обновляются все веса модели. Требует около 16 байт памяти на параметр (веса, градиенты, состояния Adam), поэтому даже для 7B-модели нужен кластер или PEFT.Разбор: Fine-tuning: SFT, LoRA, PEFT
Претрейнингpretraining
Первый и самый дорогой этап обучения LLM: модель на триллионах токенов текста учится предсказывать следующий токен, попутно усваивая грамматику, факты, логику и код.Разбор: Претрейнинг и scaling laws
Промпт-инжинирингprompt engineering
Формулировка инструкций так, чтобы желаемое продолжение стало статистически самым вероятным: роль и явные критерии вместо «сделай хорошо», примеры, декомпозиция, явный формат выхода.Разбор: Промпт-паттерны и structured outputs
Прунингpruning
Сжатие модели удалением её частей: неструктурный обнуляет отдельные «неважные» веса, структурный выбрасывает целые головы внимания, каналы или слои — модель реально уменьшается и ускоряется.Разбор: Дистилляция и сжатие моделей
Самообучениеself-supervised learning
Режим обучения, при котором метки создаются из самих данных без разметчиков: в претрейне LLM следующий токен текста и есть правильный ответ, поэтому обучающей выборкой становится весь интернет.Разбор: Претрейнинг и scaling laws · Типы обучения: с учителем, без и с подкреплением
Системный промптsystem prompt
Сообщение с ролью system — правила поведения модели: модель обучена относиться к нему как к приоритетной рамке, в отличие от реплик user (запросы) и assistant (её собственные прошлые ответы).Разбор: Работа с контекстом и разметка сообщений
Спекулятивный декодингspeculative decoding
Ускорение генерации: маленькая draft-модель предлагает несколько токенов вперёд, а большая проверяет их одним параллельным прогоном. Правило принятия сохраняет распределение большой модели — качество не страдает.Разбор: Инференс: KV-cache, квантизация, спекулятивный декодинг
Спецтокеныspecial tokens
Служебные токены chat-шаблона, размечающие границы ходов и роли в диалоге. Модель видела их миллионы раз при обучении — именно они сообщают ей, где инструкция, а где её очередь отвечать.Разбор: Работа с контекстом и разметка сообщений
Сэмплированиеsampling
Выбор следующего токена из распределения вероятностей, которое выдаёт модель: можно всегда брать самый вероятный, а можно «кидать кубик». От стратегии зависит, будет текст скучным, живым или бессвязным.Разбор: Сэмплирование: temperature, top-k, top-p
Температураtemperature
Параметр сэмплирования: логиты делятся на T до softmax. При T меньше 1 распределение обостряется к самому вероятному токену, при T больше 1 сглаживается — растёт разнообразие, а с ним и доля случайного мусора.Разбор: Сэмплирование: temperature, top-k, top-p
Температура дистилляцииdistillation temperature
Деление логитов учителя на T перед softmax при дистилляции: при T около 3–5 почти one-hot распределение размягчается, и отношения между классами становятся видимыми для лосса ученика.Разбор: Дистилляция и сжатие моделей
Эмерджентные способностиemergent abilities
Навыки, «внезапно» появляющиеся у моделей с ростом масштаба: многошаговая арифметика, следование инструкциям. Часть «скачков» — артефакт жёстких метрик, но непредсказуемость новых навыков реальна.Разбор: Претрейнинг и scaling laws
Alignmentalignment
Этап обучения, делающий модель полезной, безвредной и честной: вместо эталонных ответов используются сравнения («из этих двух ответов этот лучше»), на которых модель выучивает человеческие предпочтения.Разбор: Alignment: RLHF и DPO
Base modelbase model
Модель сразу после претрейнинга: она гениально продолжает текст, но не умеет «отвечать» и выполнять просьбы. Формат полезного ассистента ей прививают позже — на SFT и alignment.Разбор: Претрейнинг и scaling laws
Best-of-Nbest-of-n sampling
Стратегия инференса: сгенерировать N вариантов ответа и выбрать лучший с помощью отдельной модели-оценщика. Обмен вычислений на точность «вширь», в отличие от длинного рассуждения «вглубь».Разбор: Reasoning-модели и test-time compute
Chain-of-thoughtchain-of-thought
Приём «думай пошагово»: модель пишет промежуточные шаги рассуждения перед ответом. Каждый токен — дополнительный компьют, а записанные шаги работают рабочей памятью для следующих.Разбор: Reasoning-модели и test-time compute
Chat-шаблонchat template
Формат оборачивания реплик диалога спецтокенами (например, ChatML), размечающий роли и границы ходов так, как модель видела при обучении. Склейка реплик простым текстом заметно роняет качество.Разбор: Работа с контекстом и разметка сообщений
Chinchilla-оптимумchinchilla-optimal training
Вывод работы Chinchilla: при фиксированном бюджете компьюта параметры и токены надо растить вместе, примерно по 20 токенов на параметр. Продакшн-модели часто сознательно «перетренировывают» ради дешёвого инференса.Разбор: Претрейнинг и scaling laws
Continuous batchingcontinuous batching
Серверный батчинг, при котором запросы входят и выходят из батча на каждом шаге генерации, не дожидаясь самого длинного ответа. Заметно повышает пропускную способность GPU.Разбор: Инференс: KV-cache, квантизация, спекулятивный декодинг
Dark knowledgedark knowledge
Термин Хинтона: структура малых вероятностей в предсказаниях учителя, кодирующая его понимание мира. Именно это «тёмное знание» перенимает ученик при дистилляции на мягких метках.Разбор: Дистилляция и сжатие моделей
Decodedecode
Фаза генерации: по одному токену за шаг, ради каждого через чип гонятся все веса модели и весь KV-cache. Упирается не в арифметику, а в пропускную способность памяти — и определяет скорость генерации.Разбор: Инференс: KV-cache, квантизация, спекулятивный декодинг
DPOdirect preference optimization
Метод выравнивания без RL: оптимум RLHF-задачи выражается аналитически, и политика обучается напрямую на парах предпочтений обычным supervised-лоссом — без reward model, PPO и онлайн-генерации.Разбор: Alignment: RLHF и DPO
Elo-рейтингelo rating
Рейтинг моделей из парных «дуэлей», как в шахматах: пользователи вслепую голосуют за лучший из двух анонимных ответов (LMArena), и миллионы сравнений сворачиваются в общий ранг.Разбор: Оценка LLM: бенчмарки и LLM-as-judge
Few-shotfew-shot prompting
Включение в контекст нескольких пар «вход → эталонный выход»: примеры задают формат и стиль ответа мощнее словесных инструкций, потому что модель — машина продолжения паттернов.Разбор: Работа с контекстом и разметка сообщений
Fine-tuningfine-tuning
Дообучение готовой LLM под конкретную задачу: стиль, формат, домен или манеру отвечать. Оправдан, когда промптинг и RAG уже исчерпаны, а нужен устойчивый специфичный результат на большом потоке запросов.Разбор: Fine-tuning: SFT, LoRA, PEFT
Frequency penaltyfrequency penalty
Штраф за повторы: логиты уже использованных токенов понижаются, и модели становится «дороже» ходить по кругу. Основное средство против зацикливания при генерации.Разбор: Сэмплирование: temperature, top-k, top-p
JSON modejson mode
Режим инференса у провайдера, при котором выход гарантированно является валидным JSON. Без схемы структура полей не фиксируется, а правильность значений не проверяется.Разбор: Промпт-паттерны и structured outputs
KL-штрафkl penalty
Слагаемое в лоссе RLHF, штрафующее политику за отход от исходной reference-модели. «Поводок», который не даёт модели выродиться, эксплуатируя дыры несовершенной reward model.Разбор: Alignment: RLHF и DPO · VAE и GAN: генерация до диффузии
KV-cachekey-value cache
Кэш ключей и значений внимания всех обработанных токенов: они не меняются, поэтому пересчитывать их не нужно. Снижает стоимость шага генерации с квадратичной до линейной, но память растёт линейно с контекстом.Разбор: Инференс: KV-cache, квантизация, спекулятивный декодинг
Length biaslength bias
Предвзятость LLM-судьи: любовь к длинным, развёрнутым ответам, даже водянистым. Из-за неё раздувание текста выглядит как рост качества; проверяется корреляцией вердиктов с длиной ответа.Разбор: Оценка LLM: бенчмарки и LLM-as-judge
LLM-as-judgellm-as-judge
Оценка ответов сильной LLM вместо людей: судья получает вопрос, пару ответов и рубрику, выдаёт вердикт. Дёшево и масштабируемо, но судья систематически предвзят и требует калибровки по человеческим вердиктам.Разбор: Оценка LLM: бенчмарки и LLM-as-judge
Logit-дистилляцияlogit distillation
Классическая потокенная дистилляция LLM: ученик приближает распределение учителя над словарём на каждом шаге генерации. Требует общей токенизации и доступа к логитам учителя.Разбор: Дистилляция и сжатие моделей
LoRAlow-rank adaptation
Метод дообучения: сдвиг весов представляют произведением двух узких матриц низкого ранга и учат только их. После обучения добавку вливают в исходные веса, поэтому инференс не замедляется.Разбор: Fine-tuning: SFT, LoRA, PEFT
Min-pmin-p sampling
Отсечение хвоста относительно лидера: остаются токены с вероятностью не ниже заданной доли от максимальной. Ещё один адаптивный метод, популярный в open-source-инференсе.Разбор: Сэмплирование: temperature, top-k, top-p
Next token predictionnext token prediction
Базовая задача языковой модели: по началу текста предсказать распределение вероятностей следующего токена. Из этой «тупой» задачи при огромном масштабе вырастают все способности LLM.Разбор: Претрейнинг и scaling laws
PagedAttentionpagedattention
Механизм vLLM: KV-cache хранится страницами, как виртуальная память ОС. Убирает фрагментацию памяти и позволяет держать в GPU намного больше параллельных запросов.Разбор: Инференс: KV-cache, квантизация, спекулятивный декодинг
PEFTparameter-efficient fine-tuning
Семейство методов дообучения, при которых базовая модель заморожена, а обучается лишь небольшая добавка параметров — доли процента от всех весов. Самый популярный представитель — LoRA.Разбор: Fine-tuning: SFT, LoRA, PEFT
Position biasposition bias
Предвзятость LLM-судьи: склонность выбирать ответ, показанный первым или последним, независимо от содержания. Ловится контрольным прогоном каждой пары с переставленными местами A и B.Разбор: Оценка LLM: бенчмарки и LLM-as-judge
PPOproximal policy optimization
Алгоритм обучения с подкреплением, стандартный для RL-этапа RLHF: модель генерирует ответы, reward model их оценивает, и веса обновляются так, чтобы награда росла. Капризен к гиперпараметрам и дорог.Разбор: Alignment: RLHF и DPO · Обучение с подкреплением: Q-learning и PPO
Prefillprefill
Фаза инференса, обрабатывающая промпт: все его токены известны заранее и прогоняются через модель параллельно одной матричной операцией. Быстрая, ограничена вычислениями; определяет время до первого токена.Разбор: Инференс: KV-cache, квантизация, спекулятивный декодинг
QLoRAquantized low-rank adaptation
Вариант LoRA, где замороженная базовая модель квантуется в 4 бита, а адаптеры обучаются в обычной точности. Позволяет дообучать модели на 70 млрд параметров на одной GPU.Разбор: Fine-tuning: SFT, LoRA, PEFT
Reasoning-модельreasoning model
LLM, обученная через RL с проверяемыми наградами «думать» перед ответом: генерировать длинное рассуждение с декомпозицией, самопроверкой и откатами. Примеры: o1, DeepSeek R1, Claude с extended thinking.Разбор: Reasoning-модели и test-time compute
Reward modelreward model
Отдельная модель-судья в RLHF: обучается на парных сравнениях разметчиков и выдаёт число-награду за ответ. Это несовершенный прокси предпочтений, поэтому её нельзя оптимизировать без ограничений.Разбор: Alignment: RLHF и DPO
RLAIFreinforcement learning from ai feedback
Замена человеческой разметки в RLHF на ИИ-фидбек: пары ответов сравнивает сильная модель. Вариант — Constitutional AI, где модель критикует свои ответы по явному списку принципов.Разбор: Alignment: RLHF и DPO
RLHFreinforcement learning from human feedback
Конвейер выравнивания из трёх шагов: SFT, обучение reward model на человеческих сравнениях ответов и RL (обычно PPO), где политика максимизирует награду с KL-штрафом за отход от исходной модели.Разбор: Alignment: RLHF и DPO
RLVRreinforcement learning with verifiable rewards
Обучение с подкреплением, где награда — объективная проверка: сошёлся ли ответ по математике, прошли ли тесты код. Такую награду нельзя «взломать» красивым, но неверным текстом; двигатель reasoning-моделей.Разбор: Reasoning-модели и test-time compute
Scaling lawsscaling laws
Эмпирические степенные законы: лосс модели предсказуемо падает с ростом параметров, данных и компьюта. Позволяют по дешёвым маленьким прогонам заранее выбрать оптимальный размер большой модели.Разбор: Претрейнинг и scaling laws
Self-consistencyself-consistency
Параллельное test-time compute: модель сэмплирует несколько независимых цепочек рассуждений, и ответ выбирается большинством голосов — верные решения сходятся к одному ответу чаще, чем ошибки.Разбор: Reasoning-модели и test-time compute
Self-preference biasself-preference bias
Предвзятость LLM-судьи: завышение оценок ответам, похожим на его собственный стиль, особенно ответам своей же модели. Поэтому модель не судят судьёй того же семейства.Разбор: Оценка LLM: бенчмарки и LLM-as-judge
Sequence-level дистилляцияsequence-level distillation
Дистилляция LLM через данные: учитель генерирует ответы и цепочки рассуждений, а ученик дообучается на них обычным SFT. Так рассуждения DeepSeek R1 перенесли в модели размера 7B.Разбор: Дистилляция и сжатие моделей
SFTsupervised fine-tuning
Дообучение модели на парах «промпт → эталонный ответ» тем же предсказанием следующего токена, но лосс считается только по токенам ответа: модель учат отвечать, а не воспроизводить вопросы.Разбор: Fine-tuning: SFT, LoRA, PEFT
Structured outputsstructured outputs
Получение от LLM машиночитаемого выхода (обычно JSON) с гарантией формата. Лестница надёжности: просьба → few-shot → JSON mode → constrained decoding по схеме; только последний уровень даёт гарантию.Разбор: Промпт-паттерны и structured outputs
Sycophancysycophancy
Подхалимство модели — склонность соглашаться с пользователем даже в ущерб правде. Возникает из перекоса данных предпочтений: разметчики чаще выбирают ответы, которые с ними соглашаются.Разбор: Alignment: RLHF и DPO
Test-time computetest-time compute
Третья ось масштабирования после данных и параметров: точность растёт за счёт дополнительных вычислений в момент инференса — длинного рассуждения или нескольких параллельных попыток.Разбор: Reasoning-модели и test-time compute
Thinking budgetthinking budget
Регулируемый параметр инференса reasoning-модели — сколько токенов рассуждения ей разрешено. Точность растёт с насыщением, а цена и латентность — линейно, поэтому после «колена» кривой бюджет тратится впустую.Разбор: Reasoning-модели и test-time compute
Thinking-токеныthinking tokens
Токены рассуждения, которые reasoning-модель генерирует отдельным блоком до финального ответа. Провайдер может скрывать их от пользователя, но оплачиваются они как обычные выходные токены.Разбор: Reasoning-модели и test-time compute
Top-pnucleus sampling
Адаптивное отсечение хвоста: остаётся минимальный набор токенов с суммарной вероятностью не ниже p. У уверенной модели «ядро» — 1–2 токена, у неуверенной — десятки; поэтому top-p почти вытеснил top-k.Разбор: Сэмплирование: temperature, top-k, top-p
TTFTtime to first token
Время до первого токена ответа — ключевая метрика сервинга LLM: сколько пользователь ждёт начала генерации. В основном определяется фазой prefill и очередью запросов; скорость дальше меряют в tokens/s.Разбор: Инференс: KV-cache, квантизация, спекулятивный декодинг