Диагностика Mock-интервью
Главная · Раздел

LLM: обучение и инференс

Жизненный цикл большой языковой модели: претрейнинг и scaling laws, fine-tuning и LoRA, RLHF и DPO, reasoning-модели, сэмплирование, инференс, дистилляция, оценка и работа с контекстом.

10 тем, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.

1. Претрейнинг и scaling laws

Претрейнинг и scaling laws: как из токенов интернета получается base model и почему размер считают по формуле, а не наугад.

На собеседовании спросят: «Почему претрейнинг называют self-supervised?»

2. Fine-tuning: SFT, LoRA, PEFT

Fine-tuning LLM: когда нужен SFT, чем LoRA/PEFT дешевле полного файнтюна и что ожидают услышать на собеседовании AI-инженера.

На собеседовании спросят: «Промптинг, RAG или файнтюн?»

3. Alignment: RLHF и DPO

Alignment LLM: RLHF, reward model и DPO — как из base model делают полезного ассистента и что спрашивают на собеседовании.

На собеседовании спросят: «Зачем KL-штраф в RLHF?»

4. Reasoning-модели и test-time compute

Точность LLM можно масштабировать не только данными и параметрами, но и вычислениями на инференсе: reasoning-модели (o1, DeepSeek R1, Claude с extended thinking) учатся «думать» перед ответом через RL с проверяемыми наградами. Разбираем chain-of-thought, thinking-бюджет и когда всё это окупается.

На собеседовании спросят: «Чем reasoning-модель отличается от обычной с CoT-промптом?»

5. Сэмплирование: temperature, top-k, top-p

Сэмплирование в LLM: temperature, top-k и top-p — как из распределения выбрать токен. От этого зависит стиль текста; частый вопрос на собеседовании.

На собеседовании спросят: «Что делает температура математически?»

6. Инференс: KV-cache, квантизация, спекулятивный декодинг

Инференс LLM: KV-cache, квантизация и speculative decoding — куда уходит VRAM и как ускоряют генерацию токенов в проде.

На собеседовании спросят: «Почему decode медленнее prefill?»

7. Дистилляция и сжатие моделей

Как перенести качество большой модели в маленькую: knowledge distillation и мягкие метки, температура softmax, дистилляция рассуждений для LLM, pruning — и чем всё это отличается от квантизации.

На собеседовании спросят: «Чем дистилляция отличается от квантизации?»

8. Оценка LLM: бенчмарки и LLM-as-judge

У задачи «напиши письмо клиенту» нет единственного правильного ответа — поэтому оценивать LLM сложнее, чем классификатор. Разбираем бенчмарки и их болезни, арены с Elo, LLM-судей с их предвзятостями и то, как строить eval под собственный продукт.

На собеседовании спросят: «Как поймёшь, что бенчмарк контаминирован?»

9. Работа с контекстом и разметка сообщений

Модель видит не «вопрос», а весь собранный контекст перед генерацией — и то, как этот контекст структурирован и размечен, влияет на ответ не меньше, чем сам вопрос. Контекст-инжиниринг (context engineering) — это искусство собирать вход так, чтобы модель поняла границы ходов, роли и приоритеты.

На собеседовании спросят: «Почему role-разметка важнее просто текста?»

10. Промпт-паттерны и structured outputs

Как формулировать инструкции, чтобы LLM отвечала предсказуемо: роль и критерии, few-shot примеры, декомпозиция, chain-of-thought — и как constrained decoding гарантирует валидный JSON на уровне сэмплирования, а не просьбы.

На собеседовании спросят: «Как добиться валидного JSON от LLM?»