LLM: обучение и инференс
Жизненный цикл большой языковой модели: претрейнинг и scaling laws, fine-tuning и LoRA, RLHF и DPO, reasoning-модели, сэмплирование, инференс, дистилляция, оценка и работа с контекстом.
10 тем, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.
1. Претрейнинг и scaling laws
Претрейнинг и scaling laws: как из токенов интернета получается base model и почему размер считают по формуле, а не наугад.
На собеседовании спросят: «Почему претрейнинг называют self-supervised?»
2. Fine-tuning: SFT, LoRA, PEFT
Fine-tuning LLM: когда нужен SFT, чем LoRA/PEFT дешевле полного файнтюна и что ожидают услышать на собеседовании AI-инженера.
На собеседовании спросят: «Промптинг, RAG или файнтюн?»
3. Alignment: RLHF и DPO
Alignment LLM: RLHF, reward model и DPO — как из base model делают полезного ассистента и что спрашивают на собеседовании.
На собеседовании спросят: «Зачем KL-штраф в RLHF?»
4. Reasoning-модели и test-time compute
Точность LLM можно масштабировать не только данными и параметрами, но и вычислениями на инференсе: reasoning-модели (o1, DeepSeek R1, Claude с extended thinking) учатся «думать» перед ответом через RL с проверяемыми наградами. Разбираем chain-of-thought, thinking-бюджет и когда всё это окупается.
На собеседовании спросят: «Чем reasoning-модель отличается от обычной с CoT-промптом?»
5. Сэмплирование: temperature, top-k, top-p
Сэмплирование в LLM: temperature, top-k и top-p — как из распределения выбрать токен. От этого зависит стиль текста; частый вопрос на собеседовании.
На собеседовании спросят: «Что делает температура математически?»
6. Инференс: KV-cache, квантизация, спекулятивный декодинг
Инференс LLM: KV-cache, квантизация и speculative decoding — куда уходит VRAM и как ускоряют генерацию токенов в проде.
На собеседовании спросят: «Почему decode медленнее prefill?»
7. Дистилляция и сжатие моделей
Как перенести качество большой модели в маленькую: knowledge distillation и мягкие метки, температура softmax, дистилляция рассуждений для LLM, pruning — и чем всё это отличается от квантизации.
На собеседовании спросят: «Чем дистилляция отличается от квантизации?»
8. Оценка LLM: бенчмарки и LLM-as-judge
У задачи «напиши письмо клиенту» нет единственного правильного ответа — поэтому оценивать LLM сложнее, чем классификатор. Разбираем бенчмарки и их болезни, арены с Elo, LLM-судей с их предвзятостями и то, как строить eval под собственный продукт.
На собеседовании спросят: «Как поймёшь, что бенчмарк контаминирован?»
9. Работа с контекстом и разметка сообщений
Модель видит не «вопрос», а весь собранный контекст перед генерацией — и то, как этот контекст структурирован и размечен, влияет на ответ не меньше, чем сам вопрос. Контекст-инжиниринг (context engineering) — это искусство собирать вход так, чтобы модель поняла границы ходов, роли и приоритеты.
На собеседовании спросят: «Почему role-разметка важнее просто текста?»
10. Промпт-паттерны и structured outputs
Как формулировать инструкции, чтобы LLM отвечала предсказуемо: роль и критерии, few-shot примеры, декомпозиция, chain-of-thought — и как constrained decoding гарантирует валидный JSON на уровне сэмплирования, а не просьбы.
На собеседовании спросят: «Как добиться валидного JSON от LLM?»