Языковые модели: от n-грамм до трансформера
Как модели работают с текстом: n-граммы, токенизация и BPE, эмбеддинги и word2vec, механизм внимания, архитектура трансформера и современные блоки RoPE, GQA и MoE.
6 тем, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.
1. Биграммы и n-граммы
Первая языковая модель в истории NLP — простая таблица счётчиков пар. Но в ней уже есть всё, что делает GPT: предсказание следующего токена, генерация через сэмплирование и перплексия как мера качества. Понять n-граммы — значит понять саму постановку задачи, которую трансформеры просто решают лучше.
На собеседовании спросят: «Что такое языковая модель?»
2. Токенизация и BPE
Токенизация и BPE в LLM: почему модель видит номера, как это бьёт по цене/контексту и типичные вопросы про токенизаторы.
На собеседовании спросят: «Почему подслова, а не слова или символы?»
3. Эмбеддинги и word2vec
Эмбеддинги слов и текстов: word2vec, семантическая близость, роль в RAG и трансформерах — база для поиска и LLM-собеседований.
На собеседовании спросят: «Чем плох one-hot?»
4. Механизм внимания (attention)
Механизм внимания (attention): query, key, value, self-attention и почему идея лежит в основе GPT и современных LLM.
На собеседовании спросят: «Зачем делить на √d?»
5. Архитектура трансформера
Архитектура трансформера: эмбеддинги, positional encoding, multi-head attention, MLP-блоки и путь токена до следующего слова.
На собеседовании спросят: «Нарисуйте блок трансформера»
6. Современные архитектуры: RoPE, MoE, GQA
RoPE, GQA и Mixture-of-Experts: как современные LLM (Llama, Mixtral, DeepSeek) улучшили классический трансформер — и что спрашивают на собеседовании.
На собеседовании спросят: «Почему RoPE, а не learned embeddings?»