Диагностика Mock-интервью
Главная · Раздел

Языковые модели: от n-грамм до трансформера

Как модели работают с текстом: n-граммы, токенизация и BPE, эмбеддинги и word2vec, механизм внимания, архитектура трансформера и современные блоки RoPE, GQA и MoE.

6 тем, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.

1. Биграммы и n-граммы

Первая языковая модель в истории NLP — простая таблица счётчиков пар. Но в ней уже есть всё, что делает GPT: предсказание следующего токена, генерация через сэмплирование и перплексия как мера качества. Понять n-граммы — значит понять саму постановку задачи, которую трансформеры просто решают лучше.

На собеседовании спросят: «Что такое языковая модель?»

2. Токенизация и BPE

Токенизация и BPE в LLM: почему модель видит номера, как это бьёт по цене/контексту и типичные вопросы про токенизаторы.

На собеседовании спросят: «Почему подслова, а не слова или символы?»

3. Эмбеддинги и word2vec

Эмбеддинги слов и текстов: word2vec, семантическая близость, роль в RAG и трансформерах — база для поиска и LLM-собеседований.

На собеседовании спросят: «Чем плох one-hot?»

4. Механизм внимания (attention)

Механизм внимания (attention): query, key, value, self-attention и почему идея лежит в основе GPT и современных LLM.

На собеседовании спросят: «Зачем делить на √d?»

5. Архитектура трансформера

Архитектура трансформера: эмбеддинги, positional encoding, multi-head attention, MLP-блоки и путь токена до следующего слова.

На собеседовании спросят: «Нарисуйте блок трансформера»

6. Современные архитектуры: RoPE, MoE, GQA

RoPE, GQA и Mixture-of-Experts: как современные LLM (Llama, Mixtral, DeepSeek) улучшили классический трансформер — и что спрашивают на собеседовании.

На собеседовании спросят: «Почему RoPE, а не learned embeddings?»