Диагностика Mock-интервью
Главная · Глоссарий · Языковые модели: от n-грамм до трансформера

Глоссарий: Языковые модели: от n-грамм до трансформера

43 термина раздела «Языковые модели: от n-грамм до трансформера» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.

Биграммная модельbigram model
Простейшая языковая модель: вероятность следующего слова считается как доля случаев, когда оно шло за текущим словом в корпусе. По сути таблица счётчиков пар.Разбор: Биграммы и n-граммы
Декодерdecoder
Трансформер с каузальной маской (как GPT): генерирует текст слева направо, предсказывая следующий токен. Основа всех современных генеративных LLM.Разбор: Архитектура трансформера
Дистрибутивная гипотезаdistributional hypothesis
Идея, что смысл слова определяется его типичными контекстами: слова с похожими соседями по тексту близки по смыслу. Теоретическая основа word2vec и эмбеддингов вообще.Разбор: Эмбеддинги и word2vec
Запрос, ключ и значениеquery, key, value
Три проекции токена во внимании: запрос — что токен ищет, ключ — по чему его находят, значение — что он отдаёт. Похожесть запроса и ключа задаёт вес значения в итоговой смеси.Разбор: Механизм внимания (attention)
Каузальная маскаcausal mask
Запрет токену смотреть на позиции правее себя в декодере: скоры будущих позиций зануляются до softmax. Без неё модель при обучении «подглядывала» бы ответ и не училась предсказывать.Разбор: Механизм внимания (attention)
Контекстные эмбеддингиcontextual embeddings
Векторы токенов, пересчитываемые с учётом всего предложения через внимание: многозначное слово получает разные векторы в разных фразах — в отличие от статических эмбеддингов word2vec.Разбор: Эмбеддинги и word2vec
Марковское предположениеmarkov assumption
Допущение, что будущее зависит только от короткого недавнего прошлого, а не от всей истории. Для языка заведомо неверно, но делает языковую модель счётной.Разбор: Биграммы и n-граммы
Механизм вниманияattention
Механизм, позволяющий каждому токену смотреть на все остальные с разными весами: дифференцируемый «мягкий словарь», где ответ — взвешенная сумма значений по похожести запроса на ключи.Разбор: Механизм внимания (attention)
Многоголовое вниманиеmulti-head attention
Несколько параллельных «голов» внимания со своими проекциями меньшей размерности; результаты конкатенируются. Головы специализируются: синтаксис, кореференции, соседние токены.Разбор: Механизм внимания (attention)
Остаточная связьresidual connection
Прибавление выхода подслоя к его входу вместо замены: градиент течёт по этому «шоссе» сквозь десятки блоков не затухая. Без остаточных связей глубокие сети практически не обучаются.Разбор: Архитектура трансформера
Перекрёстное вниманиеcross-attention
Внимание, где запросы приходят из декодера, а ключи и значения — из энкодера: так декодер «подглядывает» во входную последовательность в encoder-decoder моделях вроде T5.Разбор: Архитектура трансформера
Перплексияperplexity
Метрика качества языковой модели: экспонента средней кросс-энтропии, интуитивно — число равновероятных вариантов, между которыми модель колеблется на каждом шаге. Меньше — лучше.Разбор: Биграммы и n-граммы
Подсловная токенизацияsubword tokenization
Золотая середина между символами и словами: частые слова остаются целыми токенами, редкие собираются из кусочков. Убирает проблему OOV при умеренной длине последовательностей.Разбор: Токенизация и BPE
Позиционное кодированиеpositional encoding
Добавление информации о позиции токена к его вектору, поскольку внимание само по себе не знает порядка слов. Варианты: синусоиды, обучаемые векторы, RoPE в современных моделях.Разбор: Архитектура трансформера
Предсказание следующего токенаnext token prediction
Постановка задачи языкового моделирования: по контексту выдать распределение вероятностей следующего токена. Одна и та же задача у биграммы Шеннона и у GPT.Разбор: Биграммы и n-граммы
Самовниманиеself-attention
Внимание, где запросы, ключи и значения делаются из одних и тех же токенов: каждый токен строит новое представление из всей последовательности. Память и вычисления квадратичны по длине.Разбор: Механизм внимания (attention)
Сглаживаниеsmoothing
Приёмы борьбы с нулевыми вероятностями невиданных сочетаний: от прибавления единицы ко всем счётчикам (Лаплас) до отката к коротким контекстам и метода Кнесера–Нея.Разбор: Биграммы и n-граммы
Скользящее окно вниманияsliding window attention
Ограничение внимания последними w токенами: стоимость становится линейной, а дальняя информация всё равно доходит — рецептивное поле растёт со стопкой слоёв. Используется в Mistral.Разбор: Современные архитектуры: RoPE, MoE, GQA
Словарь токенизатораvocabulary
Набор всех токенов, которые знает модель, обычно 50–200 тысяч. Размер — компромисс: больше словарь — короче последовательности, но тяжелее эмбеддинг-матрица и хуже обучены редкие токены.Разбор: Токенизация и BPE
Токенtoken
Минимальная единица текста для модели: символ, слово или чаще подслово из фиксированного словаря. Модель видит только номера токенов, а не буквы.Разбор: Токенизация и BPE
Токенизацияtokenization
Превращение текста в последовательность номеров токенов из конечного словаря. Определяет цену запроса, эффективную длину контекста и слабости модели в посимвольных задачах.Разбор: Токенизация и BPE
Трансформерtransformer
Архитектура из стопки одинаковых блоков «внимание плюс MLP» поверх эмбеддингов токенов. Обучается параллельно по всей длине последовательности — скелет GPT, Llama и почти всех современных LLM.Разбор: Архитектура трансформера
Эмбеддингembedding
Плотный вектор, представляющий слово или токен так, что близость векторов отражает близость смысла. Фундамент семантического поиска, RAG и первый слой любого трансформера.Разбор: Эмбеддинги и word2vec
Энкодерencoder
Трансформер без каузальной маски (как BERT): каждый токен видит всё предложение в обе стороны. Хорош для понимания текста — классификации, поиска, извлечения сущностей.Разбор: Архитектура трансформера
Языковая головаlanguage model head
Финальный линейный слой трансформера, превращающий вектор токена в логиты по всему словарю, — из них softmax даёт вероятности следующего токена.Разбор: Архитектура трансформера
Языковая модельlanguage model
Модель распределения вероятностей следующего токена при заданном контексте. Всё различие между n-граммной таблицей и GPT — в том, чем это распределение параметризовано.Разбор: Биграммы и n-граммы
BPEbyte pair encoding
Алгоритм построения подсловного словаря: жадно сливает самую частую пару соседних токенов, пока словарь не вырастет до нужного размера. Частые слова — целые токены, редкие собираются из кусков.Разбор: Токенизация и BPE
CBOWcontinuous bag of words
Режим word2vec: предсказать центральное слово по «мешку» его соседей. Быстрее skip-gram, но хуже справляется с редкими словами.Разбор: Эмбеддинги и word2vec
FlashAttentionflash attention
Точная реализация внимания с другим порядком вычислений: скоры считаются блоками в быстрой памяти GPU без материализации квадратной матрицы. Кратное ускорение и почти линейная память.Разбор: Современные архитектуры: RoPE, MoE, GQA
GQAgrouped-query attention
Компромисс между обычным вниманием и MQA: запросные головы делятся на группы, каждая делит одну пару «ключ-значение». Сжимает KV-кэш в разы почти без потери качества; используется в Llama.Разбор: Современные архитектуры: RoPE, MoE, GQA
KV-кэшkey-value cache
Кэш ключей и значений всех прошлых токенов при генерации, чтобы не пересчитывать их на каждом шаге. Растёт линейно с длиной контекста и на больших длинах съедает память GPU быстрее весов.Разбор: Современные архитектуры: RoPE, MoE, GQA
MoEmixture of experts
Смесь экспертов: MLP-блок заменяется на несколько параллельных «экспертов», из которых роутер выбирает пару на каждый токен. Экономит вычисления, но память нужна под все параметры сразу.Разбор: Современные архитектуры: RoPE, MoE, GQA
MQAmulti-query attention
Вариант внимания, где запросных голов много, а пара «ключ-значение» одна на всех: KV-кэш худеет в число голов раз, но качество заметно проседает.Разбор: Современные архитектуры: RoPE, MoE, GQA
N-граммаn-gram
Последовательность из n подряд идущих токенов; n-граммная модель предсказывает следующий токен по статистике таких цепочек в корпусе. С ростом n число контекстов растёт экспоненциально.Разбор: Биграммы и n-граммы
One-hot векторone-hot vector
Разреженное представление слова: вектор длиной со словарь с единицей на позиции слова и нулями в остальных. Геометрически бессмысленно: все слова равноудалены друг от друга.Разбор: Эмбеддинги и word2vec
OOVout-of-vocabulary
Проблема слов, отсутствующих в словаре токенизатора: в пословных словарях они превращались в бесполезный токен UNK. Подсловная и байтовая токенизации снимают её полностью.Разбор: Токенизация и BPE
RMSNormroot mean square normalization
Упрощённая нормализация: только приведение масштаба вектора, без вычитания среднего. Проще и быстрее LayerNorm; стандарт современных LLM.Разбор: Современные архитектуры: RoPE, MoE, GQA
RoPErotary position embedding
Позиционное кодирование вращением векторов запросов и ключей на угол, пропорциональный позиции: их скалярное произведение зависит только от относительного сдвига токенов. Основа удлинения контекста.Разбор: Современные архитектуры: RoPE, MoE, GQA
SentencePiecesentencepiece
Токенизатор, работающий с сырой строкой без предварительного деления по пробелам — пробел считается обычным символом. Удобен для языков без пробелов, например японского.Разбор: Токенизация и BPE
Skip-gramskip-gram
Режим word2vec: по центральному слову предсказать слова-соседи в окне. Работает для редких слов лучше, чем обратный режим CBOW.Разбор: Эмбеддинги и word2vec
SwiGLUswish-gated linear unit
Гейтированная активация MLP-блоков, заменившая ReLU в современных LLM: одна ветвь слоя умножается на «ворота» из другой, что стабильно даёт чуть лучшее качество.Разбор: Современные архитектуры: RoPE, MoE, GQA
Word2vecword2vec
Метод обучения эмбеддингов: маленькая сеть учится предсказывать соседей слова, а полезный продукт — её матрица эмбеддингов, где похожие по смыслу слова оказываются рядом.Разбор: Эмбеддинги и word2vec
WordPiecewordpiece
Подсловный токенизатор BERT: сливает не самую частую пару, а ту, что сильнее всего увеличивает правдоподобие корпуса; куски внутри слова помечаются специальным префиксом.Разбор: Токенизация и BPE