Глоссарий: Языковые модели: от n-грамм до трансформера
43 термина раздела «Языковые модели: от n-грамм до трансформера» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.
- Биграммная модельbigram model
- Простейшая языковая модель: вероятность следующего слова считается как доля случаев, когда оно шло за текущим словом в корпусе. По сути таблица счётчиков пар.Разбор: Биграммы и n-граммы
- Декодерdecoder
- Трансформер с каузальной маской (как GPT): генерирует текст слева направо, предсказывая следующий токен. Основа всех современных генеративных LLM.Разбор: Архитектура трансформера
- Дистрибутивная гипотезаdistributional hypothesis
- Идея, что смысл слова определяется его типичными контекстами: слова с похожими соседями по тексту близки по смыслу. Теоретическая основа word2vec и эмбеддингов вообще.Разбор: Эмбеддинги и word2vec
- Запрос, ключ и значениеquery, key, value
- Три проекции токена во внимании: запрос — что токен ищет, ключ — по чему его находят, значение — что он отдаёт. Похожесть запроса и ключа задаёт вес значения в итоговой смеси.Разбор: Механизм внимания (attention)
- Каузальная маскаcausal mask
- Запрет токену смотреть на позиции правее себя в декодере: скоры будущих позиций зануляются до softmax. Без неё модель при обучении «подглядывала» бы ответ и не училась предсказывать.Разбор: Механизм внимания (attention)
- Контекстные эмбеддингиcontextual embeddings
- Векторы токенов, пересчитываемые с учётом всего предложения через внимание: многозначное слово получает разные векторы в разных фразах — в отличие от статических эмбеддингов word2vec.Разбор: Эмбеддинги и word2vec
- Марковское предположениеmarkov assumption
- Допущение, что будущее зависит только от короткого недавнего прошлого, а не от всей истории. Для языка заведомо неверно, но делает языковую модель счётной.Разбор: Биграммы и n-граммы
- Механизм вниманияattention
- Механизм, позволяющий каждому токену смотреть на все остальные с разными весами: дифференцируемый «мягкий словарь», где ответ — взвешенная сумма значений по похожести запроса на ключи.Разбор: Механизм внимания (attention)
- Многоголовое вниманиеmulti-head attention
- Несколько параллельных «голов» внимания со своими проекциями меньшей размерности; результаты конкатенируются. Головы специализируются: синтаксис, кореференции, соседние токены.Разбор: Механизм внимания (attention)
- Остаточная связьresidual connection
- Прибавление выхода подслоя к его входу вместо замены: градиент течёт по этому «шоссе» сквозь десятки блоков не затухая. Без остаточных связей глубокие сети практически не обучаются.Разбор: Архитектура трансформера
- Перекрёстное вниманиеcross-attention
- Внимание, где запросы приходят из декодера, а ключи и значения — из энкодера: так декодер «подглядывает» во входную последовательность в encoder-decoder моделях вроде T5.Разбор: Архитектура трансформера
- Перплексияperplexity
- Метрика качества языковой модели: экспонента средней кросс-энтропии, интуитивно — число равновероятных вариантов, между которыми модель колеблется на каждом шаге. Меньше — лучше.Разбор: Биграммы и n-граммы
- Подсловная токенизацияsubword tokenization
- Золотая середина между символами и словами: частые слова остаются целыми токенами, редкие собираются из кусочков. Убирает проблему OOV при умеренной длине последовательностей.Разбор: Токенизация и BPE
- Позиционное кодированиеpositional encoding
- Добавление информации о позиции токена к его вектору, поскольку внимание само по себе не знает порядка слов. Варианты: синусоиды, обучаемые векторы, RoPE в современных моделях.Разбор: Архитектура трансформера
- Предсказание следующего токенаnext token prediction
- Постановка задачи языкового моделирования: по контексту выдать распределение вероятностей следующего токена. Одна и та же задача у биграммы Шеннона и у GPT.Разбор: Биграммы и n-граммы
- Самовниманиеself-attention
- Внимание, где запросы, ключи и значения делаются из одних и тех же токенов: каждый токен строит новое представление из всей последовательности. Память и вычисления квадратичны по длине.Разбор: Механизм внимания (attention)
- Сглаживаниеsmoothing
- Приёмы борьбы с нулевыми вероятностями невиданных сочетаний: от прибавления единицы ко всем счётчикам (Лаплас) до отката к коротким контекстам и метода Кнесера–Нея.Разбор: Биграммы и n-граммы
- Скользящее окно вниманияsliding window attention
- Ограничение внимания последними w токенами: стоимость становится линейной, а дальняя информация всё равно доходит — рецептивное поле растёт со стопкой слоёв. Используется в Mistral.Разбор: Современные архитектуры: RoPE, MoE, GQA
- Словарь токенизатораvocabulary
- Набор всех токенов, которые знает модель, обычно 50–200 тысяч. Размер — компромисс: больше словарь — короче последовательности, но тяжелее эмбеддинг-матрица и хуже обучены редкие токены.Разбор: Токенизация и BPE
- Токенtoken
- Минимальная единица текста для модели: символ, слово или чаще подслово из фиксированного словаря. Модель видит только номера токенов, а не буквы.Разбор: Токенизация и BPE
- Токенизацияtokenization
- Превращение текста в последовательность номеров токенов из конечного словаря. Определяет цену запроса, эффективную длину контекста и слабости модели в посимвольных задачах.Разбор: Токенизация и BPE
- Трансформерtransformer
- Архитектура из стопки одинаковых блоков «внимание плюс MLP» поверх эмбеддингов токенов. Обучается параллельно по всей длине последовательности — скелет GPT, Llama и почти всех современных LLM.Разбор: Архитектура трансформера
- Эмбеддингembedding
- Плотный вектор, представляющий слово или токен так, что близость векторов отражает близость смысла. Фундамент семантического поиска, RAG и первый слой любого трансформера.Разбор: Эмбеддинги и word2vec
- Энкодерencoder
- Трансформер без каузальной маски (как BERT): каждый токен видит всё предложение в обе стороны. Хорош для понимания текста — классификации, поиска, извлечения сущностей.Разбор: Архитектура трансформера
- Языковая головаlanguage model head
- Финальный линейный слой трансформера, превращающий вектор токена в логиты по всему словарю, — из них softmax даёт вероятности следующего токена.Разбор: Архитектура трансформера
- Языковая модельlanguage model
- Модель распределения вероятностей следующего токена при заданном контексте. Всё различие между n-граммной таблицей и GPT — в том, чем это распределение параметризовано.Разбор: Биграммы и n-граммы
- BPEbyte pair encoding
- Алгоритм построения подсловного словаря: жадно сливает самую частую пару соседних токенов, пока словарь не вырастет до нужного размера. Частые слова — целые токены, редкие собираются из кусков.Разбор: Токенизация и BPE
- CBOWcontinuous bag of words
- Режим word2vec: предсказать центральное слово по «мешку» его соседей. Быстрее skip-gram, но хуже справляется с редкими словами.Разбор: Эмбеддинги и word2vec
- FlashAttentionflash attention
- Точная реализация внимания с другим порядком вычислений: скоры считаются блоками в быстрой памяти GPU без материализации квадратной матрицы. Кратное ускорение и почти линейная память.Разбор: Современные архитектуры: RoPE, MoE, GQA
- GQAgrouped-query attention
- Компромисс между обычным вниманием и MQA: запросные головы делятся на группы, каждая делит одну пару «ключ-значение». Сжимает KV-кэш в разы почти без потери качества; используется в Llama.Разбор: Современные архитектуры: RoPE, MoE, GQA
- KV-кэшkey-value cache
- Кэш ключей и значений всех прошлых токенов при генерации, чтобы не пересчитывать их на каждом шаге. Растёт линейно с длиной контекста и на больших длинах съедает память GPU быстрее весов.Разбор: Современные архитектуры: RoPE, MoE, GQA
- MoEmixture of experts
- Смесь экспертов: MLP-блок заменяется на несколько параллельных «экспертов», из которых роутер выбирает пару на каждый токен. Экономит вычисления, но память нужна под все параметры сразу.Разбор: Современные архитектуры: RoPE, MoE, GQA
- MQAmulti-query attention
- Вариант внимания, где запросных голов много, а пара «ключ-значение» одна на всех: KV-кэш худеет в число голов раз, но качество заметно проседает.Разбор: Современные архитектуры: RoPE, MoE, GQA
- N-граммаn-gram
- Последовательность из n подряд идущих токенов; n-граммная модель предсказывает следующий токен по статистике таких цепочек в корпусе. С ростом n число контекстов растёт экспоненциально.Разбор: Биграммы и n-граммы
- One-hot векторone-hot vector
- Разреженное представление слова: вектор длиной со словарь с единицей на позиции слова и нулями в остальных. Геометрически бессмысленно: все слова равноудалены друг от друга.Разбор: Эмбеддинги и word2vec
- OOVout-of-vocabulary
- Проблема слов, отсутствующих в словаре токенизатора: в пословных словарях они превращались в бесполезный токен UNK. Подсловная и байтовая токенизации снимают её полностью.Разбор: Токенизация и BPE
- RMSNormroot mean square normalization
- Упрощённая нормализация: только приведение масштаба вектора, без вычитания среднего. Проще и быстрее LayerNorm; стандарт современных LLM.Разбор: Современные архитектуры: RoPE, MoE, GQA
- RoPErotary position embedding
- Позиционное кодирование вращением векторов запросов и ключей на угол, пропорциональный позиции: их скалярное произведение зависит только от относительного сдвига токенов. Основа удлинения контекста.Разбор: Современные архитектуры: RoPE, MoE, GQA
- SentencePiecesentencepiece
- Токенизатор, работающий с сырой строкой без предварительного деления по пробелам — пробел считается обычным символом. Удобен для языков без пробелов, например японского.Разбор: Токенизация и BPE
- Skip-gramskip-gram
- Режим word2vec: по центральному слову предсказать слова-соседи в окне. Работает для редких слов лучше, чем обратный режим CBOW.Разбор: Эмбеддинги и word2vec
- SwiGLUswish-gated linear unit
- Гейтированная активация MLP-блоков, заменившая ReLU в современных LLM: одна ветвь слоя умножается на «ворота» из другой, что стабильно даёт чуть лучшее качество.Разбор: Современные архитектуры: RoPE, MoE, GQA
- Word2vecword2vec
- Метод обучения эмбеддингов: маленькая сеть учится предсказывать соседей слова, а полезный продукт — её матрица эмбеддингов, где похожие по смыслу слова оказываются рядом.Разбор: Эмбеддинги и word2vec
- WordPiecewordpiece
- Подсловный токенизатор BERT: сливает не самую частую пару, а ту, что сильнее всего увеличивает правдоподобие корпуса; куски внутри слова помечаются специальным префиксом.Разбор: Токенизация и BPE