Глоссарий: Мультимодальные модели
49 терминов раздела «Мультимодальные модели» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.
- Автоэнкодерautoencoder
- Пара сетей: энкодер сжимает объект в короткий латентный вектор, декодер восстанавливает его обратно, лосс — ошибка реконструкции. Для генерации непригоден: латентное пространство «дырявое».Разбор: VAE и GAN: генерация до диффузии
- Аудиотокеныaudio tokens
- Дискретные токены из конечного словаря, в которые нейрокодек сжимает звуковую волну. Звук становится «языком», и модель может слушать и генерировать его как обычный текст.Разбор: Звук: распознавание и синтез речи
- Бинаризацияbinarization
- Шаг препроцессинга OCR: пиксели темнее порога считаются «чернилами», светлее — «бумагой». Порог подбирают автоматически, например методом Оцу по гистограмме яркостей.Разбор: OCR: от классики до распознавания через LLM
- Вокодерvocoder
- Сеть, восстанавливающая звуковую волну из мел-спектрограммы: спектрограмма хранит только энергии частот без фазы, поэтому вокодер учится дорисовывать правдоподобную волну.Разбор: Звук: распознавание и синтез речи
- Детекция текстаtext detection
- Поиск областей с текстом на изображении (рамки строк и слов) — первый этап современного DL-OCR; идею реализуют модели типа CRAFT и EAST.Разбор: OCR: от классики до распознавания через LLM
- Диаризацияspeaker diarization
- Разметка аудиозаписи по говорящим: «кто и когда говорит» в записи с несколькими людьми.Разбор: Звук: распознавание и синтез речи
- Дискриминаторdiscriminator
- Сеть в GAN, которая учится отличать настоящие примеры от сгенерированных; её вердикт служит генератору сигналом качества вместо попиксельного лосса.Разбор: VAE и GAN: генерация до диффузии
- Диффузионная модельdiffusion model
- Генеративная модель, обученная убирать шум маленькими шагами: сеть предсказывает подмешанный шум, а генерация — цепочка шагов расшумления, превращающая чистый шум в картинку.Разбор: Диффузионные модели: как рисует Stable Diffusion
- Латентное пространствоlatent space
- Пространство сжатых векторов-кодов, в которое энкодер отображает данные. У VAE оно гладкое: соседние точки декодируются в похожие объекты, между кодами можно плавно интерполировать.Разбор: VAE и GAN: генерация до диффузии
- Мел-спектрограммаmel spectrogram
- «Картинка» время×частота: волну режут на окна, в каждом считают спектр, а частотную ось сжимают по мел-шкале под чувствительность человеческого уха. Стандартный вход речевых моделей.Разбор: Звук: распознавание и синтез речи
- Мерцаниеflickering
- Артефакт генерации видео независимыми кадрами: цвет, размер и позиция объектов заново выбираются в каждом кадре, при проигрывании картинка мигает, а объекты «телепортируются».Разбор: Видео-модели: генерация с временной согласованностью
- Нейрокодекneural codec
- Модель сжатия звука (идея EnCodec): энкодер, квантизация RVQ (несколько словарей, каждый следующий кодирует остаток предыдущего) и декодер, восстанавливающий волну из дискретных токенов.Разбор: Звук: распознавание и синтез речи
- Пайплайн ASR→LLM→TTScascaded voice pipeline
- Голосовой ассистент из трёх отдельных моделей: распознавание речи, языковая модель, синтез речи. Задержки блоков складываются в секунды, а на стыках теряются интонация и эмоции.Разбор: Omni-модели: все модальности в одной
- Патчpatch
- Квадратный фрагмент изображения (обычно 14×14 или 16×16 пикселей), который после линейной проекции становится одним визуальным токеном. Чем меньше патч, тем больше токенов и дороже обработка.Разбор: Как LLM видят изображения
- Поздняя фузияlate fusion
- Объединение модальностей в конце: отдельные модели обрабатывают каждая свою модальность, а результаты склеиваются. Крайний случай — пайплайн из распознавания речи, LLM и синтеза речи.Разбор: Omni-модели: все модальности в одной
- Проекторprojector, adapter
- Небольшой модуль (MLP или cross-attention) между vision-энкодером и LLM: переводит визуальные эмбеддинги в пространство эмбеддингов языковой модели, выравнивая и размерность, и «язык» векторов.Разбор: Как LLM видят изображения
- Пространственно-временные патчиspatio-temporal patches
- Токены видео-моделей Sora-класса: сжатый видео-VAE латент режется на «кубики» по ширине, высоте и времени, и каждый кубик становится токеном для диффузионного трансформера.Разбор: Видео-модели: генерация с временной согласованностью
- Ранняя фузияearly fusion
- Объединение модальностей на входе: токены текста, аудио и изображений смешиваются в один поток, и одна модель учится связям между ними глубоко внутри.Разбор: Omni-модели: все модальности в одной
- Расписание шумаnoise schedule
- Кривая, задающая долю сигнала исходной картинки на каждом шаге зашумления — от единицы (чистая картинка) до почти нуля (чистый шум). Форму подбирают для равномерного разрушения информации.Разбор: Диффузионные модели: как рисует Stable Diffusion
- Сегментация символовcharacter segmentation
- Шаг классического OCR: страница режется на строки, слова и символы, например по проекциям — пустые столбцы пикселей считаются границами. Ломается на слипшихся буквах.Разбор: OCR: от классики до распознавания через LLM
- ASRautomatic speech recognition
- Распознавание речи — превращение аудио в текст. Современный подход в духе Whisper: мел-спектрограмма подаётся в трансформер encoder-decoder, декодер авторегрессионно выводит текст.Разбор: Звук: распознавание и синтез речи
- CFGclassifier-free guidance
- Управление диффузией: на каждом шаге модель делает предсказание с промптом и без, итог экстраполируется в сторону условного. Больше сила — точнее следование промпту, перебор «пережаривает» картинку.Разбор: Диффузионные модели: как рисует Stable Diffusion
- CLIPcontrastive language-image pretraining
- Модель, обученная контрастивно на сотнях миллионов пар «картинка–подпись»: эмбеддинги изображений и текстов живут в общем пространстве, что даёт zero-shot классификацию.Разбор: Как LLM видят изображения
- CRNNconvolutional recurrent neural network
- Сеть для распознавания строки текста: свёртки превращают строку в последовательность кадров-признаков, рекуррентный слой читает её, а CTC-лосс выравнивает кадры с буквами без посимвольной сегментации.Разбор: OCR: от классики до распознавания через LLM
- CTCconnectionist temporal classification
- Лосс для распознавания речи, решающий проблему выравнивания без разметки границ звуков: модель предсказывает букву или пустой токен на каждый кадр, повторы схлопываются, blank выбрасывается.Разбор: Звук: распознавание и синтез речи
- DDIMdenoising diffusion implicit models
- Детерминированный сэмплер диффузии, позволяющий шагать крупнее: 20–50 шагов расшумления вместо тысячи, без переобучения модели.Разбор: Диффузионные модели: как рисует Stable Diffusion
- DiTdiffusion transformer
- Диффузионный трансформер: замена U-Net на трансформер над патчами латента. Лучше масштабируется и стал стандартом новых моделей генерации изображений и видео.Разбор: Диффузионные модели: как рисует Stable Diffusion
- Forward-процессforward process
- Прямой процесс диффузии: в картинку за много шагов постепенно замешивается гауссов шум по расписанию, пока не останется чистый шум. Так создаются обучающие пары для сети-расшумлятора.Разбор: Диффузионные модели: как рисует Stable Diffusion
- GANgenerative adversarial network
- Генеративно-состязательная сеть: генератор превращает шум в картинку, дискриминатор учится отличать настоящее от сгенерированного. Минимакс-игра даёт резкие картинки, но обучение нестабильно.Разбор: VAE и GAN: генерация до диффузии
- Image-to-videoimage-to-video
- Режим видео-генерации с кондиционированием на стартовый кадр: картинка фиксирует композицию и стиль, а модель дорисовывает согласованное движение.Разбор: Видео-модели: генерация с временной согласованностью
- Interleaved-данныеinterleaved data
- Обучающие последовательности, где токены разных модальностей чередуются в одном потоке — как текст со вставленными картинками на веб-странице. На них omni-модель учится связям между модальностями.Разбор: Omni-модели: все модальности в одной
- Latent diffusionlatent diffusion model
- Диффузия не в пикселях, а в компактном латенте VAE: энкодер сжимает картинку в десятки раз, расшумление идёт в латенте, декодер возвращает пиксели. Основа Stable Diffusion.Разбор: Диффузионные модели: как рисует Stable Diffusion
- Mode collapsemode collapse
- Хроническая болезнь GAN: генератор находит несколько примеров, стабильно обманывающих дискриминатора, и выдаёт почти одно и то же на любые входы — разнообразие распределения потеряно.Разбор: VAE и GAN: генерация до диффузии
- OCRoptical character recognition
- Распознавание текста на изображении: из пикселей — машиночитаемая строка. Три поколения инструментов: правила и шаблоны, свёрточные сети, мультимодальные LLM.Разбор: OCR: от классики до распознавания через LLM
- Omni-модельnatively multimodal model
- Модель, с претрейна обученная на перемешанных последовательностях токенов разных модальностей: единый трансформер принимает и генерирует текст, аудио и изображения как один поток.Разбор: Omni-модели: все модальности в одной
- Reparameterization trickreparameterization trick
- Приём в VAE: сэмпл записывают как среднее плюс разброс, умноженный на стандартный шум. Случайность вынесена в отдельную переменную, и градиент проходит через параметры распределения.Разбор: VAE и GAN: генерация до диффузии
- Structured extractionstructured extraction
- Извлечение структурированных полей из документа («номер счёта», «сумма», «дата») сразу в машиночитаемом виде — типичная задача для чтения документов мультимодальной LLM.Разбор: OCR: от классики до распознавания через LLM
- Temporal attentiontemporal attention
- Внимание по оси времени: участок сцены смотрит на себя в соседних кадрах. Вместе с пространственным вниманием образует пространственно-временное (3D) внимание видео-моделей.Разбор: Видео-модели: генерация с временной согласованностью
- Temporal consistencytemporal consistency
- Временная согласованность видео: объекты сохраняют форму, цвет и плавную траекторию от кадра к кадру. Главная проблема видео-генерации — сама собой согласованность не возникает.Разбор: Видео-модели: генерация с временной согласованностью
- Tilingtiling
- Обработка изображения высокого разрешения по частям: картинка режется на фрагменты стандартного размера плюс уменьшенная глобальная копия. Деталей видно больше, но визуальных токенов кратно больше.Разбор: Как LLM видят изображения
- TTStext-to-speech
- Синтез речи: конвейер «текст → мел-спектрограмма → волна», где последний шаг выполняет отдельная сеть — вокодер.Разбор: Звук: распознавание и синтез речи
- U-Netu-net
- Свёрточная архитектура «энкодер–декодер», исторически основная сеть предсказания шума в диффузионных моделях; в новых моделях вытеснена диффузионным трансформером.Разбор: Диффузионные модели: как рисует Stable Diffusion
- VAEvariational autoencoder
- Автоэнкодер, где энкодер предсказывает распределение (среднее и разброс) вместо точки, а KL-штраф прижимает латент к нормальному — пространство становится гладким и пригодным для сэмплирования.Разбор: VAE и GAN: генерация до диффузии
- Visual instruction tuningvisual instruction tuning
- Дообучение VLM на диалогах с картинками («что на фото?», «прочитай таблицу»), после которого модель не просто подписывает изображения, а умеет разговаривать о них.Разбор: Как LLM видят изображения
- ViTvision transformer
- Трансформер для изображений: картинка режется на патчи фиксированного размера, каждый линейно проецируется в вектор и получает позиционный эмбеддинг — дальше работает обычный механизм внимания.Разбор: Как LLM видят изображения · Свёрточные сети (CNN)
- VLMvisual language model
- Мультимодальная модель «текст + изображения»: vision-энкодер превращает картинку в визуальные токены, проектор выравнивает их с пространством LLM, и языковая модель отвечает на вопросы об изображении.Разбор: Как LLM видят изображения
- WERword error rate
- Главная метрика качества распознавания речи: сумма замен, удалений и вставок слов, делённая на число слов в эталоне. Из-за вставок может превышать 100%.Разбор: Звук: распознавание и синтез речи
- World modelworld model
- Модель, предсказывающая развитие сцены («что будет, если»): видео-модель как симулятор среды, в котором агент или робот может прокрутить последствия действий до реального шага.Разбор: Видео-модели: генерация с временной согласованностью
- Zero-shot классификацияzero-shot classification
- Классификация без дообучения: эмбеддинг картинки сравнивается с эмбеддингами текстовых описаний классов («фото кошки», «фото собаки»), и выбирается ближайший.Разбор: Как LLM видят изображения