Мультимодальные модели
Модели за пределами текста: как LLM видят изображения и слышат речь, omni-модели, OCR, а также генерация картинок и видео от VAE и GAN до диффузионных моделей.
7 тем, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.
1. Как LLM видят изображения
LLM понимает только последовательности токенов, поэтому картинку превращают в «визуальные слова»: ViT режет её на патчи, CLIP учит энкодер смыслу изображений, а проектор подаёт визуальные токены в языковую модель (VLM).
На собеседовании спросят: «Как картинка попадает в LLM?»
2. Звук: распознавание и синтез речи
Как звук превращается в текст и обратно: волна, мел-спектрограмма, ASR-модели вроде Whisper, CTC-лосс, TTS с вокодером и аудиотокены, которые делают звук «языком» для LLM. Плюс метрика WER.
На собеседовании спросят: «Как звук попадает в нейросеть?»
3. Omni-модели: все модальности в одной
GPT-4o и Gemini — natively multimodal (omni) модели: один трансформер принимает и генерирует текст, аудио и изображения как единый поток токенов. Чем это лучше пайплайна ASR→LLM→TTS и VLM с адаптерами — разбираем на задержке и эмоциях.
На собеседовании спросят: «Чем omni отличается от LLM с адаптерами и от пайплайна ASR→LLM→TTS?»
4. OCR: от классики до распознавания через LLM
Как из пикселей получить текст: классический OCR-пайплайн (бинаризация, сегментация, распознавание символов), современный DL-OCR с CRNN и CTC, и чтение документов мультимодальными LLM — с их главным риском, галлюцинациями.
На собеседовании спросят: «Спроектируй распознавание паспортов/чеков»
5. VAE и GAN: генерация до диффузии
До диффузии картинки генерировали VAE и GAN: вариационный автоэнкодер учит гладкое латентное пространство, из которого можно сэмплировать, а GAN устраивает состязание генератора с дискриминатором. Оба живы: VAE — внутри Stable Diffusion, GAN — в апскейлерах.
На собеседовании спросят: «Чем VAE отличается от автоэнкодера?»
6. Диффузионные модели: как рисует Stable Diffusion
Диффузионная модель учится убирать шум маленькими шагами: forward-процесс топит картинку в гауссовом шуме, сеть предсказывает этот шум, а генерация — расшумление из чистого шума. Разбираем latent diffusion, guidance и ускорение до 1–4 шагов.
На собеседовании спросят: «Что предсказывает диффузионная сеть?»
7. Видео-модели: генерация с временной согласованностью
Видео — не стопка независимых картинок: без внимания по времени кадры мерцают, а объекты телепортируются. Разбираем temporal consistency, пространственно-временные патчи Sora-класса, цену видео в токенах и идею world models.
На собеседовании спросят: «Чем видео-генерация сложнее картиночной?»