Диагностика Mock-интервью
Главная · Раздел

Мультимодальные модели

Модели за пределами текста: как LLM видят изображения и слышат речь, omni-модели, OCR, а также генерация картинок и видео от VAE и GAN до диффузионных моделей.

7 тем, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.

1. Как LLM видят изображения

LLM понимает только последовательности токенов, поэтому картинку превращают в «визуальные слова»: ViT режет её на патчи, CLIP учит энкодер смыслу изображений, а проектор подаёт визуальные токены в языковую модель (VLM).

На собеседовании спросят: «Как картинка попадает в LLM?»

2. Звук: распознавание и синтез речи

Как звук превращается в текст и обратно: волна, мел-спектрограмма, ASR-модели вроде Whisper, CTC-лосс, TTS с вокодером и аудиотокены, которые делают звук «языком» для LLM. Плюс метрика WER.

На собеседовании спросят: «Как звук попадает в нейросеть?»

3. Omni-модели: все модальности в одной

GPT-4o и Gemini — natively multimodal (omni) модели: один трансформер принимает и генерирует текст, аудио и изображения как единый поток токенов. Чем это лучше пайплайна ASR→LLM→TTS и VLM с адаптерами — разбираем на задержке и эмоциях.

На собеседовании спросят: «Чем omni отличается от LLM с адаптерами и от пайплайна ASR→LLM→TTS?»

4. OCR: от классики до распознавания через LLM

Как из пикселей получить текст: классический OCR-пайплайн (бинаризация, сегментация, распознавание символов), современный DL-OCR с CRNN и CTC, и чтение документов мультимодальными LLM — с их главным риском, галлюцинациями.

На собеседовании спросят: «Спроектируй распознавание паспортов/чеков»

5. VAE и GAN: генерация до диффузии

До диффузии картинки генерировали VAE и GAN: вариационный автоэнкодер учит гладкое латентное пространство, из которого можно сэмплировать, а GAN устраивает состязание генератора с дискриминатором. Оба живы: VAE — внутри Stable Diffusion, GAN — в апскейлерах.

На собеседовании спросят: «Чем VAE отличается от автоэнкодера?»

6. Диффузионные модели: как рисует Stable Diffusion

Диффузионная модель учится убирать шум маленькими шагами: forward-процесс топит картинку в гауссовом шуме, сеть предсказывает этот шум, а генерация — расшумление из чистого шума. Разбираем latent diffusion, guidance и ускорение до 1–4 шагов.

На собеседовании спросят: «Что предсказывает диффузионная сеть?»

7. Видео-модели: генерация с временной согласованностью

Видео — не стопка независимых картинок: без внимания по времени кадры мерцают, а объекты телепортируются. Разбираем temporal consistency, пространственно-временные патчи Sora-класса, цену видео в токенах и идею world models.

На собеседовании спросят: «Чем видео-генерация сложнее картиночной?»