Диагностика Mock-интервью
Главная · Раздел

Железо и развёртывание

Железо и развёртывание: видеокарты и расчёт VRAM, распределённое обучение DP, TP, PP и ZeRO, выбор между локальными моделями, облаком и API.

3 темы, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.

1. Видеокарты и VRAM: железо для нейросетей

Почему нейросети живут на GPU, а не на CPU, что такое видеопамять (VRAM) и как по простой арифметике заранее сказать, влезет ли модель в вашу карту — или придётся квантовать, делить на несколько GPU и офлоадить слои в RAM.

На собеседовании спросят: «Сколько VRAM нужно для 13B в 4 бита?»

2. Распределённое обучение: DP, TP, PP и ZeRO

Что делать, когда модель или данные не помещаются на одну GPU: data, tensor и pipeline parallelism, шардирование состояний ZeRO/FSDP и как из них собирают 3D-параллелизм для обучения больших LLM.

На собеседовании спросят: «Модель 70B не влезает в A100 на 80 ГБ»

3. Локальные модели против SaaS и API

Крутить open-weight модель на своём железе, арендовать GPU в облаке или ходить в чужой API — решение, которое на собеседовании по дизайну систем всплывает постоянно. Разбираем две оси выбора, три модели затрат и главную идею: точку перелома, где дешёвое становится дорогим.

На собеседовании спросят: «Когда self-hosted, а когда API?»