Железо и развёртывание
Железо и развёртывание: видеокарты и расчёт VRAM, распределённое обучение DP, TP, PP и ZeRO, выбор между локальными моделями, облаком и API.
3 темы, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.
1. Видеокарты и VRAM: железо для нейросетей
Почему нейросети живут на GPU, а не на CPU, что такое видеопамять (VRAM) и как по простой арифметике заранее сказать, влезет ли модель в вашу карту — или придётся квантовать, делить на несколько GPU и офлоадить слои в RAM.
На собеседовании спросят: «Сколько VRAM нужно для 13B в 4 бита?»
2. Распределённое обучение: DP, TP, PP и ZeRO
Что делать, когда модель или данные не помещаются на одну GPU: data, tensor и pipeline parallelism, шардирование состояний ZeRO/FSDP и как из них собирают 3D-параллелизм для обучения больших LLM.
На собеседовании спросят: «Модель 70B не влезает в A100 на 80 ГБ»
3. Локальные модели против SaaS и API
Крутить open-weight модель на своём железе, арендовать GPU в облаке или ходить в чужой API — решение, которое на собеседовании по дизайну систем всплывает постоянно. Разбираем две оси выбора, три модели затрат и главную идею: точку перелома, где дешёвое становится дорогим.
На собеседовании спросят: «Когда self-hosted, а когда API?»