Диагностика Mock-интервью
Главная · Глоссарий · Железо и развёртывание

Глоссарий: Железо и развёртывание

24 термина раздела «Железо и развёртывание» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.

3D-параллелизм3d parallelism
Комбинация трёх осей для обучения фронтир-моделей: tensor parallelism внутри узла с NVLink, pipeline parallelism между узлами и data parallelism поверх получившихся копий.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
Микробатчmicro-batch
Малая часть батча, на которые его режут при pipeline parallelism, чтобы стадии конвейера работали внахлёст (схемы GPipe, 1F1B): чем больше микробатчей, тем меньше доля простоя.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
Пропускная способность памятиmemory bandwidth
Скорость, с которой память отдаёт данные чипу. У VRAM — порядка терабайта в секунду, у обычной RAM — в 10–30 раз меньше; для инференса LLM это важнее объёма и терафлопсов.Разбор: Видеокарты и VRAM: железо для нейросетей
Роутинг запросовrouting
Гибридная схема: дешёвая локальная модель обрабатывает простые и приватные запросы, а сложные уходят в мощный API — экономия на объёме плюс доступ к frontier-качеству там, где оно нужно.Разбор: Локальные модели против SaaS и API
Точка переломаcrossover point
Объём использования, на котором один вариант затрат становится дешевле другого: линейно растущая стоимость API пересекает почти фиксированную стоимость собственного железа.Разбор: Локальные модели против SaaS и API
All-reduceall-reduce
Коллективная операция обмена, усредняющая или суммирующая значения со всех GPU и раздающая результат каждой; так синхронизируются градиенты при data parallelism.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
Capexcapital expenditure
Капитальные затраты — разовые вложения, например покупка GPU. Модель затрат собственного кластера: дорого на старте, зато цена за токен при высокой утилизации крошечная.Разбор: Локальные модели против SaaS и API
Cloud burstingcloud bursting
Гибридная схема размещения: базовая стабильная нагрузка обслуживается собственным железом, а пики трафика отдаются в облако.Разбор: Локальные модели против SaaS и API
Data parallelismdata parallelism
Параллелизм по данным: на каждой GPU полная копия модели, батчи разные; градиенты усредняются операцией all-reduce на каждом шаге. Ускоряет обучение почти линейно, но память не экономит.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
FSDPfully sharded data parallel
Реализация идей ZeRO в PyTorch: веса, градиенты и состояния оптимизатора шардируются по GPU, а полные веса слоя собираются только на время его вычисления и сразу отбрасываются.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
GPUgraphics processing unit
Графический процессор: тысячи простых ядер, параллельно перемалывающих однотипную арифметику. Нейросети — потоки умножений матриц, поэтому на GPU они в десятки раз быстрее, чем на CPU.Разбор: Видеокарты и VRAM: железо для нейросетей
Memory-bandwidth-boundmemory-bandwidth-bound
Режим, когда скорость упирается не в вычисления, а в перекачку данных: на каждый токен генерации через чип прогоняются все веса и кэш, а арифметики при этом мало.Разбор: Видеокарты и VRAM: железо для нейросетей
Offloadoffloading
Выгрузка части слоёв модели из VRAM в оперативную память или на диск с подкачкой по мере надобности: модель запускается на слабом железе, но каждый выгруженный слой замедляет генерацию.Разбор: Видеокарты и VRAM: железо для нейросетей
Open-weight модельopen-weight model
Модель с опубликованными весами: её можно скачать, запустить на своём железе и дообучить — в отличие от проприетарной frontier-модели, доступной только через API провайдера.Разбор: Локальные модели против SaaS и API
Opexoperational expenditure
Операционные затраты — регулярные платежи, например почасовая аренда GPU: гибко масштабируется вверх и вниз, но платить приходится и за простаивающие часы.Разбор: Локальные модели против SaaS и API
Pipeline bubblepipeline bubble
Простой стадий конвейера при pipeline parallelism: в начале шага последние стадии ждут данных, в конце первые уже закончили. Лечится разбиением батча на много микробатчей.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
Pipeline parallelismpipeline parallelism
Разрез модели «вдоль»: разным GPU достаются разные группы слоёв, данные идут по конвейеру, между стадиями передаются только активации. Плата — пузырь простоя в начале и конце шага.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
Self-hostedself-hosted
Запуск модели на собственном железе: данные не покидают периметр, есть полный контроль и свой файнтюн, а затраты капитальные — выгодно при большом стабильном потоке запросов.Разбор: Локальные модели против SaaS и API
TCOtotal cost of ownership
Полная стоимость владения: не только цена GPU, но и электричество, амортизация, зарплаты инженеров и стоимость простоя недозагруженных карт. Именно TCO сравнивают со стоимостью API.Разбор: Локальные модели против SaaS и API
Tensor parallelismtensor parallelism
Разрез модели «поперёк»: каждая матрица слоя делится между GPU, карты считают слой сообща и обмениваются активациями внутри каждого слоя. Из-за частых обменов живёт только на NVLink внутри узла.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
Vendor lock-invendor lock-in
Зависимость от провайдера: невозможность легко сменить API или модель, риск внезапных изменений модели и цен на стороне вендора.Разбор: Локальные модели против SaaS и API
VRAMvideo ram
Видеопамять, распаянная рядом с чипом GPU. Ключевое свойство — пропускная способность порядка терабайт в секунду; веса модели должны помещаться в VRAM целиком, иначе скорость падает в разы.Разбор: Видеокарты и VRAM: железо для нейросетей
ZeROzero redundancy optimizer
Устранение избыточности data parallelism шардированием состояний по картам: стадия 1 — состояния оптимизатора, 2 — плюс градиенты, 3 — плюс сами веса. Память на карту падает почти в число карт раз.Разбор: Распределённое обучение: DP, TP, PP и ZeRO