Глоссарий: Железо и развёртывание
24 термина раздела «Железо и развёртывание» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.
- 3D-параллелизм3d parallelism
- Комбинация трёх осей для обучения фронтир-моделей: tensor parallelism внутри узла с NVLink, pipeline parallelism между узлами и data parallelism поверх получившихся копий.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
- Микробатчmicro-batch
- Малая часть батча, на которые его режут при pipeline parallelism, чтобы стадии конвейера работали внахлёст (схемы GPipe, 1F1B): чем больше микробатчей, тем меньше доля простоя.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
- Пропускная способность памятиmemory bandwidth
- Скорость, с которой память отдаёт данные чипу. У VRAM — порядка терабайта в секунду, у обычной RAM — в 10–30 раз меньше; для инференса LLM это важнее объёма и терафлопсов.Разбор: Видеокарты и VRAM: железо для нейросетей
- Роутинг запросовrouting
- Гибридная схема: дешёвая локальная модель обрабатывает простые и приватные запросы, а сложные уходят в мощный API — экономия на объёме плюс доступ к frontier-качеству там, где оно нужно.Разбор: Локальные модели против SaaS и API
- Точка переломаcrossover point
- Объём использования, на котором один вариант затрат становится дешевле другого: линейно растущая стоимость API пересекает почти фиксированную стоимость собственного железа.Разбор: Локальные модели против SaaS и API
- All-reduceall-reduce
- Коллективная операция обмена, усредняющая или суммирующая значения со всех GPU и раздающая результат каждой; так синхронизируются градиенты при data parallelism.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
- Capexcapital expenditure
- Капитальные затраты — разовые вложения, например покупка GPU. Модель затрат собственного кластера: дорого на старте, зато цена за токен при высокой утилизации крошечная.Разбор: Локальные модели против SaaS и API
- Cloud burstingcloud bursting
- Гибридная схема размещения: базовая стабильная нагрузка обслуживается собственным железом, а пики трафика отдаются в облако.Разбор: Локальные модели против SaaS и API
- Data parallelismdata parallelism
- Параллелизм по данным: на каждой GPU полная копия модели, батчи разные; градиенты усредняются операцией all-reduce на каждом шаге. Ускоряет обучение почти линейно, но память не экономит.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
- FSDPfully sharded data parallel
- Реализация идей ZeRO в PyTorch: веса, градиенты и состояния оптимизатора шардируются по GPU, а полные веса слоя собираются только на время его вычисления и сразу отбрасываются.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
- GPUgraphics processing unit
- Графический процессор: тысячи простых ядер, параллельно перемалывающих однотипную арифметику. Нейросети — потоки умножений матриц, поэтому на GPU они в десятки раз быстрее, чем на CPU.Разбор: Видеокарты и VRAM: железо для нейросетей
- Memory-bandwidth-boundmemory-bandwidth-bound
- Режим, когда скорость упирается не в вычисления, а в перекачку данных: на каждый токен генерации через чип прогоняются все веса и кэш, а арифметики при этом мало.Разбор: Видеокарты и VRAM: железо для нейросетей
- NVLinknvlink
- Быстрая шина для обмена данными между GPU внутри узла, в разы быстрее обычного PCIe. Необходима тензорному параллелизму, где карты обмениваются активациями на каждом слое.Разбор: Видеокарты и VRAM: железо для нейросетей
- Offloadoffloading
- Выгрузка части слоёв модели из VRAM в оперативную память или на диск с подкачкой по мере надобности: модель запускается на слабом железе, но каждый выгруженный слой замедляет генерацию.Разбор: Видеокарты и VRAM: железо для нейросетей
- Open-weight модельopen-weight model
- Модель с опубликованными весами: её можно скачать, запустить на своём железе и дообучить — в отличие от проприетарной frontier-модели, доступной только через API провайдера.Разбор: Локальные модели против SaaS и API
- Opexoperational expenditure
- Операционные затраты — регулярные платежи, например почасовая аренда GPU: гибко масштабируется вверх и вниз, но платить приходится и за простаивающие часы.Разбор: Локальные модели против SaaS и API
- Pipeline bubblepipeline bubble
- Простой стадий конвейера при pipeline parallelism: в начале шага последние стадии ждут данных, в конце первые уже закончили. Лечится разбиением батча на много микробатчей.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
- Pipeline parallelismpipeline parallelism
- Разрез модели «вдоль»: разным GPU достаются разные группы слоёв, данные идут по конвейеру, между стадиями передаются только активации. Плата — пузырь простоя в начале и конце шага.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
- Self-hostedself-hosted
- Запуск модели на собственном железе: данные не покидают периметр, есть полный контроль и свой файнтюн, а затраты капитальные — выгодно при большом стабильном потоке запросов.Разбор: Локальные модели против SaaS и API
- TCOtotal cost of ownership
- Полная стоимость владения: не только цена GPU, но и электричество, амортизация, зарплаты инженеров и стоимость простоя недозагруженных карт. Именно TCO сравнивают со стоимостью API.Разбор: Локальные модели против SaaS и API
- Tensor parallelismtensor parallelism
- Разрез модели «поперёк»: каждая матрица слоя делится между GPU, карты считают слой сообща и обмениваются активациями внутри каждого слоя. Из-за частых обменов живёт только на NVLink внутри узла.Разбор: Распределённое обучение: DP, TP, PP и ZeRO
- Vendor lock-invendor lock-in
- Зависимость от провайдера: невозможность легко сменить API или модель, риск внезапных изменений модели и цен на стороне вендора.Разбор: Локальные модели против SaaS и API
- VRAMvideo ram
- Видеопамять, распаянная рядом с чипом GPU. Ключевое свойство — пропускная способность порядка терабайт в секунду; веса модели должны помещаться в VRAM целиком, иначе скорость падает в разы.Разбор: Видеокарты и VRAM: железо для нейросетей
- ZeROzero redundancy optimizer
- Устранение избыточности data parallelism шардированием состояний по картам: стадия 1 — состояния оптимизатора, 2 — плюс градиенты, 3 — плюс сами веса. Память на карту падает почти в число карт раз.Разбор: Распределённое обучение: DP, TP, PP и ZeRO