Глоссарий: Нейронные сети
52 термина раздела «Нейронные сети» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.
- Автоматическое дифференцированиеautomatic differentiation
- Механизм фреймворков, который строит граф вычислений и сам считает производные любой композиции операций. Благодаря ему backprop работает для любой архитектуры без ручного вывода формул.Разбор: Обратное распространение ошибки
- Батч-нормализацияbatch normalization
- Нормировка активаций по статистикам текущего батча с обучаемыми сдвигом и масштабом. Ускоряет обучение CNN, но зависит от размера батча и требует бегущих статистик на инференсе.Разбор: Практика обучения: батчи, dropout, batchnorm
- Вентильgate
- Маленький сигмоидный слой со значениями от 0 до 1, управляющий потоком информации в рекуррентной сети: что стереть из памяти, что записать, что показать наружу. Основной механизм LSTM и GRU.Разбор: Рекуррентные сети (RNN, LSTM)
- Весweight
- Обучаемый коэффициент, на который нейрон умножает входной сигнал. Веса подбираются градиентным спуском и определяют, какие признаки и насколько сильно влияют на выход.Разбор: От нейрона к многослойному перцептрону
- Взрывающиеся градиентыexploding gradients
- Экспоненциальный рост градиента по цепочке умножений, из-за которого лосс скачет или уходит в NaN. Стандартное лекарство — обрезка градиентов.Разбор: Обратное распространение ошибки
- Гиперболический тангенсtanh
- Активация с диапазоном от минус единицы до единицы: центрирована вокруг нуля, что удобнее для оптимизации, чем сигмоида, но точно так же насыщается на больших входах.Разбор: Функции активации
- Глубокое обучениеdeep learning
- Обучение нейросетей со многими слоями, где каждый слой строит признаки поверх предыдущих. Композиция даёт иерархию признаков и требует куда меньше нейронов, чем один широкий слой.Разбор: От нейрона к многослойному перцептрону
- Затухание весовweight decay
- Регуляризация, на каждом шаге слегка уменьшающая веса, чтобы они не разрастались. В AdamW применяется отдельным слагаемым, а не как L2-штраф в лоссе.Разбор: Оптимизаторы: SGD, Momentum, Adam
- Затухающие градиентыvanishing gradients
- Экспоненциальное уменьшение градиента к ранним слоям, когда множители в цепочке производных меньше единицы. Классическая причина — насыщающиеся активации; лечат ReLU, нормализация и остаточные связи.Разбор: Обратное распространение ошибки
- Инвариантность к сдвигуtranslation invariance
- Способность модели узнавать признак независимо от его положения на картинке. У свёрток встроена благодаря скольжению одного ядра; у полносвязных сетей отсутствует.Разбор: Свёрточные сети (CNN)
- Индуктивное смещениеinductive bias
- Встроенные в архитектуру априорные предположения о данных — например, локальность и разделяемые веса свёрток. Помогает учиться на малых данных, но ограничивает гибкость.Разбор: Свёрточные сети (CNN)
- Инициализация весовweight initialization
- Задание стартовых весов случайными числами правильного масштаба (схемы Xavier и He). Нулевая инициализация вырождает слой: из-за симметрии все нейроны навсегда остаются копиями друг друга.Разбор: Практика обучения: батчи, dropout, batchnorm
- Искусственный нейронartificial neuron
- Базовый элемент нейросети: взвешивает входы, суммирует их со смещением и пропускает результат через функцию активации. Из таких блоков, соединённых слоями, строится любая нейросеть.Разбор: От нейрона к многослойному перцептрону
- Карта признаковfeature map
- Выход свёрточного фильтра: карта откликов детектора на каждом участке изображения. Слой из многих фильтров выдаёт по отдельной карте на каждый искомый признак.Разбор: Свёрточные сети (CNN)
- Линейный классификаторlinear classifier
- Модель, считающая скор каждого класса как взвешенную сумму признаков плюс смещение. Границы классов — гиперплоскости; для картинок веса можно увидеть как выученные «шаблоны» классов.Разбор: Распознавание цифр из пикселей
- Мёртвые нейроныdead neurons
- ReLU-нейроны, застрявшие в отрицательной зоне на всех входах: их выход и градиент — тождественный ноль, и обучение их уже не вернёт. Лечится Leaky ReLU, GELU и аккуратным learning rate.Разбор: Функции активации
- Мини-батчmini-batch
- Случайная пачка примеров (обычно 32–1024), по которой оценивается градиент на одном шаге. Компромисс между шумной оценкой по одному примеру и дорогим подсчётом по всему датасету.Разбор: Практика обучения: батчи, dropout, batchnorm
- Многослойный перцептронmultilayer perceptron
- Нейросеть из чередующихся линейных слоёв и нелинейных активаций. Простейшая полносвязная архитектура, способная приближать очень сложные функции.Разбор: От нейрона к многослойному перцептрону
- Насыщениеsaturation
- Зона активации, где её производная почти нулевая, — например, большие по модулю входы сигмоиды. Градиент через насыщенный нейрон не проходит, и слой перестаёт учиться.Разбор: Функции активации
- Нормализация слояlayer normalization
- Нормировка активаций по признакам одного примера, без участия батча. Дружит с последовательностями переменной длины и стала стандартом трансформеров.Разбор: Практика обучения: батчи, dropout, batchnorm
- Обратное распространение ошибкиbackpropagation
- Алгоритм вычисления градиента лосса по всем весам сети за один обратный проход через повторное применение правила цепочки. Считает градиенты, но не обновляет веса — это работа оптимизатора.Разбор: Обратное распространение ошибки
- Обратный проходbackward pass
- Проход от лосса к входам, на котором градиент каждого узла получается умножением входящего градиента на локальную производную. Стоит примерно как два прямых прохода.Разбор: Обратное распространение ошибки
- Обрезка градиентовgradient clipping
- Масштабирование градиента вниз, если его норма превышает порог: один аномальный батч не сможет разнести веса. Стандартная практика для рекуррентных сетей и LLM.Разбор: Практика обучения: батчи, dropout, batchnorm
- Перцептронperceptron
- Один нейрон с пороговой активацией — простейший линейный классификатор. Проводит гиперплоскость в пространстве признаков и потому решает только линейно разделимые задачи.Разбор: От нейрона к многослойному перцептрону
- Правило цепочкиchain rule
- Правило дифференцирования сложной функции: чувствительности перемножаются по цепочке зависимостей. Математическая основа обратного распространения ошибки.Разбор: Обратное распространение ошибки
- Прогревwarmup
- Начальный этап обучения, когда learning rate линейно растёт от нуля. Защищает хрупкую свежеинициализированную модель от разноса, пока статистики моментов оптимизатора не накопились.Разбор: Оптимизаторы: SGD, Momentum, Adam
- Прямой проходforward pass
- Вычисление выхода сети от входа к лоссу с сохранением промежуточных активаций — они понадобятся на обратном проходе для подсчёта локальных производных.Разбор: Обратное распространение ошибки
- Разделяемые весаweight sharing
- Использование одного и того же ядра во всех позициях изображения: признак детектируется где угодно одними весами, а параметров нужно в тысячи раз меньше, чем полносвязному слою.Разбор: Свёрточные сети (CNN)
- Расписание скорости обученияlearning rate schedule
- План изменения learning rate по ходу обучения: типично линейный прогрев в начале и косинусное затухание к концу. Постоянный шаг почти никогда не оптимален.Разбор: Практика обучения: батчи, dropout, batchnorm
- Рецептивное полеreceptive field
- Область входного изображения, влияющая на данный нейрон. С глубиной сети растёт: верхние слои «видят» крупные фрагменты и собирают из простых признаков сложные.Разбор: Свёрточные сети (CNN)
- Сопоставление с шаблонамиtemplate matching
- Интерпретация линейного классификатора картинок: веса каждого класса — картинка-шаблон, а предсказание — выбор шаблона, с которым вход дал наибольшее скалярное произведение.Разбор: Распознавание цифр из пикселей
- Теорема об универсальной аппроксимацииuniversal approximation theorem
- Утверждение, что MLP даже с одним достаточно широким скрытым слоем может приблизить любую непрерывную функцию. Не гарантирует ни разумный размер сети, ни то, что обучение найдёт нужные веса.Разбор: От нейрона к многослойному перцептрону
- Функция активацииactivation function
- Нелинейное преобразование выхода нейрона. Без активаций стопка линейных слоёв схлопывается в один линейный слой, а производная активации определяет, как течёт градиент при обучении.Разбор: Функции активации
- Эпохаepoch
- Один полный проход обучения по всем примерам датасета. Обучение обычно длится десятки эпох, а прогресс отслеживают по кривым ошибки на трейне и валидации.Разбор: Практика обучения: батчи, dropout, batchnorm
- Ядро свёрткиconvolution kernel
- Маленькая матрица весов (например, 3 на 3), скользящая по изображению и считающая скалярное произведение с каждым окном. Один обучаемый детектор признака, применяемый во всех позициях.Разбор: Свёрточные сети (CNN)
- Ячейка памятиcell state
- Отдельный «конвейер» памяти в LSTM, по которому информация течёт сквозь шаги почти без изменений и обновляется аддитивно — благодаря этому градиенты затухают куда медленнее.Разбор: Рекуррентные сети (RNN, LSTM)
- Adamadaptive moment estimation
- Оптимизатор, объединяющий momentum и RMSProp: ведёт скользящие средние градиента и его квадрата с поправкой смещения. Дефолтный выбор для большинства задач.Разбор: Оптимизаторы: SGD, Momentum, Adam
- AdamWadam with decoupled weight decay
- Adam с исправленным weight decay: штраф за большие веса применяется отдельным слагаемым, а не через градиент, где его исказила бы адаптивная нормировка. Стандарт обучения трансформеров.Разбор: Оптимизаторы: SGD, Momentum, Adam
- BPTTbackpropagation through time
- Обучение RNN через «развёртку» цепочки шагов в глубокую сеть с общими весами и обратное распространение по ней. Именно здесь градиенты затухают или взрываются с ростом длины последовательности.Разбор: Рекуррентные сети (RNN, LSTM)
- CNNconvolutional neural network
- Свёрточная нейросеть: архитектура для изображений, где маленькие ядра-детекторы скользят по картинке. Локальность и разделяемые веса дают экономию параметров и устойчивость к сдвигам.Разбор: Свёрточные сети (CNN)
- Dropoutdropout
- Регуляризация: при обучении каждый нейрон случайно выключается с заданной вероятностью, чтобы признаки стали избыточными. На инференсе выключен — отсюда различие режимов train и eval.Разбор: Практика обучения: батчи, dropout, batchnorm
- GELUgaussian error linear unit
- Гладкая версия ReLU, взвешивающая вход по функции нормального распределения. Вместе с SiLU — стандартная активация FFN-блоков современных трансформеров.Разбор: Функции активации
- GRUgated recurrent unit
- Упрощённая альтернатива LSTM с двумя вентилями вместо трёх и без отдельной ячейки памяти. Быстрее, а по качеству обычно сопоставима.Разбор: Рекуррентные сети (RNN, LSTM)
- LSTMlong short-term memory
- Рекуррентная архитектура с ячейкой памяти и тремя вентилями, управляющими записью, стиранием и чтением. Аддитивное обновление памяти позволяет градиенту течь на сотни шагов без затухания.Разбор: Рекуррентные сети (RNN, LSTM)
- MNISTmodified national institute of standards and technology database
- Классический датасет из 70 тысяч рукописных цифр 28 на 28 пикселей — «hello world» компьютерного зрения и стандартная песочница для отладки пайплайна обучения.Разбор: Распознавание цифр из пикселей
- Momentummomentum
- Приём оптимизации, накапливающий экспоненциальное скользящее среднее градиентов — «скорость». Гасит колебания поперёк оврага и разгоняет движение вдоль него.Разбор: Оптимизаторы: SGD, Momentum, Adam
- ReLUrectified linear unit
- Активация, возвращающая ноль для отрицательного входа и сам вход для положительного. С ней глубокие сети впервые стали стабильно обучаться, но нейроны могут «умирать» в нулевой зоне.Разбор: Функции активации
- RMSProproot mean square propagation
- Оптимизатор с адаптивным шагом: делит обновление на корень скользящего среднего квадратов градиента, выравнивая масштаб шага у параметров с разными по величине градиентами.Разбор: Оптимизаторы: SGD, Momentum, Adam
- RNNrecurrent neural network
- Рекуррентная сеть: обрабатывает последовательность шаг за шагом, храня «конспект» прочитанного в скрытом состоянии. Один и тот же слой с общими весами применяется на каждом шаге.Разбор: Рекуррентные сети (RNN, LSTM)
- SSMstate space model
- Модели пространства состояний (например, Mamba) — современные линейные рекуррентные сети: дешёвый пошаговый инференс как у RNN при параллельном обучении как у трансформера.Разбор: Рекуррентные сети (RNN, LSTM)