Диагностика Mock-интервью
Главная · Глоссарий · Нейронные сети

Глоссарий: Нейронные сети

52 термина раздела «Нейронные сети» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.

Автоматическое дифференцированиеautomatic differentiation
Механизм фреймворков, который строит граф вычислений и сам считает производные любой композиции операций. Благодаря ему backprop работает для любой архитектуры без ручного вывода формул.Разбор: Обратное распространение ошибки
Батч-нормализацияbatch normalization
Нормировка активаций по статистикам текущего батча с обучаемыми сдвигом и масштабом. Ускоряет обучение CNN, но зависит от размера батча и требует бегущих статистик на инференсе.Разбор: Практика обучения: батчи, dropout, batchnorm
Вентильgate
Маленький сигмоидный слой со значениями от 0 до 1, управляющий потоком информации в рекуррентной сети: что стереть из памяти, что записать, что показать наружу. Основной механизм LSTM и GRU.Разбор: Рекуррентные сети (RNN, LSTM)
Весweight
Обучаемый коэффициент, на который нейрон умножает входной сигнал. Веса подбираются градиентным спуском и определяют, какие признаки и насколько сильно влияют на выход.Разбор: От нейрона к многослойному перцептрону
Взрывающиеся градиентыexploding gradients
Экспоненциальный рост градиента по цепочке умножений, из-за которого лосс скачет или уходит в NaN. Стандартное лекарство — обрезка градиентов.Разбор: Обратное распространение ошибки
Гиперболический тангенсtanh
Активация с диапазоном от минус единицы до единицы: центрирована вокруг нуля, что удобнее для оптимизации, чем сигмоида, но точно так же насыщается на больших входах.Разбор: Функции активации
Глубокое обучениеdeep learning
Обучение нейросетей со многими слоями, где каждый слой строит признаки поверх предыдущих. Композиция даёт иерархию признаков и требует куда меньше нейронов, чем один широкий слой.Разбор: От нейрона к многослойному перцептрону
Затухание весовweight decay
Регуляризация, на каждом шаге слегка уменьшающая веса, чтобы они не разрастались. В AdamW применяется отдельным слагаемым, а не как L2-штраф в лоссе.Разбор: Оптимизаторы: SGD, Momentum, Adam
Затухающие градиентыvanishing gradients
Экспоненциальное уменьшение градиента к ранним слоям, когда множители в цепочке производных меньше единицы. Классическая причина — насыщающиеся активации; лечат ReLU, нормализация и остаточные связи.Разбор: Обратное распространение ошибки
Инвариантность к сдвигуtranslation invariance
Способность модели узнавать признак независимо от его положения на картинке. У свёрток встроена благодаря скольжению одного ядра; у полносвязных сетей отсутствует.Разбор: Свёрточные сети (CNN)
Индуктивное смещениеinductive bias
Встроенные в архитектуру априорные предположения о данных — например, локальность и разделяемые веса свёрток. Помогает учиться на малых данных, но ограничивает гибкость.Разбор: Свёрточные сети (CNN)
Инициализация весовweight initialization
Задание стартовых весов случайными числами правильного масштаба (схемы Xavier и He). Нулевая инициализация вырождает слой: из-за симметрии все нейроны навсегда остаются копиями друг друга.Разбор: Практика обучения: батчи, dropout, batchnorm
Искусственный нейронartificial neuron
Базовый элемент нейросети: взвешивает входы, суммирует их со смещением и пропускает результат через функцию активации. Из таких блоков, соединённых слоями, строится любая нейросеть.Разбор: От нейрона к многослойному перцептрону
Карта признаковfeature map
Выход свёрточного фильтра: карта откликов детектора на каждом участке изображения. Слой из многих фильтров выдаёт по отдельной карте на каждый искомый признак.Разбор: Свёрточные сети (CNN)
Линейный классификаторlinear classifier
Модель, считающая скор каждого класса как взвешенную сумму признаков плюс смещение. Границы классов — гиперплоскости; для картинок веса можно увидеть как выученные «шаблоны» классов.Разбор: Распознавание цифр из пикселей
Мёртвые нейроныdead neurons
ReLU-нейроны, застрявшие в отрицательной зоне на всех входах: их выход и градиент — тождественный ноль, и обучение их уже не вернёт. Лечится Leaky ReLU, GELU и аккуратным learning rate.Разбор: Функции активации
Мини-батчmini-batch
Случайная пачка примеров (обычно 32–1024), по которой оценивается градиент на одном шаге. Компромисс между шумной оценкой по одному примеру и дорогим подсчётом по всему датасету.Разбор: Практика обучения: батчи, dropout, batchnorm
Многослойный перцептронmultilayer perceptron
Нейросеть из чередующихся линейных слоёв и нелинейных активаций. Простейшая полносвязная архитектура, способная приближать очень сложные функции.Разбор: От нейрона к многослойному перцептрону
Насыщениеsaturation
Зона активации, где её производная почти нулевая, — например, большие по модулю входы сигмоиды. Градиент через насыщенный нейрон не проходит, и слой перестаёт учиться.Разбор: Функции активации
Нормализация слояlayer normalization
Нормировка активаций по признакам одного примера, без участия батча. Дружит с последовательностями переменной длины и стала стандартом трансформеров.Разбор: Практика обучения: батчи, dropout, batchnorm
Обратное распространение ошибкиbackpropagation
Алгоритм вычисления градиента лосса по всем весам сети за один обратный проход через повторное применение правила цепочки. Считает градиенты, но не обновляет веса — это работа оптимизатора.Разбор: Обратное распространение ошибки
Обратный проходbackward pass
Проход от лосса к входам, на котором градиент каждого узла получается умножением входящего градиента на локальную производную. Стоит примерно как два прямых прохода.Разбор: Обратное распространение ошибки
Обрезка градиентовgradient clipping
Масштабирование градиента вниз, если его норма превышает порог: один аномальный батч не сможет разнести веса. Стандартная практика для рекуррентных сетей и LLM.Разбор: Практика обучения: батчи, dropout, batchnorm
Перцептронperceptron
Один нейрон с пороговой активацией — простейший линейный классификатор. Проводит гиперплоскость в пространстве признаков и потому решает только линейно разделимые задачи.Разбор: От нейрона к многослойному перцептрону
Правило цепочкиchain rule
Правило дифференцирования сложной функции: чувствительности перемножаются по цепочке зависимостей. Математическая основа обратного распространения ошибки.Разбор: Обратное распространение ошибки
Прогревwarmup
Начальный этап обучения, когда learning rate линейно растёт от нуля. Защищает хрупкую свежеинициализированную модель от разноса, пока статистики моментов оптимизатора не накопились.Разбор: Оптимизаторы: SGD, Momentum, Adam
Прямой проходforward pass
Вычисление выхода сети от входа к лоссу с сохранением промежуточных активаций — они понадобятся на обратном проходе для подсчёта локальных производных.Разбор: Обратное распространение ошибки
Разделяемые весаweight sharing
Использование одного и того же ядра во всех позициях изображения: признак детектируется где угодно одними весами, а параметров нужно в тысячи раз меньше, чем полносвязному слою.Разбор: Свёрточные сети (CNN)
Расписание скорости обученияlearning rate schedule
План изменения learning rate по ходу обучения: типично линейный прогрев в начале и косинусное затухание к концу. Постоянный шаг почти никогда не оптимален.Разбор: Практика обучения: батчи, dropout, batchnorm
Рецептивное полеreceptive field
Область входного изображения, влияющая на данный нейрон. С глубиной сети растёт: верхние слои «видят» крупные фрагменты и собирают из простых признаков сложные.Разбор: Свёрточные сети (CNN)
Скрытое состояниеhidden state
Вектор фиксированного размера, в который RNN ужимает всю прочитанную историю и который обновляется на каждом шаге. Константная память — и сила, и бутылочное горлышко рекуррентных сетей.Разбор: Рекуррентные сети (RNN, LSTM)
Скрытый слойhidden layer
Слой нейронов между входом и выходом сети. Строит новые признаки из исходных, благодаря чему сеть решает линейно неразделимые задачи вроде XOR.Разбор: От нейрона к многослойному перцептрону
Сопоставление с шаблонамиtemplate matching
Интерпретация линейного классификатора картинок: веса каждого класса — картинка-шаблон, а предсказание — выбор шаблона, с которым вход дал наибольшее скалярное произведение.Разбор: Распознавание цифр из пикселей
Теорема об универсальной аппроксимацииuniversal approximation theorem
Утверждение, что MLP даже с одним достаточно широким скрытым слоем может приблизить любую непрерывную функцию. Не гарантирует ни разумный размер сети, ни то, что обучение найдёт нужные веса.Разбор: От нейрона к многослойному перцептрону
Функция активацииactivation function
Нелинейное преобразование выхода нейрона. Без активаций стопка линейных слоёв схлопывается в один линейный слой, а производная активации определяет, как течёт градиент при обучении.Разбор: Функции активации
Эпохаepoch
Один полный проход обучения по всем примерам датасета. Обучение обычно длится десятки эпох, а прогресс отслеживают по кривым ошибки на трейне и валидации.Разбор: Практика обучения: батчи, dropout, batchnorm
Ядро свёрткиconvolution kernel
Маленькая матрица весов (например, 3 на 3), скользящая по изображению и считающая скалярное произведение с каждым окном. Один обучаемый детектор признака, применяемый во всех позициях.Разбор: Свёрточные сети (CNN)
Ячейка памятиcell state
Отдельный «конвейер» памяти в LSTM, по которому информация течёт сквозь шаги почти без изменений и обновляется аддитивно — благодаря этому градиенты затухают куда медленнее.Разбор: Рекуррентные сети (RNN, LSTM)
Adamadaptive moment estimation
Оптимизатор, объединяющий momentum и RMSProp: ведёт скользящие средние градиента и его квадрата с поправкой смещения. Дефолтный выбор для большинства задач.Разбор: Оптимизаторы: SGD, Momentum, Adam
AdamWadam with decoupled weight decay
Adam с исправленным weight decay: штраф за большие веса применяется отдельным слагаемым, а не через градиент, где его исказила бы адаптивная нормировка. Стандарт обучения трансформеров.Разбор: Оптимизаторы: SGD, Momentum, Adam
BPTTbackpropagation through time
Обучение RNN через «развёртку» цепочки шагов в глубокую сеть с общими весами и обратное распространение по ней. Именно здесь градиенты затухают или взрываются с ростом длины последовательности.Разбор: Рекуррентные сети (RNN, LSTM)
CNNconvolutional neural network
Свёрточная нейросеть: архитектура для изображений, где маленькие ядра-детекторы скользят по картинке. Локальность и разделяемые веса дают экономию параметров и устойчивость к сдвигам.Разбор: Свёрточные сети (CNN)
Dropoutdropout
Регуляризация: при обучении каждый нейрон случайно выключается с заданной вероятностью, чтобы признаки стали избыточными. На инференсе выключен — отсюда различие режимов train и eval.Разбор: Практика обучения: батчи, dropout, batchnorm
GELUgaussian error linear unit
Гладкая версия ReLU, взвешивающая вход по функции нормального распределения. Вместе с SiLU — стандартная активация FFN-блоков современных трансформеров.Разбор: Функции активации
GRUgated recurrent unit
Упрощённая альтернатива LSTM с двумя вентилями вместо трёх и без отдельной ячейки памяти. Быстрее, а по качеству обычно сопоставима.Разбор: Рекуррентные сети (RNN, LSTM)
LSTMlong short-term memory
Рекуррентная архитектура с ячейкой памяти и тремя вентилями, управляющими записью, стиранием и чтением. Аддитивное обновление памяти позволяет градиенту течь на сотни шагов без затухания.Разбор: Рекуррентные сети (RNN, LSTM)
MNISTmodified national institute of standards and technology database
Классический датасет из 70 тысяч рукописных цифр 28 на 28 пикселей — «hello world» компьютерного зрения и стандартная песочница для отладки пайплайна обучения.Разбор: Распознавание цифр из пикселей
Momentummomentum
Приём оптимизации, накапливающий экспоненциальное скользящее среднее градиентов — «скорость». Гасит колебания поперёк оврага и разгоняет движение вдоль него.Разбор: Оптимизаторы: SGD, Momentum, Adam
ReLUrectified linear unit
Активация, возвращающая ноль для отрицательного входа и сам вход для положительного. С ней глубокие сети впервые стали стабильно обучаться, но нейроны могут «умирать» в нулевой зоне.Разбор: Функции активации
RMSProproot mean square propagation
Оптимизатор с адаптивным шагом: делит обновление на корень скользящего среднего квадратов градиента, выравнивая масштаб шага у параметров с разными по величине градиентами.Разбор: Оптимизаторы: SGD, Momentum, Adam
RNNrecurrent neural network
Рекуррентная сеть: обрабатывает последовательность шаг за шагом, храня «конспект» прочитанного в скрытом состоянии. Один и тот же слой с общими весами применяется на каждом шаге.Разбор: Рекуррентные сети (RNN, LSTM)
SSMstate space model
Модели пространства состояний (например, Mamba) — современные линейные рекуррентные сети: дешёвый пошаговый инференс как у RNN при параллельном обучении как у трансформера.Разбор: Рекуррентные сети (RNN, LSTM)