Диагностика Mock-интервью
Главная · Раздел

Нейронные сети

Нейронные сети от одного нейрона до свёрточных и рекуррентных архитектур: функции активации, обратное распространение ошибки, оптимизаторы, батчи, dropout и batchnorm.

8 тем, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.

1. От нейрона к многослойному перцептрону

Один искусственный нейрон умеет проводить только прямую линию. Но стоит поставить нейроны в несколько слоёв и добавить нелинейность — и получается конструктор, способный приблизить почти любую функцию. Это и есть переход от перцептрона к MLP.

На собеседовании спросят: «Почему перцептрон не решает XOR?»

2. Функции активации

Активация — та самая нелинейность между слоями, без которой нейросеть схлопывается в линейную модель. Выбор активации определяет, как течёт градиент, поэтому вопрос «sigmoid или ReLU и почему» — из числа обязательных на собеседовании.

На собеседовании спросят: «Чем плоха sigmoid в скрытых слоях?»

3. Обратное распространение ошибки

Backprop простыми словами: цепное правило, градиенты по весам за один проход и почему без него нет обучения нейросетей и LLM.

На собеседовании спросят: «Объясни backprop одним предложением»

4. Оптимизаторы: SGD, Momentum, Adam

Backprop выдал градиенты — но как именно делать шаг? От выбора оптимизатора зависит, будет модель учиться часами или неделями и сойдётся ли вообще. Разберём эволюцию: SGD → Momentum → RMSProp → Adam → AdamW.

На собеседовании спросят: «Чем Adam отличается от SGD с momentum?»

5. Практика обучения: батчи, dropout, batchnorm

Формулу градиентного спуска знают все, но сети «не учатся» по десятку прозаичных причин: не тот learning rate, забытый warmup, нулевая инициализация. Эта тема — про инженерную кухню обучения и про то, как ставить диагноз по кривым loss.

На собеседовании спросят: «Почему нельзя инициализировать веса нулями?»

6. Распознавание цифр из пикселей

MNIST — «hello world» компьютерного зрения: 70 000 рукописных цифр 28×28. На этой задаче проще всего понять, как картинка превращается в вектор чисел, а классификатор — в набор «шаблонов», которые можно буквально увидеть.

На собеседовании спросят: «Сколько параметров у линейного классификатора MNIST?»

7. Свёрточные сети (CNN)

Свёрточные нейросети (convolutional neural networks, CNN) десятилетие правили компьютерным зрением — и до сих пор их идеи (локальность, разделяемые веса, иерархия признаков) обязательны к пониманию, даже если сегодня вы обучаете трансформеры.

На собеседовании спросят: «Посчитайте параметры свёрточного слоя»

8. Рекуррентные сети (RNN, LSTM)

До эпохи трансформеров последовательности — текст, речь, временные ряды — обрабатывали рекуррентные сети (recurrent neural networks, RNN). Их главная идея, «память в скрытом состоянии», жива до сих пор: без неё не понять ни LSTM на легаси-проде, ни современные state space models.

На собеседовании спросят: «Напишите формулу шага RNN»