Нейронные сети
Нейронные сети от одного нейрона до свёрточных и рекуррентных архитектур: функции активации, обратное распространение ошибки, оптимизаторы, батчи, dropout и batchnorm.
8 тем, читаются сверху вниз — от простого к сложному. У каждой темы есть интерактив, плашка «На собеседовании» и тест из 10–15 вопросов. Проверить себя по всему учебнику можно в диагностике, термины раздела собраны в глоссарии.
1. От нейрона к многослойному перцептрону
Один искусственный нейрон умеет проводить только прямую линию. Но стоит поставить нейроны в несколько слоёв и добавить нелинейность — и получается конструктор, способный приблизить почти любую функцию. Это и есть переход от перцептрона к MLP.
На собеседовании спросят: «Почему перцептрон не решает XOR?»
2. Функции активации
Активация — та самая нелинейность между слоями, без которой нейросеть схлопывается в линейную модель. Выбор активации определяет, как течёт градиент, поэтому вопрос «sigmoid или ReLU и почему» — из числа обязательных на собеседовании.
На собеседовании спросят: «Чем плоха sigmoid в скрытых слоях?»
3. Обратное распространение ошибки
Backprop простыми словами: цепное правило, градиенты по весам за один проход и почему без него нет обучения нейросетей и LLM.
На собеседовании спросят: «Объясни backprop одним предложением»
4. Оптимизаторы: SGD, Momentum, Adam
Backprop выдал градиенты — но как именно делать шаг? От выбора оптимизатора зависит, будет модель учиться часами или неделями и сойдётся ли вообще. Разберём эволюцию: SGD → Momentum → RMSProp → Adam → AdamW.
На собеседовании спросят: «Чем Adam отличается от SGD с momentum?»
5. Практика обучения: батчи, dropout, batchnorm
Формулу градиентного спуска знают все, но сети «не учатся» по десятку прозаичных причин: не тот learning rate, забытый warmup, нулевая инициализация. Эта тема — про инженерную кухню обучения и про то, как ставить диагноз по кривым loss.
На собеседовании спросят: «Почему нельзя инициализировать веса нулями?»
6. Распознавание цифр из пикселей
MNIST — «hello world» компьютерного зрения: 70 000 рукописных цифр 28×28. На этой задаче проще всего понять, как картинка превращается в вектор чисел, а классификатор — в набор «шаблонов», которые можно буквально увидеть.
На собеседовании спросят: «Сколько параметров у линейного классификатора MNIST?»
7. Свёрточные сети (CNN)
Свёрточные нейросети (convolutional neural networks, CNN) десятилетие правили компьютерным зрением — и до сих пор их идеи (локальность, разделяемые веса, иерархия признаков) обязательны к пониманию, даже если сегодня вы обучаете трансформеры.
На собеседовании спросят: «Посчитайте параметры свёрточного слоя»
8. Рекуррентные сети (RNN, LSTM)
До эпохи трансформеров последовательности — текст, речь, временные ряды — обрабатывали рекуррентные сети (recurrent neural networks, RNN). Их главная идея, «память в скрытом состоянии», жива до сих пор: без неё не понять ни LSTM на легаси-проде, ни современные state space models.
На собеседовании спросят: «Напишите формулу шага RNN»