<?xml version="1.0" encoding="utf-8"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ru">
<title>ml-book.com — новые и обновлённые темы</title>
<subtitle>Интерактивный учебник по машинному обучению и LLM</subtitle>
<link href="https://ml-book.com/feed.xml" rel="self"/>
<link href="https://ml-book.com/"/>
<id>https://ml-book.com/</id>
<updated>2026-09-16T00:00:00Z</updated>
<author><name>ml-book.com</name><uri>https://ml-book.com/about/</uri></author>
<entry>
<title>Выборка, ЦПТ и стандартная ошибка</title>
<link href="https://ml-book.com/t/sampling-clt/"/>
<id>https://ml-book.com/t/sampling-clt/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-09-16T00:00:00Z</published>
<category term="Статистика для ML"/>
<summary>Почему средние по выборкам ложатся в колокол: центральная предельная теорема, стандартная ошибка σ/√n и правило 68–95–99.7 — с симулятором, где выборки набираются на глазах.</summary>
</entry>
<entry>
<title>Доверительные интервалы</title>
<link href="https://ml-book.com/t/confidence-intervals/"/>
<id>https://ml-book.com/t/confidence-intervals/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-09-16T00:00:00Z</published>
<category term="Статистика для ML"/>
<summary>Доверительный интервал — честный ответ вместо точечной оценки: формула x̄ ± t·s/√n, что на самом деле значат «95 %», интервалы для долей и бутстреп, симуляция ста интервалов и калькулятор.</summary>
</entry>
<entry>
<title>P-value и проверка гипотез</title>
<link href="https://ml-book.com/t/p-value/"/>
<id>https://ml-book.com/t/p-value/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-09-16T00:00:00Z</published>
<category term="Статистика для ML"/>
<summary>P-value простыми словами: нулевая гипотеза, уровень значимости 0,05, ошибки I и II рода, одно- и двусторонние тесты — и почему p = 0,03 не значит «эффект есть с вероятностью 97 %». С интерактивом.</summary>
</entry>
<entry>
<title>Bias–variance: разложение ошибки</title>
<link href="https://ml-book.com/t/bias-variance/"/>
<id>https://ml-book.com/t/bias-variance/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-09T00:00:00Z</published>
<category term="Основы машинного обучения"/>
<summary>Bias–variance tradeoff простыми словами: смещение, разброс, шум; почему простые модели недообучаются, а сложные переобучаются.</summary>
</entry>
<entry>
<title>Кросс-валидация и подбор гиперпараметров</title>
<link href="https://ml-book.com/t/cross-validation-tuning/"/>
<id>https://ml-book.com/t/cross-validation-tuning/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-09T00:00:00Z</published>
<category term="Основы машинного обучения"/>
<summary>Кросс-валидация (k-fold, nested CV) и подбор гиперпараметров: grid vs random search — как не завысить метрику на собеседовании.</summary>
</entry>
<entry>
<title>SVM и kernel trick</title>
<link href="https://ml-book.com/t/svm-kernels/"/>
<id>https://ml-book.com/t/svm-kernels/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-07T00:00:00Z</published>
<category term="Основы машинного обучения"/>
<summary>SVM (метод опорных векторов) — классификатор максимального зазора: границу определяют только опорные векторы, а kernel trick разделяет линейно неразделимое. Разбираем margin, параметры C и gamma, RBF-ядро — вечную классику собеседований.</summary>
</entry>
<entry>
<title>Reasoning-модели и test-time compute</title>
<link href="https://ml-book.com/t/reasoning-models/"/>
<id>https://ml-book.com/t/reasoning-models/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-07T00:00:00Z</published>
<category term="LLM: обучение и инференс"/>
<summary>Точность LLM можно масштабировать не только данными и параметрами, но и вычислениями на инференсе: reasoning-модели (o1, DeepSeek R1, Claude с extended thinking) учатся «думать» перед ответом через RL с проверяемыми наградами. Разбираем chain-of-thought, thinking-бюджет и когда всё это окупается.</summary>
</entry>
<entry>
<title>OCR: от классики до распознавания через LLM</title>
<link href="https://ml-book.com/t/ocr/"/>
<id>https://ml-book.com/t/ocr/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-07T00:00:00Z</published>
<category term="Мультимодальные модели"/>
<summary>Как из пикселей получить текст: классический OCR-пайплайн (бинаризация, сегментация, распознавание символов), современный DL-OCR с CRNN и CTC, и чтение документов мультимодальными LLM — с их главным риском, галлюцинациями.</summary>
</entry>
<entry>
<title>VAE и GAN: генерация до диффузии</title>
<link href="https://ml-book.com/t/vae-gan/"/>
<id>https://ml-book.com/t/vae-gan/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-07T00:00:00Z</published>
<category term="Мультимодальные модели"/>
<summary>До диффузии картинки генерировали VAE и GAN: вариационный автоэнкодер учит гладкое латентное пространство, из которого можно сэмплировать, а GAN устраивает состязание генератора с дискриминатором. Оба живы: VAE — внутри Stable Diffusion, GAN — в апскейлерах.</summary>
</entry>
<entry>
<title>MCP: стандарт подключения инструментов</title>
<link href="https://ml-book.com/t/mcp/"/>
<id>https://ml-book.com/t/mcp/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-07T00:00:00Z</published>
<category term="Агенты и инструменты"/>
<summary>MCP (Model Context Protocol) — открытый стандарт, который соединяет LLM-приложения с инструментами и источниками данных: вместо N×M самодельных интеграций — N+M подключений к общему протоколу. Разбираем роли, жизненный цикл, JSON-RPC и риски чужих серверов.</summary>
</entry>
<entry>
<title>Векторные базы данных и их типы</title>
<link href="https://ml-book.com/t/vector-databases/"/>
<id>https://ml-book.com/t/vector-databases/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-07T00:00:00Z</published>
<category term="RAG: поиск + генерация"/>
<summary>Векторные БД: managed vs self-hosted, метаданные и фильтры, когда хватит pgvector — выбор хранилища на AI-собеседовании.</summary>
</entry>
<entry>
<title>MMR и разнообразие выдачи</title>
<link href="https://ml-book.com/t/mmr-diversity/"/>
<id>https://ml-book.com/t/mmr-diversity/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-07T00:00:00Z</published>
<category term="RAG: поиск + генерация"/>
<summary>MMR в RAG: баланс релевантности и новизны (λ), зачем убирать дубликаты из топ-k и как объяснить на собеседовании.</summary>
</entry>
<entry>
<title>Эмбеддинг-модели: как их обучают</title>
<link href="https://ml-book.com/t/embedding-models/"/>
<id>https://ml-book.com/t/embedding-models/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-07T00:00:00Z</published>
<category term="RAG: поиск + генерация"/>
<summary>Эмбеддинг-модели для поиска: InfoNCE, hard negatives, query/passage префиксы и matryoshka — база для RAG-интервью.</summary>
</entry>
<entry>
<title>Линейная регрессия</title>
<link href="https://ml-book.com/t/linear-regression/"/>
<id>https://ml-book.com/t/linear-regression/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Основы машинного обучения"/>
<summary>Линейная регрессия простыми словами: MSE, нормальное уравнение, градиентный спуск и типичные вопросы ML-собеседования с интерактивом.</summary>
</entry>
<entry>
<title>Градиентный спуск</title>
<link href="https://ml-book.com/t/gradient-descent/"/>
<id>https://ml-book.com/t/gradient-descent/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Основы машинного обучения"/>
<summary>Градиентный спуск для собеседования: шаг, learning rate, локальные минимумы, batch/SGD и почему алгоритм обучает от регрессии до нейросетей.</summary>
</entry>
<entry>
<title>Логистическая регрессия и классификация</title>
<link href="https://ml-book.com/t/logistic-regression/"/>
<id>https://ml-book.com/t/logistic-regression/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Основы машинного обучения"/>
<summary>Логистическая регрессия и классификация: сигмоида, кросс-энтропия, решающая граница и разбор типичных вопросов на ML-интервью.</summary>
</entry>
<entry>
<title>Переобучение и регуляризация</title>
<link href="https://ml-book.com/t/overfitting-regularization/"/>
<id>https://ml-book.com/t/overfitting-regularization/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Основы машинного обучения"/>
<summary>Переобучение и регуляризация: train/val кривые, L1/L2, dropout, early stopping — как диагностировать и что отвечать на собеседовании.</summary>
</entry>
<entry>
<title>Метрики качества</title>
<link href="https://ml-book.com/t/metrics/"/>
<id>https://ml-book.com/t/metrics/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Основы машинного обучения"/>
<summary>Метрики качества модели: accuracy vs precision/recall, F1, ROC-AUC, когда какая нужна и как не обмануть себя на собеседовании.</summary>
</entry>
<entry>
<title>Деревья решений и ансамбли</title>
<link href="https://ml-book.com/t/trees-ensembles/"/>
<id>https://ml-book.com/t/trees-ensembles/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Основы машинного обучения"/>
<summary>Деревья решений и ансамбли: RF vs градиентный бустинг, overfitting деревьев и что спрашивают про табличные модели на собеседовании.</summary>
</entry>
<entry>
<title>Обратное распространение ошибки</title>
<link href="https://ml-book.com/t/backprop/"/>
<id>https://ml-book.com/t/backprop/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Нейронные сети"/>
<summary>Backprop простыми словами: цепное правило, градиенты по весам за один проход и почему без него нет обучения нейросетей и LLM.</summary>
</entry>
<entry>
<title>Токенизация и BPE</title>
<link href="https://ml-book.com/t/tokenization/"/>
<id>https://ml-book.com/t/tokenization/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Языковые модели: от n-грамм до трансформера"/>
<summary>Токенизация и BPE в LLM: почему модель видит номера, как это бьёт по цене/контексту и типичные вопросы про токенизаторы.</summary>
</entry>
<entry>
<title>Эмбеддинги и word2vec</title>
<link href="https://ml-book.com/t/embeddings/"/>
<id>https://ml-book.com/t/embeddings/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Языковые модели: от n-грамм до трансформера"/>
<summary>Эмбеддинги слов и текстов: word2vec, семантическая близость, роль в RAG и трансформерах — база для поиска и LLM-собеседований.</summary>
</entry>
<entry>
<title>Механизм внимания (attention)</title>
<link href="https://ml-book.com/t/attention/"/>
<id>https://ml-book.com/t/attention/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Языковые модели: от n-грамм до трансформера"/>
<summary>Механизм внимания (attention): query, key, value, self-attention и почему идея лежит в основе GPT и современных LLM.</summary>
</entry>
<entry>
<title>Архитектура трансформера</title>
<link href="https://ml-book.com/t/transformer/"/>
<id>https://ml-book.com/t/transformer/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Языковые модели: от n-грамм до трансформера"/>
<summary>Архитектура трансформера: эмбеддинги, positional encoding, multi-head attention, MLP-блоки и путь токена до следующего слова.</summary>
</entry>
<entry>
<title>Современные архитектуры: RoPE, MoE, GQA</title>
<link href="https://ml-book.com/t/modern-architectures/"/>
<id>https://ml-book.com/t/modern-architectures/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Языковые модели: от n-грамм до трансформера"/>
<summary>RoPE, GQA и Mixture-of-Experts: как современные LLM (Llama, Mixtral, DeepSeek) улучшили классический трансформер — и что спрашивают на собеседовании.</summary>
</entry>
<entry>
<title>Претрейнинг и scaling laws</title>
<link href="https://ml-book.com/t/pretraining/"/>
<id>https://ml-book.com/t/pretraining/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="LLM: обучение и инференс"/>
<summary>Претрейнинг и scaling laws: как из токенов интернета получается base model и почему размер считают по формуле, а не наугад.</summary>
</entry>
<entry>
<title>Fine-tuning: SFT, LoRA, PEFT</title>
<link href="https://ml-book.com/t/finetuning/"/>
<id>https://ml-book.com/t/finetuning/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="LLM: обучение и инференс"/>
<summary>Fine-tuning LLM: когда нужен SFT, чем LoRA/PEFT дешевле полного файнтюна и что ожидают услышать на собеседовании AI-инженера.</summary>
</entry>
<entry>
<title>Alignment: RLHF и DPO</title>
<link href="https://ml-book.com/t/alignment/"/>
<id>https://ml-book.com/t/alignment/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="LLM: обучение и инференс"/>
<summary>Alignment LLM: RLHF, reward model и DPO — как из base model делают полезного ассистента и что спрашивают на собеседовании.</summary>
</entry>
<entry>
<title>Сэмплирование: temperature, top-k, top-p</title>
<link href="https://ml-book.com/t/sampling/"/>
<id>https://ml-book.com/t/sampling/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="LLM: обучение и инференс"/>
<summary>Сэмплирование в LLM: temperature, top-k и top-p — как из распределения выбрать токен. От этого зависит стиль текста; частый вопрос на собеседовании.</summary>
</entry>
<entry>
<title>Инференс: KV-cache, квантизация, спекулятивный декодинг</title>
<link href="https://ml-book.com/t/inference/"/>
<id>https://ml-book.com/t/inference/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="LLM: обучение и инференс"/>
<summary>Инференс LLM: KV-cache, квантизация и speculative decoding — куда уходит VRAM и как ускоряют генерацию токенов в проде.</summary>
</entry>
<entry>
<title>Оценка LLM: бенчмарки и LLM-as-judge</title>
<link href="https://ml-book.com/t/llm-evals/"/>
<id>https://ml-book.com/t/llm-evals/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="LLM: обучение и инференс"/>
<summary>У задачи «напиши письмо клиенту» нет единственного правильного ответа — поэтому оценивать LLM сложнее, чем классификатор. Разбираем бенчмарки и их болезни, арены с Elo, LLM-судей с их предвзятостями и то, как строить eval под собственный продукт.</summary>
</entry>
<entry>
<title>Tool calling: как модель вызывает инструменты</title>
<link href="https://ml-book.com/t/tool-calling/"/>
<id>https://ml-book.com/t/tool-calling/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Агенты и инструменты"/>
<summary>Tool calling даёт LLM «руки»: вызов API, БД и инструментов в агентном цикле. Фундамент AI-агентов и частый вопрос на собеседовании инженера.</summary>
</entry>
<entry>
<title>Что такое RAG и зачем он нужен</title>
<link href="https://ml-book.com/t/rag-basics/"/>
<id>https://ml-book.com/t/rag-basics/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="RAG: поиск + генерация"/>
<summary>Что такое RAG: поиск по документам + генерация LLM, зачем нужен в проде, схема пайплайна и базовые вопросы на интервью AI-инженера.</summary>
</entry>
<entry>
<title>Векторный поиск и ANN-индексы</title>
<link href="https://ml-book.com/t/vector-search/"/>
<id>https://ml-book.com/t/vector-search/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="RAG: поиск + генерация"/>
<summary>Векторный поиск для RAG: brute-force vs ANN (HNSW, IVF), trade-off recall/latency и типичные вопросы на AI-собеседовании.</summary>
</entry>
<entry>
<title>Чанкинг и подготовка данных</title>
<link href="https://ml-book.com/t/chunking/"/>
<id>https://ml-book.com/t/chunking/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="RAG: поиск + генерация"/>
<summary>Чанкинг в RAG: размер окна, overlap, рекурсивная нарезка — как границы чанков бьют по качеству поиска на собеседовании.</summary>
</entry>
<entry>
<title>Гибридный поиск и реранкинг</title>
<link href="https://ml-book.com/t/hybrid-rerank/"/>
<id>https://ml-book.com/t/hybrid-rerank/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="RAG: поиск + генерация"/>
<summary>Гибридный поиск и реранкинг: BM25 + векторы, fusion и cross-encoder — прод-рецепт RAG и вопросы на интервью.</summary>
</entry>
<entry>
<title>Оценка качества RAG</title>
<link href="https://ml-book.com/t/rag-eval/"/>
<id>https://ml-book.com/t/rag-eval/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="RAG: поиск + генерация"/>
<summary>Оценка RAG: метрики ретривера и генератора по отдельности, faithfulness, context precision — что мерить на собеседовании.</summary>
</entry>
<entry>
<title>Дизайн ML-систем на собеседовании</title>
<link href="https://ml-book.com/t/ml-system-design/"/>
<id>https://ml-book.com/t/ml-system-design/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Продакшн и качество"/>
<summary>Дизайн ML-систем на интервью: от метрики продукта до данных, модели, сервиса и мониторинга — каркас ответа без лишней теории.</summary>
</entry>
<entry>
<title>Мониторинг и дрифт данных</title>
<link href="https://ml-book.com/t/monitoring-drift/"/>
<id>https://ml-book.com/t/monitoring-drift/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Продакшн и качество"/>
<summary>Мониторинг и дрифт данных: data/concept drift, PSI, алерты и когда модель в проде нужно переобучать.</summary>
</entry>
<entry>
<title>A/B-тесты и продуктовые метрики</title>
<link href="https://ml-book.com/t/ab-testing/"/>
<id>https://ml-book.com/t/ab-testing/</id>
<updated>2026-09-16T00:00:00Z</updated>
<published>2026-07-04T00:00:00Z</published>
<category term="Продакшн и качество"/>
<summary>Оффлайн-метрики выросли — но выиграет ли от этого продукт? Единственный честный способ узнать — контролируемый эксперимент на живых пользователях. Здесь — как его спроектировать и не обмануть самого себя статистикой.</summary>
</entry>
</feed>
