Глоссарий: Агенты и инструменты
32 термина раздела «Агенты и инструменты» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.
- Агентagent
- LLM, запущенная в цикле «думай — действуй — наблюдай»: модель сама решает, какие шаги нужны и сколько их будет, вызывая инструменты до достижения цели. В отличие от пайплайна, последовательность шагов не задана заранее.Разбор: Агентный цикл и критерий остановки
- Верификация результата агентаverification
- Внешняя проверка после «готово»: запуск тестов, компиляция, валидация схемы или модель-критик. Превращает мнение агента об успехе в наблюдаемый факт и резко поднимает надёжность.Разбор: Агентный цикл и критерий остановки
- Галлюцинация инструментаtool hallucination
- Ситуация, когда модель вызывает инструмент, которого нет в списке доступных. Правильная реакция кода — вернуть модели сообщение об ошибке с перечнем доступных инструментов, а не исполнять «похожий».Разбор: Tool calling: как модель вызывает инструменты
- Динамическое обнаружениеdynamic discovery
- Свойство MCP: клиент запрашивает у сервера список инструментов в рантайме и узнаёт о новых тулах без перекомпиляции и правок кода приложения.Разбор: MCP: стандарт подключения инструментов
- Компакцияcompaction
- Сжатие старой истории агента в короткое резюме: многословные результаты инструментов заменяются парой фраз с сутью. Освобождает контекстное окно, сохраняя ключевые факты.Разбор: Память, планирование и мультиагентные системы
- Компаундинг ошибокerror compounding
- Накопление ошибок в многошаговой траектории агента: даже при 95% успеха на каждом шаге задача из 20 шагов доходит до конца лишь примерно в трети случаев. Лечится верификацией и короткими подзадачами.Разбор: Агентный цикл и критерий остановки
- Критерий остановкиstopping criterion
- Правило завершения агентного цикла: ответ модели без вызова инструмента, проверяемое условие успеха, лимит итераций или детекция зацикливания. Внешняя проверка надёжнее самооценки модели.Разбор: Агентный цикл и критерий остановки
- Оркестраторorchestrator
- Главный агент мультиагентной системы: декомпозирует задачу, раздаёт подзадачи субагентам и собирает их короткие результаты, не засоряя свой контекст деталями их работы.Разбор: Память, планирование и мультиагентные системы
- Параллельные вызовы инструментовparallel tool calls
- Способность модели вернуть в одном ответе сразу несколько вызовов инструментов, чтобы код исполнил их одновременно — например, запросить погоду в двух городах за один шаг.Разбор: Tool calling: как модель вызывает инструменты
- Песочницаsandbox
- Изолированное воспроизводимое окружение с фиксированным начальным состоянием, в котором прогоняют агента. Без неё оценка «флакает»: внешний мир меняется, и метрики прыгают без изменений в агенте.Разбор: Оценка агентов: pass@k и траектории
- Рабочая память агентаworking memory
- Контекстное окно агента, куда попадает всё: системный промпт, план, вызовы инструментов и их результаты. Она конечна, а качество использования деградирует ещё до переполнения.Разбор: Память, планирование и мультиагентные системы
- Риск цепочки поставокsupply chain risk
- Угроза от стороннего MCP-сервера: это чужой код с реальными полномочиями, который может красть данные или подменять описания инструментов. Лечится доверенными источниками и наименьшими привилегиями.Разбор: MCP: стандарт подключения инструментов
- Субагентsubagent
- Агент с собственным чистым контекстом, которому делегируют подзадачу. Может прочитать десятки файлов и перебрать гипотезы — весь шум останется у него, наверх вернётся только результат.Разбор: Память, планирование и мультиагентные системы
- Траекторияtrajectory
- Полная последовательность «мысль — действие — наблюдение» за один прогон агента. Главный материал для отладки: читают её целиком, а не только финальный ответ.Разбор: Агентный цикл и критерий остановки
- Успех задачиtask success
- Автоматически проверяемый исход прогона агента: тесты прошли, файл создан, ответ совпал с эталоном. Фундамент оценки агентов — внешняя проверка вместо мнения модели.Разбор: Оценка агентов: pass@k и траектории
- Хостhost
- Приложение с LLM внутри — чат, IDE, ассистент. Внутри хоста живёт MCP-клиент, который держит соединение с MCP-серверами и получает от них инструменты, ресурсы и промпты.Разбор: MCP: стандарт подключения инструментов
- Constrained decodingconstrained decoding
- Генерация с маскированием токенов, нарушающих заданную грамматику или схему. Так модель гарантированно выдаёт синтаксически валидный формат, например JSON для вызова инструмента.Разбор: Tool calling: как модель вызывает инструменты · Промпт-паттерны и structured outputs
- JSON-схема инструментаjson schema
- Формальное описание параметров инструмента: имена аргументов, их типы и обязательность. По ней модель заполняет вызов, а код приложения валидирует аргументы перед исполнением.Разбор: Tool calling: как модель вызывает инструменты
- JSON-RPCjson-rpc 2.0
- Формат сообщений протокола MCP: запросы вида «метод плюс параметры» поверх stdio для локальных серверов или HTTP/SSE для удалённых.Разбор: MCP: стандарт подключения инструментов
- Lost in the middlelost in the middle
- Эффект, при котором модель хуже использует информацию из середины длинного контекста, чем из его начала и конца. Поэтому «напихать всё в окно» — не стратегия управления памятью.Разбор: Память, планирование и мультиагентные системы · Работа с контекстом и разметка сообщений
- MCPmodel context protocol
- Открытый стандарт подключения LLM-приложений к инструментам и источникам данных: вместо N×M самодельных интеграций — N+M подключений к общему протоколу. Опубликован Anthropic в конце 2024 года.Разбор: MCP: стандарт подключения инструментов
- MCP-серверmcp server
- Обёртка над источником возможностей — файловой системой, базой данных, браузером, — которая описывает свои инструменты по стандарту MCP. Любой совместимый клиент может ими пользоваться.Разбор: MCP: стандарт подключения инструментов
- Milestone-оценкаmilestone evaluation
- Частичный зачёт по чекпоинтам траектории: «нашёл нужный файл», «воспроизвёл баг», «написал фикс». На сложных задачах различает «почти решил» и «не понял задачу».Разбор: Оценка агентов: pass@k и траектории
- pass@1pass at 1
- Доля задач, решённых агентом с первой попытки. Метрика пользовательского опыта: именно её видит человек, запустивший агента один раз.Разбор: Оценка агентов: pass@k и траектории
- pass@kpass at k
- Доля задач, решённых агентом хотя бы раз из k попыток. Показывает потолок способностей: решение в принципе достижимо, но не гарантировано в каждом прогоне.Разбор: Оценка агентов: pass@k и траектории
- pass^kpass hat k
- Доля задач, решённых агентом во всех k прогонах подряд. Метрика надёжности для продакшна: агент, которому можно доверять без присмотра.Разбор: Оценка агентов: pass@k и траектории
- ReActreasoning and acting
- Классическая формулировка агентного цикла: модель чередует рассуждение и действие — думает, вызывает инструмент, наблюдает результат и рассуждает снова.Разбор: Агентный цикл и критерий остановки
- Reward hackingreward hacking
- Агент формально проходит проверку, взломав её: находит ответ в файлах тестов, ослабляет проверку или подгоняет вывод под грейдер. Подозрительно резкий рост метрики — повод читать траектории.Разбор: Оценка агентов: pass@k и траектории · Alignment: RLHF и DPO
- Scratchpadscratchpad
- Внешний файл-блокнот агента для находок, решений и списка дел. Живёт вне контекстного окна, поэтому переживает компакцию и переполнение — это долговременная память агента.Разбор: Память, планирование и мультиагентные системы
- Structured outputstructured output, json mode
- Режим, в котором модель принуждают выдавать строго валидный JSON по заданной схеме, без последующего исполнения. Tool calling — та же механика плюс цикл «вызов — исполнение — результат».Разбор: Tool calling: как модель вызывает инструменты
- SWE-benchswe-bench
- Бенчмарк агентов на реальных issue из GitHub-репозиториев: агент должен написать патч, успех проверяется скрытыми тестами.Разбор: Оценка агентов: pass@k и траектории
- Tool callingtool calling
- Механизм, при котором LLM генерирует структурированный JSON-запрос на вызов внешней функции, а код приложения исполняет его и возвращает результат в контекст. Сама модель ничего не исполняет — только «просит».Разбор: Tool calling: как модель вызывает инструменты