Диагностика Mock-интервью
Главная · Глоссарий · Агенты и инструменты

Глоссарий: Агенты и инструменты

32 термина раздела «Агенты и инструменты» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.

Агентagent
LLM, запущенная в цикле «думай — действуй — наблюдай»: модель сама решает, какие шаги нужны и сколько их будет, вызывая инструменты до достижения цели. В отличие от пайплайна, последовательность шагов не задана заранее.Разбор: Агентный цикл и критерий остановки
Верификация результата агентаverification
Внешняя проверка после «готово»: запуск тестов, компиляция, валидация схемы или модель-критик. Превращает мнение агента об успехе в наблюдаемый факт и резко поднимает надёжность.Разбор: Агентный цикл и критерий остановки
Галлюцинация инструментаtool hallucination
Ситуация, когда модель вызывает инструмент, которого нет в списке доступных. Правильная реакция кода — вернуть модели сообщение об ошибке с перечнем доступных инструментов, а не исполнять «похожий».Разбор: Tool calling: как модель вызывает инструменты
Динамическое обнаружениеdynamic discovery
Свойство MCP: клиент запрашивает у сервера список инструментов в рантайме и узнаёт о новых тулах без перекомпиляции и правок кода приложения.Разбор: MCP: стандарт подключения инструментов
Компакцияcompaction
Сжатие старой истории агента в короткое резюме: многословные результаты инструментов заменяются парой фраз с сутью. Освобождает контекстное окно, сохраняя ключевые факты.Разбор: Память, планирование и мультиагентные системы
Компаундинг ошибокerror compounding
Накопление ошибок в многошаговой траектории агента: даже при 95% успеха на каждом шаге задача из 20 шагов доходит до конца лишь примерно в трети случаев. Лечится верификацией и короткими подзадачами.Разбор: Агентный цикл и критерий остановки
Критерий остановкиstopping criterion
Правило завершения агентного цикла: ответ модели без вызова инструмента, проверяемое условие успеха, лимит итераций или детекция зацикливания. Внешняя проверка надёжнее самооценки модели.Разбор: Агентный цикл и критерий остановки
Оркестраторorchestrator
Главный агент мультиагентной системы: декомпозирует задачу, раздаёт подзадачи субагентам и собирает их короткие результаты, не засоряя свой контекст деталями их работы.Разбор: Память, планирование и мультиагентные системы
Параллельные вызовы инструментовparallel tool calls
Способность модели вернуть в одном ответе сразу несколько вызовов инструментов, чтобы код исполнил их одновременно — например, запросить погоду в двух городах за один шаг.Разбор: Tool calling: как модель вызывает инструменты
Песочницаsandbox
Изолированное воспроизводимое окружение с фиксированным начальным состоянием, в котором прогоняют агента. Без неё оценка «флакает»: внешний мир меняется, и метрики прыгают без изменений в агенте.Разбор: Оценка агентов: pass@k и траектории
Рабочая память агентаworking memory
Контекстное окно агента, куда попадает всё: системный промпт, план, вызовы инструментов и их результаты. Она конечна, а качество использования деградирует ещё до переполнения.Разбор: Память, планирование и мультиагентные системы
Риск цепочки поставокsupply chain risk
Угроза от стороннего MCP-сервера: это чужой код с реальными полномочиями, который может красть данные или подменять описания инструментов. Лечится доверенными источниками и наименьшими привилегиями.Разбор: MCP: стандарт подключения инструментов
Субагентsubagent
Агент с собственным чистым контекстом, которому делегируют подзадачу. Может прочитать десятки файлов и перебрать гипотезы — весь шум останется у него, наверх вернётся только результат.Разбор: Память, планирование и мультиагентные системы
Траекторияtrajectory
Полная последовательность «мысль — действие — наблюдение» за один прогон агента. Главный материал для отладки: читают её целиком, а не только финальный ответ.Разбор: Агентный цикл и критерий остановки
Успех задачиtask success
Автоматически проверяемый исход прогона агента: тесты прошли, файл создан, ответ совпал с эталоном. Фундамент оценки агентов — внешняя проверка вместо мнения модели.Разбор: Оценка агентов: pass@k и траектории
Хостhost
Приложение с LLM внутри — чат, IDE, ассистент. Внутри хоста живёт MCP-клиент, который держит соединение с MCP-серверами и получает от них инструменты, ресурсы и промпты.Разбор: MCP: стандарт подключения инструментов
Constrained decodingconstrained decoding
Генерация с маскированием токенов, нарушающих заданную грамматику или схему. Так модель гарантированно выдаёт синтаксически валидный формат, например JSON для вызова инструмента.Разбор: Tool calling: как модель вызывает инструменты · Промпт-паттерны и structured outputs
JSON-схема инструментаjson schema
Формальное описание параметров инструмента: имена аргументов, их типы и обязательность. По ней модель заполняет вызов, а код приложения валидирует аргументы перед исполнением.Разбор: Tool calling: как модель вызывает инструменты
JSON-RPCjson-rpc 2.0
Формат сообщений протокола MCP: запросы вида «метод плюс параметры» поверх stdio для локальных серверов или HTTP/SSE для удалённых.Разбор: MCP: стандарт подключения инструментов
Lost in the middlelost in the middle
Эффект, при котором модель хуже использует информацию из середины длинного контекста, чем из его начала и конца. Поэтому «напихать всё в окно» — не стратегия управления памятью.Разбор: Память, планирование и мультиагентные системы · Работа с контекстом и разметка сообщений
MCPmodel context protocol
Открытый стандарт подключения LLM-приложений к инструментам и источникам данных: вместо N×M самодельных интеграций — N+M подключений к общему протоколу. Опубликован Anthropic в конце 2024 года.Разбор: MCP: стандарт подключения инструментов
MCP-серверmcp server
Обёртка над источником возможностей — файловой системой, базой данных, браузером, — которая описывает свои инструменты по стандарту MCP. Любой совместимый клиент может ими пользоваться.Разбор: MCP: стандарт подключения инструментов
Milestone-оценкаmilestone evaluation
Частичный зачёт по чекпоинтам траектории: «нашёл нужный файл», «воспроизвёл баг», «написал фикс». На сложных задачах различает «почти решил» и «не понял задачу».Разбор: Оценка агентов: pass@k и траектории
pass@1pass at 1
Доля задач, решённых агентом с первой попытки. Метрика пользовательского опыта: именно её видит человек, запустивший агента один раз.Разбор: Оценка агентов: pass@k и траектории
pass@kpass at k
Доля задач, решённых агентом хотя бы раз из k попыток. Показывает потолок способностей: решение в принципе достижимо, но не гарантировано в каждом прогоне.Разбор: Оценка агентов: pass@k и траектории
pass^kpass hat k
Доля задач, решённых агентом во всех k прогонах подряд. Метрика надёжности для продакшна: агент, которому можно доверять без присмотра.Разбор: Оценка агентов: pass@k и траектории
ReActreasoning and acting
Классическая формулировка агентного цикла: модель чередует рассуждение и действие — думает, вызывает инструмент, наблюдает результат и рассуждает снова.Разбор: Агентный цикл и критерий остановки
Reward hackingreward hacking
Агент формально проходит проверку, взломав её: находит ответ в файлах тестов, ослабляет проверку или подгоняет вывод под грейдер. Подозрительно резкий рост метрики — повод читать траектории.Разбор: Оценка агентов: pass@k и траектории · Alignment: RLHF и DPO
Scratchpadscratchpad
Внешний файл-блокнот агента для находок, решений и списка дел. Живёт вне контекстного окна, поэтому переживает компакцию и переполнение — это долговременная память агента.Разбор: Память, планирование и мультиагентные системы
Structured outputstructured output, json mode
Режим, в котором модель принуждают выдавать строго валидный JSON по заданной схеме, без последующего исполнения. Tool calling — та же механика плюс цикл «вызов — исполнение — результат».Разбор: Tool calling: как модель вызывает инструменты
SWE-benchswe-bench
Бенчмарк агентов на реальных issue из GitHub-репозиториев: агент должен написать патч, успех проверяется скрытыми тестами.Разбор: Оценка агентов: pass@k и траектории
Tool callingtool calling
Механизм, при котором LLM генерирует структурированный JSON-запрос на вызов внешней функции, а код приложения исполняет его и возвращает результат в контекст. Сама модель ничего не исполняет — только «просит».Разбор: Tool calling: как модель вызывает инструменты