Диагностика Mock-интервью
Главная · Глоссарий · RAG: поиск + генерация

Глоссарий: RAG: поиск + генерация

51 термин раздела «RAG: поиск + генерация» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.

Векторная база данныхvector database
Хранилище эмбеддингов с ANN-индексом: за миллисекунды находит ближайшие по смыслу векторы среди миллионов, храня вместе с ними метаданные и исходный текст. Отвечает на вопрос «что похоже по смыслу».Разбор: Векторные базы данных и их типы
Генерация с опорой на контекстgrounded generation
Режим, при котором модель отвечает по переданным в промпт фрагментам документов, а не по памяти. Снижает галлюцинации и позволяет цитировать источники, делая ответы проверяемыми.Разбор: Что такое RAG и зачем он нужен
Дата отсечения знанийknowledge cutoff
Момент, на котором заморожены знания LLM: о событиях после даты обучения модель не знает и может отвечать выдумкой. Одна из главных причин использовать RAG.Разбор: Что такое RAG и зачем он нужен
Золотой сетgolden set
Набор из 100–500 реальных запросов продукта с эталонными ответами или человеческими оценками. Главный актив eval-инфраструктуры: им калибруют судью и по нему гоняют регрессионные прогоны на каждый релиз.Разбор: Оценка качества RAG · Оценка LLM: бенчмарки и LLM-as-judge
Индексацияindexing
Офлайн-фаза RAG: документы нарезаются на чанки, каждый превращается в вектор-эмбеддинг, векторы складываются в векторную базу данных для последующего поиска.Разбор: Что такое RAG и зачем он нужен
Контрастивное обучениеcontrastive learning
Обучение эмбеддинг-моделей: векторы пары «запрос — релевантный документ» стягиваются, а с нерелевантными негативами расталкиваются. Качество модели определяется тем, что было негативом.Разбор: Эмбеддинг-модели: как их обучают · Как LLM видят изображения
Косинусная близостьcosine similarity
Мера сходства векторов через угол между ними: похожие по смыслу тексты дают близкие направления. Стандартная метрика близости эмбеддингов в семантическом поиске.Разбор: Векторный поиск и ANN-индексы · Эмбеддинги и word2vec
Ложные негативыfalse negatives
Релевантные, но неразмеченные документы, случайно попавшие в негативы при майнинге: модель учат отталкивать правильные ответы. Кандидатов фильтруют, например отбрасывая высокие скоры кросс-энкодера.Разбор: Эмбеддинг-модели: как их обучают
Лямбда-параметр MMRlambda parameter
Коэффициент баланса в MMR: ближе к единице — чистая релевантность с риском дублей, ближе к нулю — чистое разнообразие с риском нерелевантности. На практике держат около 0.5–0.7.Разбор: MMR и разнообразие выдачи
Маргинальная релевантностьmarginal relevance
Прирост полезности документа с учётом уже отобранных: фрагмент, повторяющий выбранное, почти ничего не добавляет, даже если сам по себе релевантен запросу.Разбор: MMR и разнообразие выдачи
Матрёшка-эмбеддингиmatryoshka representation learning
Обучение, при котором первые k координат вектора — самостоятельный рабочий эмбеддинг. Вектор на 1024 измерения можно обрезать до 256 под бюджет памяти, почти не теряя качества и ничего не переобучая.Разбор: Эмбеддинг-модели: как их обучают
Метаданныеpayload, metadata
Структурированные поля записи векторной базы: автор, дата, отдел, язык, права доступа. По ним фильтруют кандидатов при семантическом поиске.Разбор: Векторные базы данных и их типы
Перекрытие чанковoverlap
Соседние чанки перекрываются на несколько токенов, чтобы мысль на границе целиком попала хотя бы в один из них. Цена — дубли в индексе и почти одинаковые кандидаты в выдаче.Разбор: Чанкинг и подготовка данных
Пост-фильтрацияpost-filtering
Стратегия фильтров: сначала найти топ-k по близости, потом отсеять по метаданным. Строгий фильтр может выбить почти все результаты, оставив два из десяти.Разбор: Векторные базы данных и их типы
Пре-фильтрацияpre-filtering
Стратегия фильтров в векторном поиске: сначала сузить кандидатов по метаданным, потом искать по близости. Точнее пост-фильтрации, но дороже для индекса.Разбор: Векторные базы данных и их типы
Пулингpooling
Сборка контекстных векторов всех токенов в один вектор текста: усреднение (mean pooling) или вектор служебного CLS-токена. Так трансформер-энкодер выдаёт эмбеддинг целого запроса или документа.Разбор: Эмбеддинг-модели: как их обучают · Свёрточные сети (CNN)
Разнообразие выдачиdiversity
Свойство набора результатов покрывать разные грани темы вместо повторов одного тезиса. Важно для широких обзорных вопросов и вредно для узких фактовых, где решает точность первого результата.Разбор: MMR и разнообразие выдачи
Рекурсивный сплиттерrecursive character splitter
Стратегия нарезки: резать по самым крупным разделителям (абзац, предложение, слово), спускаясь ниже, только если кусок не влезает в лимит. Практичный дефолт чанкинга.Разбор: Чанкинг и подготовка данных
Реранкерreranker
Вторая ступень поиска: точная модель пересортировывает топ кандидатов от быстрого ретривера. Отвечает за precision, но не вернёт документ, который первая ступень потеряла.Разбор: Гибридный поиск и реранкинг
Ретриверretriever
Первая ступень поиска, быстро отбирающая кандидатов из миллионов документов. Её recall — жёсткий потолок качества всей системы: что не найдено на этом этапе, не спасёт никакой реранкер.Разбор: Гибридный поиск и реранкинг
Семантический чанкингsemantic chunking
Нарезка по смыслу: считаются эмбеддинги соседних предложений, и граница ставится там, где близость резко падает. Точнее фиксированной нарезки, но дороже на этапе индексации.Разбор: Чанкинг и подготовка данных
Чанкchunk
Фрагмент документа — единица индексации в RAG: его эмбеддинг участвует в поиске, его текст попадает в промпт. Хороший чанк понятен сам по себе, без остального документа.Разбор: Чанкинг и подготовка данных
Чанкингchunking
Нарезка документов на фрагменты перед индексацией. От того, где пройдут границы, качество поиска зависит сильнее, чем от выбора модели эмбеддингов.Разбор: Чанкинг и подготовка данных
ACLaccess control list
Список прав доступа, который обязательно прокидывают в метаданные чанков. Без фильтрации по ACL на этапе поиска RAG отдаст содержимое закрытых документов любому, кто задал подходящий вопрос.Разбор: Чанкинг и подготовка данных
ANNapproximate nearest neighbors
Приближённый поиск ближайших соседей: находит «почти наверняка ближайшие» векторы на порядки быстрее полного перебора ценой небольшой потери полноты. Основа векторного поиска на миллионах документов.Разбор: Векторный поиск и ANN-индексы
Answer relevanceanswer relevance
Метрика генерации: отвечает ли сгенерированный текст на заданный вопрос. Ответ может быть верен контексту, но не о том, что спрашивали.Разбор: Оценка качества RAG
Bi-encoderbi-encoder
Модель поиска, кодирующая запрос и документ по отдельности: векторы документов предвычислены заранее, поэтому поиск по миллионам занимает миллисекунды. Раздельное кодирование — потеря точности.Разбор: Гибридный поиск и реранкинг
BM25bm25
Классический алгоритм лексического поиска по взвешенному совпадению слов, наследник TF-IDF. Мгновенно находит точные термины — артикулы, коды ошибок, имена, — но пасует перед синонимами и перефразировками.Разбор: Гибридный поиск и реранкинг
Contextual retrievalcontextual retrieval
Обогащение чанков: LLM читает весь документ и дописывает к каждому фрагменту одно-два предложения контекста — откуда он и о чём. Дороже на индексации, но заметно поднимает точность поиска.Разбор: Чанкинг и подготовка данных
Cross-encodercross-encoder
Модель, читающая пару «запрос плюс документ» целиком одним проходом и выдающая точный скор релевантности. На порядки дороже bi-encoder, поэтому применяется только к топу выдачи.Разбор: Гибридный поиск и реранкинг
FAISSfaiss
Библиотека векторных индексов, работающая в памяти процесса без отдельного сервера. Максимум контроля и скорости, но персистентность, репликация и фильтры — забота разработчика.Разбор: Векторные базы данных и их типы
Faithfulnessfaithfulness, groundedness
Метрика генерации в RAG: опирается ли ответ на переданный контекст или содержит выдуманные утверждения. Именно она ловит галлюцинации; обычно считается LLM-судьёй.Разбор: Оценка качества RAG
Flat-индексflat index
Точный перебор всех векторов при поиске: стопроцентная полнота, но линейная стоимость на каждый запрос. Годится для небольших баз и как эталон при измерении качества ANN-индексов.Разбор: Векторные базы данных и их типы
Hard negativeshard negatives
Похожие, но нерелевантные документы, которые майнят через BM25 или прошлую версию модели. Учат тонким различиям внутри темы; случайные негативы слишком лёгкие и почти не дают градиента.Разбор: Эмбеддинг-модели: как их обучают
HNSWhierarchical navigable small world
Многослойный граф-индекс для ANN: верхние слои — редкие «хайвеи» для дальних прыжков по пространству, нижние — плотные «улицы» для точной доводки. Быстрый и точный, но требует много памяти.Разбор: Векторный поиск и ANN-индексы
In-batch negativesin-batch negatives
Приём контрастивного обучения: для каждого запроса негативами служат документы остальных пар того же батча — без отдельной разметки.Разбор: Эмбеддинг-модели: как их обучают
InfoNCEinfonce loss
Лосс контрастивного обучения: softmax-классификация «найди свой документ среди чужих в батче». Скор позитива тянется вверх относительно негативов, температура задаёт резкость распределения.Разбор: Эмбеддинг-модели: как их обучают
IVFinverted file index
ANN-индекс, в котором база заранее разбита на ячейки вокруг центроидов кластеризации. Поиск идёт только в нескольких ближайших ячейках; их число балансирует полноту и скорость.Разбор: Векторный поиск и ANN-индексы
MMRmaximal marginal relevance
Жадный отбор документов, на каждом шаге балансирующий близость к запросу и непохожесть на уже выбранные. Превращает «k копий лучшего ответа» в «k разных граней темы».Разбор: MMR и разнообразие выдачи
MRRmean reciprocal rank
Средний обратный ранг первого релевантного результата по множеству запросов. Учитывает позицию: релевантный фрагмент на первом месте ценнее, чем на пятом.Разбор: Оценка качества RAG · Ранжирование: learning-to-rank
MTEBmassive text embedding benchmark
Большой бенчмарк задач с эмбеддингами, по которому сравнивают и выбирают эмбеддинг-модели. Лишь ориентир: решает полнота поиска на золотом сете из собственных запросов и документов.Разбор: Эмбеддинг-модели: как их обучают
nDCGnormalized discounted cumulative gain
Метрика качества ранжирования, учитывающая позиции: релевантные результаты наверху списка дают больше очков, чем внизу. Используется в оценке поиска и рекомендаций.Разбор: Оценка качества RAG · Ранжирование: learning-to-rank
Near-дубликатыnear-duplicates
Почти совпадающие фрагменты корпуса, которые забивают топ выдачи перефразировками одного и того же. Отсеиваются MMR: документ, слишком похожий на уже выбранный, теряет ценность.Разбор: MMR и разнообразие выдачи
pgvectorpgvector
Расширение PostgreSQL, добавляющее вектор-колонку и ANN-индекс в обычную базу. Лучший старт до миллиона векторов, если Postgres уже в стеке: одна система, транзакции, привычные бэкапы.Разбор: Векторные базы данных и их типы
PQproduct quantization
Сжатие векторов для ANN-индексов: вектор режется на части, каждая кодируется номером ближайшего эталона из маленького словаря. Память падает в десятки раз при небольшой потере точности.Разбор: Векторный поиск и ANN-индексы
Precision@kprecision at k
Доля действительно релевантных среди k подтянутых фрагментов. Показывает, сколько мусора едет в контекст модели вместе с полезным.Разбор: Оценка качества RAG
RAGretrieval-augmented generation
Паттерн, дающий LLM знания вне её весов: перед генерацией система находит в базе знаний релевантные фрагменты и подставляет их в промпт. Обновить знания — значит переиндексировать документы, а не переобучать модель.Разбор: Что такое RAG и зачем он нужен
Recall@krecall at k
Доля вопросов, для которых релевантный фрагмент попал в топ-k выдачи. Главная метрика ретривера: если нужного чанка нет в контексте, генератор бессилен.Разбор: Оценка качества RAG
RRFreciprocal rank fusion
Слияние ранжированных списков по позициям документов, а не по скорам: чем выше документ в каждом списке, тем больше очков. Не требует калибровки несравнимых шкал BM25 и косинусной близости.Разбор: Гибридный поиск и реранкинг
Top-ktop-k retrieval
Число ближайших фрагментов, которые поиск отдаёт модели в промпт. Мало — риск не захватить нужный, много — шум и лишние токены; значение подбирают эмпирически по метрикам поиска.Разбор: Что такое RAG и зачем он нужен · Сэмплирование: temperature, top-k, top-p