Глоссарий: RAG: поиск + генерация
51 термин раздела «RAG: поиск + генерация» с короткими определениями и ссылками на темы, где они разбираются. Весь глоссарий · карточки.
- Векторная база данныхvector database
- Хранилище эмбеддингов с ANN-индексом: за миллисекунды находит ближайшие по смыслу векторы среди миллионов, храня вместе с ними метаданные и исходный текст. Отвечает на вопрос «что похоже по смыслу».Разбор: Векторные базы данных и их типы
- Генерация с опорой на контекстgrounded generation
- Режим, при котором модель отвечает по переданным в промпт фрагментам документов, а не по памяти. Снижает галлюцинации и позволяет цитировать источники, делая ответы проверяемыми.Разбор: Что такое RAG и зачем он нужен
- Гибридный поискhybrid search
- Параллельный запуск лексического и векторного поиска со слиянием списков результатов. Слабости методов не пересекаются, поэтому гибрид почти всегда выигрывает у каждого по отдельности.Разбор: Гибридный поиск и реранкинг
- Дата отсечения знанийknowledge cutoff
- Момент, на котором заморожены знания LLM: о событиях после даты обучения модель не знает и может отвечать выдумкой. Одна из главных причин использовать RAG.Разбор: Что такое RAG и зачем он нужен
- Золотой сетgolden set
- Набор из 100–500 реальных запросов продукта с эталонными ответами или человеческими оценками. Главный актив eval-инфраструктуры: им калибруют судью и по нему гоняют регрессионные прогоны на каждый релиз.Разбор: Оценка качества RAG · Оценка LLM: бенчмарки и LLM-as-judge
- Индексацияindexing
- Офлайн-фаза RAG: документы нарезаются на чанки, каждый превращается в вектор-эмбеддинг, векторы складываются в векторную базу данных для последующего поиска.Разбор: Что такое RAG и зачем он нужен
- Контрастивное обучениеcontrastive learning
- Обучение эмбеддинг-моделей: векторы пары «запрос — релевантный документ» стягиваются, а с нерелевантными негативами расталкиваются. Качество модели определяется тем, что было негативом.Разбор: Эмбеддинг-модели: как их обучают · Как LLM видят изображения
- Косинусная близостьcosine similarity
- Мера сходства векторов через угол между ними: похожие по смыслу тексты дают близкие направления. Стандартная метрика близости эмбеддингов в семантическом поиске.Разбор: Векторный поиск и ANN-индексы · Эмбеддинги и word2vec
- Ложные негативыfalse negatives
- Релевантные, но неразмеченные документы, случайно попавшие в негативы при майнинге: модель учат отталкивать правильные ответы. Кандидатов фильтруют, например отбрасывая высокие скоры кросс-энкодера.Разбор: Эмбеддинг-модели: как их обучают
- Лямбда-параметр MMRlambda parameter
- Коэффициент баланса в MMR: ближе к единице — чистая релевантность с риском дублей, ближе к нулю — чистое разнообразие с риском нерелевантности. На практике держат около 0.5–0.7.Разбор: MMR и разнообразие выдачи
- Маргинальная релевантностьmarginal relevance
- Прирост полезности документа с учётом уже отобранных: фрагмент, повторяющий выбранное, почти ничего не добавляет, даже если сам по себе релевантен запросу.Разбор: MMR и разнообразие выдачи
- Матрёшка-эмбеддингиmatryoshka representation learning
- Обучение, при котором первые k координат вектора — самостоятельный рабочий эмбеддинг. Вектор на 1024 измерения можно обрезать до 256 под бюджет памяти, почти не теряя качества и ничего не переобучая.Разбор: Эмбеддинг-модели: как их обучают
- Метаданныеpayload, metadata
- Структурированные поля записи векторной базы: автор, дата, отдел, язык, права доступа. По ним фильтруют кандидатов при семантическом поиске.Разбор: Векторные базы данных и их типы
- Перекрытие чанковoverlap
- Соседние чанки перекрываются на несколько токенов, чтобы мысль на границе целиком попала хотя бы в один из них. Цена — дубли в индексе и почти одинаковые кандидаты в выдаче.Разбор: Чанкинг и подготовка данных
- Пост-фильтрацияpost-filtering
- Стратегия фильтров: сначала найти топ-k по близости, потом отсеять по метаданным. Строгий фильтр может выбить почти все результаты, оставив два из десяти.Разбор: Векторные базы данных и их типы
- Пре-фильтрацияpre-filtering
- Стратегия фильтров в векторном поиске: сначала сузить кандидатов по метаданным, потом искать по близости. Точнее пост-фильтрации, но дороже для индекса.Разбор: Векторные базы данных и их типы
- Пулингpooling
- Сборка контекстных векторов всех токенов в один вектор текста: усреднение (mean pooling) или вектор служебного CLS-токена. Так трансформер-энкодер выдаёт эмбеддинг целого запроса или документа.Разбор: Эмбеддинг-модели: как их обучают · Свёрточные сети (CNN)
- Разнообразие выдачиdiversity
- Свойство набора результатов покрывать разные грани темы вместо повторов одного тезиса. Важно для широких обзорных вопросов и вредно для узких фактовых, где решает точность первого результата.Разбор: MMR и разнообразие выдачи
- Рекурсивный сплиттерrecursive character splitter
- Стратегия нарезки: резать по самым крупным разделителям (абзац, предложение, слово), спускаясь ниже, только если кусок не влезает в лимит. Практичный дефолт чанкинга.Разбор: Чанкинг и подготовка данных
- Реранкерreranker
- Вторая ступень поиска: точная модель пересортировывает топ кандидатов от быстрого ретривера. Отвечает за precision, но не вернёт документ, который первая ступень потеряла.Разбор: Гибридный поиск и реранкинг
- Ретриверretriever
- Первая ступень поиска, быстро отбирающая кандидатов из миллионов документов. Её recall — жёсткий потолок качества всей системы: что не найдено на этом этапе, не спасёт никакой реранкер.Разбор: Гибридный поиск и реранкинг
- Семантический чанкингsemantic chunking
- Нарезка по смыслу: считаются эмбеддинги соседних предложений, и граница ставится там, где близость резко падает. Точнее фиксированной нарезки, но дороже на этапе индексации.Разбор: Чанкинг и подготовка данных
- Чанкchunk
- Фрагмент документа — единица индексации в RAG: его эмбеддинг участвует в поиске, его текст попадает в промпт. Хороший чанк понятен сам по себе, без остального документа.Разбор: Чанкинг и подготовка данных
- Чанкингchunking
- Нарезка документов на фрагменты перед индексацией. От того, где пройдут границы, качество поиска зависит сильнее, чем от выбора модели эмбеддингов.Разбор: Чанкинг и подготовка данных
- ACLaccess control list
- Список прав доступа, который обязательно прокидывают в метаданные чанков. Без фильтрации по ACL на этапе поиска RAG отдаст содержимое закрытых документов любому, кто задал подходящий вопрос.Разбор: Чанкинг и подготовка данных
- ANNapproximate nearest neighbors
- Приближённый поиск ближайших соседей: находит «почти наверняка ближайшие» векторы на порядки быстрее полного перебора ценой небольшой потери полноты. Основа векторного поиска на миллионах документов.Разбор: Векторный поиск и ANN-индексы
- Answer relevanceanswer relevance
- Метрика генерации: отвечает ли сгенерированный текст на заданный вопрос. Ответ может быть верен контексту, но не о том, что спрашивали.Разбор: Оценка качества RAG
- Bi-encoderbi-encoder
- Модель поиска, кодирующая запрос и документ по отдельности: векторы документов предвычислены заранее, поэтому поиск по миллионам занимает миллисекунды. Раздельное кодирование — потеря точности.Разбор: Гибридный поиск и реранкинг
- BM25bm25
- Классический алгоритм лексического поиска по взвешенному совпадению слов, наследник TF-IDF. Мгновенно находит точные термины — артикулы, коды ошибок, имена, — но пасует перед синонимами и перефразировками.Разбор: Гибридный поиск и реранкинг
- Contextual retrievalcontextual retrieval
- Обогащение чанков: LLM читает весь документ и дописывает к каждому фрагменту одно-два предложения контекста — откуда он и о чём. Дороже на индексации, но заметно поднимает точность поиска.Разбор: Чанкинг и подготовка данных
- Cross-encodercross-encoder
- Модель, читающая пару «запрос плюс документ» целиком одним проходом и выдающая точный скор релевантности. На порядки дороже bi-encoder, поэтому применяется только к топу выдачи.Разбор: Гибридный поиск и реранкинг
- FAISSfaiss
- Библиотека векторных индексов, работающая в памяти процесса без отдельного сервера. Максимум контроля и скорости, но персистентность, репликация и фильтры — забота разработчика.Разбор: Векторные базы данных и их типы
- Faithfulnessfaithfulness, groundedness
- Метрика генерации в RAG: опирается ли ответ на переданный контекст или содержит выдуманные утверждения. Именно она ловит галлюцинации; обычно считается LLM-судьёй.Разбор: Оценка качества RAG
- Flat-индексflat index
- Точный перебор всех векторов при поиске: стопроцентная полнота, но линейная стоимость на каждый запрос. Годится для небольших баз и как эталон при измерении качества ANN-индексов.Разбор: Векторные базы данных и их типы
- Hard negativeshard negatives
- Похожие, но нерелевантные документы, которые майнят через BM25 или прошлую версию модели. Учат тонким различиям внутри темы; случайные негативы слишком лёгкие и почти не дают градиента.Разбор: Эмбеддинг-модели: как их обучают
- In-batch negativesin-batch negatives
- Приём контрастивного обучения: для каждого запроса негативами служат документы остальных пар того же батча — без отдельной разметки.Разбор: Эмбеддинг-модели: как их обучают
- InfoNCEinfonce loss
- Лосс контрастивного обучения: softmax-классификация «найди свой документ среди чужих в батче». Скор позитива тянется вверх относительно негативов, температура задаёт резкость распределения.Разбор: Эмбеддинг-модели: как их обучают
- IVFinverted file index
- ANN-индекс, в котором база заранее разбита на ячейки вокруг центроидов кластеризации. Поиск идёт только в нескольких ближайших ячейках; их число балансирует полноту и скорость.Разбор: Векторный поиск и ANN-индексы
- MMRmaximal marginal relevance
- Жадный отбор документов, на каждом шаге балансирующий близость к запросу и непохожесть на уже выбранные. Превращает «k копий лучшего ответа» в «k разных граней темы».Разбор: MMR и разнообразие выдачи
- MRRmean reciprocal rank
- Средний обратный ранг первого релевантного результата по множеству запросов. Учитывает позицию: релевантный фрагмент на первом месте ценнее, чем на пятом.Разбор: Оценка качества RAG · Ранжирование: learning-to-rank
- MTEBmassive text embedding benchmark
- Большой бенчмарк задач с эмбеддингами, по которому сравнивают и выбирают эмбеддинг-модели. Лишь ориентир: решает полнота поиска на золотом сете из собственных запросов и документов.Разбор: Эмбеддинг-модели: как их обучают
- nDCGnormalized discounted cumulative gain
- Метрика качества ранжирования, учитывающая позиции: релевантные результаты наверху списка дают больше очков, чем внизу. Используется в оценке поиска и рекомендаций.Разбор: Оценка качества RAG · Ранжирование: learning-to-rank
- Near-дубликатыnear-duplicates
- Почти совпадающие фрагменты корпуса, которые забивают топ выдачи перефразировками одного и того же. Отсеиваются MMR: документ, слишком похожий на уже выбранный, теряет ценность.Разбор: MMR и разнообразие выдачи
- pgvectorpgvector
- Расширение PostgreSQL, добавляющее вектор-колонку и ANN-индекс в обычную базу. Лучший старт до миллиона векторов, если Postgres уже в стеке: одна система, транзакции, привычные бэкапы.Разбор: Векторные базы данных и их типы
- PQproduct quantization
- Сжатие векторов для ANN-индексов: вектор режется на части, каждая кодируется номером ближайшего эталона из маленького словаря. Память падает в десятки раз при небольшой потере точности.Разбор: Векторный поиск и ANN-индексы
- Precision@kprecision at k
- Доля действительно релевантных среди k подтянутых фрагментов. Показывает, сколько мусора едет в контекст модели вместе с полезным.Разбор: Оценка качества RAG
- RAGretrieval-augmented generation
- Паттерн, дающий LLM знания вне её весов: перед генерацией система находит в базе знаний релевантные фрагменты и подставляет их в промпт. Обновить знания — значит переиндексировать документы, а не переобучать модель.Разбор: Что такое RAG и зачем он нужен
- Recall@krecall at k
- Доля вопросов, для которых релевантный фрагмент попал в топ-k выдачи. Главная метрика ретривера: если нужного чанка нет в контексте, генератор бессилен.Разбор: Оценка качества RAG
- RRFreciprocal rank fusion
- Слияние ранжированных списков по позициям документов, а не по скорам: чем выше документ в каждом списке, тем больше очков. Не требует калибровки несравнимых шкал BM25 и косинусной близости.Разбор: Гибридный поиск и реранкинг
- Top-ktop-k retrieval
- Число ближайших фрагментов, которые поиск отдаёт модели в промпт. Мало — риск не захватить нужный, много — шум и лишние токены; значение подбирают эмпирически по метрикам поиска.Разбор: Что такое RAG и зачем он нужен · Сэмплирование: temperature, top-k, top-p