Skip to main content

RAG (Retrieval-Augmented Generation)

Архитектурный паттерн корпоративного AI, который динамически обогащает контекстное окно модели релевантными верифицированными знаниями из внешних хранилищ (векторных баз, графов, полнотекстовых индексов) перед генерацией финального ответа.

1. Обзор концепции и системная проблема

Попытка «впихнуть» все внутренние документы компании в веса нейросети путем предварительного обучения или Fine-Tuning является фундаментальной инженерной ошибкой:

  1. Катастрофическое забывание (Catastrophic Forgetting): Модель может частично утратить базовые навыки рассуждения, пытаясь запомнить специфические корпоративные артефакты.
  2. Невозможность отзыва данных (Right to be Forgotten / GDPR): Если конфиденциальный документ попал в веса модели, его невозможно удалить оттуда без полного перенаправления стоимостью в сотни тысяч долларов.
  3. Недостаток разграничения прав доступа (RBAC): Обученная модель ответит рядовому сотруднику информацией о зарплатах топ-менеджеров, поскольку данные перемешаны в общих матрицах весов.

RAG (Retrieval-Augmented Generation) разделяет вычислительный интеллект и хранилище данных: LLM остается беспристрастным «процессором рассуждений», а все знания хранятся во внешней базе данных под строгим инженерным контролем.

2. Архитектурная таксономия и ментальная модель

Эволюция архитектуры RAG классифицируется на три поколения:

  • 1. Наивный RAG (Naive RAG): Линейный пайплайн: Chunking -> Embedding -> Vector DB -> Top-K Nearest Neighbors -> Prompt Context. Имеет высокий уровень шума, слеп к точным совпадениям и страдает от галлюцинаций при неудачных разрезах текста.
  • 2. Продвинутый RAG (Advanced RAG): Включает этапы до и после выборки:
    • Pre-Retrieval: расширение запроса (Query Expansion), генерация гипотетических ответов (HyDE) и маршрутизация к различным базам знаний.
    • Retrieval: гибридный поиск (BM25 + HNSW-векторы).
    • Post-Retrieval: фильтрация по метаданным, компрессия контекста и кросс-энкодерный реранкинг.
  • 3. Модульный и агентский RAG (Modular / Agentic RAG): Агент сам решает, когда ему нужен поиск, проверяет полученные факты (Self-RAG), корректирует запрос в случае нехватки данных и использует графовые индексы (GraphRAG) для выявления сложных межсубъектных связей.

3. Технический пайплайн и внутренняя механика

Полный цикл производственной системы RAG состоит из двух контуров:

Контур индексации (Offline Ingestion Pipeline):

  1. Parsing & Clean: Извлечение текста из PDF, Markdown, Notion или SQL, очистка от разметки.
  2. Syntax-Aware Chunking: Сегментация по логическим границам (AST / заголовки) с буфером перекрытия.
  3. Vectorization & Indexing: Генерация векторов эмбеддингов и сохранение в векторной БД с метаданными доступа.

Контур запроса (Online Query Pipeline):

  1. Query Transformation: Преобразование пользовательского вопроса в оптимизированный поисковый запрос.
  2. Hybrid Retrieval: Одновременное извлечение кандидатов через векторы и полнотекстовый индекс BM25.
  3. Re-ranking: Модель-реранкер (Cross-Encoder) ранжирует топ-30 найденных чанков и оставляет топ-5 наиболее релевантных.
  4. Grounded Generation: LLM получает строгий промпт с подставленными чанками и формирует точный ответ с обязательным указанием источников.

4. Практические инженерные сценарии в продакшене

01. Корпоративный ассистент с разграничением прав (RBAC)

Запрос пользователя сопровождается его JWT-токеном. Векторная база отсекает документы на этапе pre-filtering: WHERE team_id = 'engineering' AND access_level <= user.level. Модель физически не получает в контекст информацию, к которой пользователь не имеет доступа.

02. Техническая документация для инженеров с прямыми ссылками

Разработчик запрашивает: «как настроить репликацию SQLite». RAG возвращает точную последовательность шагов с пометками [источник: docs/replication.md#L45], позволяя инженеру за один клик перейти к исходному коду.

03. Автоматизированный комплаенс-аудит юридических контрактов

Система проверяет 100-страничный договор против реестра корпоративных политик, подтягивая только релевантные пункты о форс-мажоре и неустойке.

5. Подводные камни, типовые ошибки и безопасность

  • Отравление базы знаний (RAG Poisoning): Злоумышленник загружает во внутреннюю базу файл с скрытыми инструкциями (Prompt Injection), который заставляет RAG выдавать ложные инструкции всем пользователям. Проверяйте источники знаний и используйте защитные рейки (Guardrails).
  • Мусор на входе — мусор на выходе (Garbage In, Garbage Out): Если вы загрузили в RAG плохо отсканированный PDF с кучей разорванных слов, никакая модель не сможет дать адекватного ответа.
  • Потеря связи между чанками: Использование слишком мелкого разбиения лишает предложения контекста. Всегда обогащайте чанки заголовками родительских разделов.
/ Частые вопросыSchema.org FAQPage

FAQ: RAG (Retrieval-Augmented Generation)

Fine-Tuning обучает модель новому стилю или синтаксису, но является ненадежным методом запоминания точных фактов (высокий риск галлюцинаций) и требует повторного дорогостоящего перенаправления при каждом изменении файла. RAG обновляется мгновенно простым обновлением строки в базе данных, позволяет настраивать права доступа пользователей (RBAC) и обеспечивает 100% кликабельные ссылки на первоисточники.
/ Внутренняя перелинковка
Все термины
Промпты и RAG

Векторные базы данных (Vector DBs & ANN Search)

Специализированные СУБД и расширения (Qdrant, pgvector, Milvus, Chroma, Turso), оптимизированные для хранения миллионов многомерных векторов и сверхбыстрого приближенного поиска ближайших соседей (Approximate Nearest Neighbors).

Читать термин
Промпты и RAG

Векторные эмбеддинги (Dense Embeddings)

Математическая проекция текста, кода или мультимодальных данных в плотный многомерный числовой вектор, где угол и геометрия между координатами отражают их семантическую связанность.

Читать термин
Промпты и RAG

Чанкинг документов (Chunking Strategies)

Методология декомпозиции массивных документов и кодовых баз на информационно самодостаточные фрагменты (чанки) для генерации векторных эмбеддингов и точного поиска в RAG-системах.

Читать термин
Промпты и RAG

Гибридный поиск (Dense + Sparse Search)

Архитектура ретривала в современных RAG-системах, сочетающая семантический векторный поиск (Dense Embeddings) с классическим полнотекстовым индексированием по ключевым словам (Sparse / BM25) через алгоритмы слияния рангов (RRF).

Читать термин