Self-RAG & Corrective RAG (CRAG)
Методология адаптивного поиска, где языковая модель самостоятельно оценивает релевантность найденных документов, отбрасывает шум и динамически переформулирует поисковый запрос при нехватке информации.
1. Обзор концепции и системная проблема
Традиционный конвейер RAG действует как слепой автомат: Запрос ➔ Поиск ➔ Генерация. Но в реальных системах векторный поиск регулярно ошибается:
- Пользователь задает вопрос о технологии, которой вообще нет во внутренней базе знаний компании.
- База возвращает 5 наиболее похожих слов, но они описывают совсем другие вещи.
- Модель получает этот нерелевантный контекст, пытается связать несовместимые вещи и выдает уверенную галлюцинацию, которая может стоить компании репутации.
Self-Reflective RAG (Self-RAG & CRAG) внедряет критическое мышление в процесс поиска: модель не просто потребляет документы, а выступает строгим цензором, оценивая качество извлеченных знаний перед генерацией каждого предложения.
2. Архитектурная таксономия и ментальная модель
[ ВХОДНОЙ ЗАПРОС ]
│
▼
[ Векторный поиск ]
│
▼
┌──────────────────────────────────────┐
│ EVALUATOR MODEL (CRAG) │
│ Оценка найденных документов [0..1] │
└───┬──────────────────────────────┬───┘
│ │
▼ (> 0.7: Correct) ▼ (< 0.4: Incorrect)
┌───────────────────────┐ ┌─────────────────────────┐
│ KNOWLEDGE REFINEMENT │ │ RE-WRITE QUERY & FALLBACK│
│ Извлечение ключевых │ │ • Отбросить внутренний │
│ предложений, выбрасывание шума│ │ шум │
└──────────┬────────────┘ │ • Запустить Web Search │
│ └────────────┬────────────┘
└───────────────┬────────────────┘
▼
┌────────────────────────┐
│ FACT-CHECKED GENERATION│
│ Каждое утверждение │
│ подтверждено источником │
└────────────────────────┘
3. Практические инженерные сценарии в продакшене
01. Защита от устаревшей документации
Пользователь запрашивает о настройках новейшей функции React 19. Внутренняя база содержит документы только для React 17. Self-RAG оценивает найденные документы как нерелевантные (confidence: 0.12), не использует их и честно отвечает: "Во внутренней базе нет информации о React 19, запускаю поиск в официальной документации".
02. Точечный вызов поиска только по необходимости (Dynamic Retrieval)
Если пользователь запрашивает "Что такое цикл for в JavaScript?", Self-RAG понимает, что это базовое знание модели ([No-Retrieve]), и отвечает мгновенно без затрат времени и запросов к векторной базе.
4. Подводные камни, типовые ошибки и безопасность
- Увеличение латентности (Latency Penalty): Этап оценки документов и возможный повторный поиск могут добавить 1–2 секунды к времени ответа. Используйте для оценки сверхбыстрые модели (например, 1B–3B классификаторы).
- Ложное отклонение правильных данных (False Negatives): Слишком строгий порог отсечения может привести к тому, что система отклонит полезный документ лишь из-за необычного формулирования.
5. Стратегический вывод для инженера 2026 года
Self-RAG преобразовал поисковые системы из наивных конвейеров в интеллектуальные исследовательские агенты. Способность системы сказать: "Найденные данные не отвечают на ваш вопрос, я ищу дальше" — это фундаментальное предположение нулевой толерантности к галлюцинациям.
FAQ: Self-RAG & Corrective RAG (CRAG)
Связанные термины
RAG (Retrieval-Augmented Generation)
Архитектурный паттерн корпоративного AI, который динамически обогащает контекстное окно модели релевантными верифицированными знаниями из внешних хранилищ (векторных баз, графов, полнотекстовых индексов) перед генерацией финального ответа.
Reflection Pattern (Рефлексия)
Архитектурный паттерн повышения надежности агентов, который разделяет процесс на генерацию решения (Generator), его критический аудит (Critic) и итеративное доработку (Refiner).
Гибридный поиск (Dense + Sparse Search)
Архитектура ретривала в современных RAG-системах, сочетающая семантический векторный поиск (Dense Embeddings) с классическим полнотекстовым индексированием по ключевым словам (Sparse / BM25) через алгоритмы слияния рангов (RRF).
Галлюцинации ИИ (Hallucinations & Confabulations)
Генерация языковой моделью фактически неверной, вымышленной или несуществующей информации (библиотек, методов API, цитат), выраженной с высокой вероятностной уверенностью.