Skip to main content

RAG (Retrieval-Augmented Generation)(Генерація з доповненою вибіркою даних (RAG))

Архітектурний патерн корпоративного AI, що динамічно збагачує контекстне вікно моделі релевантними верифікованими знаннями із зовнішніх сховищ (векторних баз, графів, повнотекстових індексів) перед генерацією фінальної відповіді.

1. Огляд концепції та системна проблема

Спроба «згодувати» всі внутрішні документи компанії у ваги нейромережі шляхом попереднього навчання або Fine-Tuning є фундаментальною інженерною помилкою:

  1. Катастрофічне забування (Catastrophic Forgetting): Модель може частково втратити базові навички міркування, намагаючись запам'ятати специфічні корпоративні артикули.
  2. Неможливість відкликання даних (Right to be Forgotten / GDPR): Якщо конфіденційний документ потрапив у ваги моделі, його неможливо видалити звідти без повного перенавчання вартістю в сотні тисяч доларів.
  3. Брак розмежування прав доступу (RBAC): Натренована модель відповість рядовому співробітнику інформацією про зарплати топ-менеджерів, оскільки дані перемішані в загальних матрицях ваг.

RAG (Retrieval-Augmented Generation) розділяє обчислювальний інтелект і сховище даних: LLM залишається безстороннім «процесором міркувань», а всі знання зберігаються у зовнішній базі даних під суворим інженерним контролем.

2. Архітектурна таксономія та ментальна модель

Еволюція архітектури RAG класифікується на три покоління:

  • 1. Наївний RAG (Naive RAG): Лінійний пайплайн: Chunking -> Embedding -> Vector DB -> Top-K Nearest Neighbors -> Prompt Context. Має високий рівень шуму, сліпий до точних збігів і страждає від галюцинацій при невдалих розрізах тексту.
  • 2. Просунутий RAG (Advanced RAG): Включає етапи до і після вибірки:
    • Pre-Retrieval: розширення запиту (Query Expansion), генерація гіпотетичних відповідей (HyDE) та маршрутизація до різних баз знань.
    • Retrieval: гібридний пошук (BM25 + HNSW-вектори).
    • Post-Retrieval: фільтрація за метаданими, компресія контексту та крос-енкодерний реранкінг.
  • 3. Модульний та агентський RAG (Modular / Agentic RAG): Агент сам вирішує, коли йому потрібен пошук, перевіряє отримані факти (Self-RAG), коригує запит у разі браку даних та використовує графові індекси (GraphRAG) для виявлення складних міжсуб'єктних зв'язків.

3. Технічний пайплайн та внутрішня механіка

Повний цикл виробничої системи RAG складається з двох контурів:

Контур індексації (Offline Ingestion Pipeline):

  1. Parsing & Clean: Вилучення тексту з PDF, Markdown, Notion або SQL, очищення від розмітки.
  2. Syntax-Aware Chunking: Сегментація за логічними кордонами (AST / заголовки) з буфером перекриття.
  3. Vectorization & Indexing: Генерація векторів ембеддінгів та збереження у векторній БД із метаданими доступу.

Контур запиту (Online Query Pipeline):

  1. Query Transformation: Перетворення користувацького питання на оптимізований пошуковий запит.
  2. Hybrid Retrieval: Одночасне вилучення кандидатів через вектори та повнотекстовий індекс BM25.
  3. Re-ranking: Модель-реранкер (Cross-Encoder) ранжує топ-30 знайдених чанків і залишає топ-5 найбільш релевантних.
  4. Grounded Generation: LLM отримує суворий промпт з підставленими чанками і формує точну відповідь із обов'язковим зазначенням джерел.

4. Практичні інженерні сценарії в продакшені

01. Корпоративний асистент із розмежуванням прав (RBAC)

Запит користувача супроводжується його JWT-токеном. Векторна база відсікає документи на етапі pre-filtering: WHERE team_id = 'engineering' AND access_level <= user.level. Модель фізично не отримує в контекст інформацію, до якої користувач не має доступу.

02. Технічна документація для інженерів із прямими посиланнями

Розробник запитує: «як налаштувати реплікацію SQLite». RAG повертає точну послідовність кроків із позначками [джерело: docs/replication.md#L45], дозволяючи інженеру за один клік перейти до вихідного коду.

03. Автоматизований комплаєнс-аудит юридичних контрактів

Система перевіряє 100-сторінковий договір проти реєстру корпоративних політик, підтягуючи лише релевантні пункти про форс-мажор та неустойку.

5. Підводні камені, типові помилки та безпека

  • Отруєння бази знань (RAG Poisoning): Зловмисник завантажує у внутрішню базу файл із прихованими інструкціями (Prompt Injection), який змушує RAG видавати хибні інструкції всім користувачам. Перевіряйте джерела знань та використовуйте захисні рейки (Guardrails).
  • Сміття на вході — сміття на виході (Garbage In, Garbage Out): Якщо ви завантажили в RAG погано відсканований PDF із купою розірваних слів, жодна модель не зможе дати адекватної відповіді.
  • Втрата зв'язку між чанками: Використання занадто дрібного розбиття позбавляє речення контексту. Завжди збагачуйте чанки заголовками батьківських розділів.
/ Часті запитанняSchema.org FAQPage

FAQ: RAG (Retrieval-Augmented Generation)

Fine-Tuning навчає модель новому стилю чи синтаксису, але є ненадійним методом запам'ятовування точних фактів (високий ризик галюцинацій) і вимагає повторного дорогого перенавчання при кожній зміні файлу. RAG оновлюється миттєво простим оновленням рядка в базі даних, дозволяє налаштовувати права доступу користувачів (RBAC) і забезпечує 100% клікабельні посилання на першоджерела.
/ Внутрішня перелінковка
Всі терміни
Промптинг & RAG

Векторні бази даних (Vector DBs & ANN Search)

Спеціалізовані СУБД та розширення (Qdrant, pgvector, Milvus, Chroma, Turso), оптимізовані для зберігання мільйонів багатовимірних векторів та надшвидкого наближеного пошуку найближчих сусідів (Approximate Nearest Neighbors).

Читати термін
Промптинг & RAG

Векторні ембеддінги (Dense Embeddings)

Математична проєкція тексту, коду чи мультимодальних даних у щільний багатовимірний числовий вектор, де кут і геометрія між координатами відображають їхню смислову спорідненість.

Читати термін
Промптинг & RAG

Чанкінг документів (Chunking Strategies)

Методологія декомпозиції масивних документів і кодових баз на інформаційно самодостатні фрагменти (чанки) для генерації векторних ембеддінгів та точного пошуку в RAG-системах.

Читати термін
Промптинг & RAG

Гібридний пошук (Dense + Sparse Search)

Архітектура ретривелу в сучасних RAG-системах, що поєднує семантичний векторний пошук (Dense Embeddings) із класичним повнотекстовим індексуванням за ключовими словами (Sparse / BM25) через алгоритми злиття рангів (RRF).

Читати термін