Фільтрація за метаданими в RAG (Metadata Filtering)(Метадані в RAG: як шукати тільки у свіжих документах потрібного відділу компанії)
Техніка комбінованого пошуку у векторних базах даних (Self-Querying Retriever). Дозволяє поєднувати семантичний пошук за смислом із суворими фільтрами бази даних за метаданими: дата публікації, автор документа, рівень доступу, мова або департамент компанії.
1. Огляд концепції та призначення
Уявіть велику бібліотеку, де всі книги скинуті в одну гігантську купу посеред зали. Ви підходите і кажете: «Знайди мені правила безпеки праці». Бібліотекар знаходить брошуру... але виявляється, що це брошура за 1978 рік! Звісно, за змістом вона ідеально підходить під тему «безпека праці», але її правила застаріли на півстоліття.
Чистий векторний пошук страждає саме на цю сліпоту: він оцінює лише смислову схожість слів, повністю ігноруючи дату, автора чи статус документа.
Щоб виправити це, використовують Фільтрацію за метаданими (Metadata Filtering).
Практична аналогія: як фільтри на сайті інтернет-магазину: ви шукаєте «кросівки» (семантичний пошук), але виставляєте галочки: «тільки 42 розмір», «чорний колір» і «знижка від 20%» (метадані).
2. Як влаштований двофазний пошук із фільтрацією
┌─────────────────────────────────────────────────────────────┐
│ СХЕМА METADATA FILTERING │
├─────────────────────────────────────────────────────────────┤
│ 👤 ЗАПИТ ЛЮДИНИ: │
│ «Які нові інструкції для кур'єрів вийшли у 2026 році?» │
├─────────────────────────────────────────────────────────────┤
│ 🧠 LLM АВТОМАТИЧНО РОЗДІЛЯЄ ЗАПИТ НА ДВІ ЧАСТИНИ: │
│ 1. Семантичний вектор: «інструкції обов'язки доставка» │
│ 2. Жорсткий SQL-фільтр: │
│ `WHERE year == 2026 AND category == 'logistics'` │
├─────────────────────────────────────────────────────────────┤
│ 🗄️ ВЕКТОРНА БАЗА ДАНИХ (Qdrant / Pinecone): │
│ - Миттєво відсікає 95% старих документів інших років │
│ - Серед решти 5% шукає найближчі смислові вектори │
├─────────────────────────────────────────────────────────────┤
│ 🎯 РЕЗУЛЬТАТ: Лише актуальні інструкції 2026 року! │
└─────────────────────────────────────────────────────────────┘
3. Топ-4 поля метаданих, які врятують ваш проєкт
- Дата створення / оновлення (
updated_at): завжди пріоритезуйте свіжі регламенти над архівами. - Рівень прав доступу (
role_allowed): захист від того, щоб стажер не побачив у відповідях бота файли з позначкоюstrictly_confidential. - Статус версії (
status: 'active' | 'archived'): виключення чернеток та застарілих проєктів. - Мова документа (
lang: 'uk' | 'en'): уникнення каші з різномовних відповідей.
4. Практичний висновок
Вектори без метаданих — це половина успіху. Завжди супроводжуйте кожен збережений у базі чанк багатим паспортом метаданих — це перетворить випадковий генератор цитат на сувору, юридично надійну бізнес-систему.
FAQ: Фільтрація за метаданими в RAG (Metadata Filtering)
Пов'язані терміни
Векторний пошук проти Ctrl+F (Dense vs Sparse)
Порівняння двох підходів до пошуку: нейромережевого смислового (Dense Retrieval) та класичного ключового за збігом слів (Sparse / BM25). Пояснює, чому векторний пошук може провалитися на пошуку артикулів товарів і як працює гібридний пошук.
Підключення баз знань (Google Drive, Notion, Confluence)
Технологія інтеграції корпоративних джерел даних із мовними моделями за допомогою готових конекторів (Connectors / ETL). Автоматично синхронізує оновлені документи з Google Drive, Notion, Confluence та Slack із векторною базою без ручного завантаження файлів.
Векторні бази даних (Vector DBs & ANN Search)
Спеціалізовані СУБД та розширення (Qdrant, pgvector, Milvus, Chroma, Turso), оптимізовані для зберігання мільйонів багатовимірних векторів та надшвидкого наближеного пошуку найближчих сусідів (Approximate Nearest Neighbors).