Skip to main content

Расширение поискового запроса (Query Expansion & HyDE)

Техника подготовки поискового запроса в системах RAG. Перед обращением к векторной базе языковая модель автоматически генерирует синонимы, ключевые слова или вымышленный гипотетический ответ (HyDE — Hypothetical Document Embeddings), что кардинально повышает качество найденных документов.

1. Обзор концепции и системная проблема

Когда вы ищете что-то в корпоративной базе документов, вы часто пишете так, как думаете:

  • «Почему у меня не работает вход через телефон?»

Но в официальной инструкции для инженеров тот же процесс описан другими словами:

  • «Двухфакторная SMS-аутентификация через шлюз Twilio: устранение таймаутов».

Если просто преобразовать ваш короткий вопрос в вектор, он может пролететь мимо официальной инструкции.

Расширение поискового запроса (Query Expansion) — это интеллектуальный мост между разговорным языком человека и профессиональной терминологией базы знаний:

  • Прежде чем лезть в векторную базу, быстрая модель преобразует один ваш вопрос в 3 профессиональные версии.
  • База ищет документы по всем трем направлениям.
  • Вы получаете 100% точный результат, даже если не знали ни одного профессионального термина.

В инженерной практике это как нанять опытного библиотекаря, который переводит ваше простое обращение на точные научные шифры каталогов.

2. Как работает метод HyDE (Гипотетическая ответ)

┌─────────────────────────────────────────────────────────────┐
│                 МЕТОД HyDE В СИСТЕМАХ RAG                   │
├─────────────────────────────────────────────────────────────┤
│ 1. ВАШ ВОПРОС: «Почему колесо велосипеда скрипит?»           │
├─────────────────────────────────────────────────────────────┤
│ 2. МОДЕЛЬ ГЕНЕРИРУЕТ ГИПОТЕТИЧЕСКУЮ СТАТЬЮ (HyDE):          │
│    «Скрип в втулке колеса обычно вызван износом             │
│    подшипников или нехваткой смазки на оси каретки...»      │
├─────────────────────────────────────────────────────────────┤
│ 3. ВЕКТОРНЫЙ ПОИСК:                                         │
│    Система ищет в базе документы, похожие не на ваше короткое │
│    вопрос, а на детальную техническую статью с терминами!    │
├─────────────────────────────────────────────────────────────┤
│ 🎯 РЕЗУЛЬТАТ: Мгновенно найдена точная заводская инструкция!  │
└─────────────────────────────────────────────────────────────┘

3. Четыре техники расширения запроса

  1. Генерация синонимов: добавление родственных слов на русском и английском языках.
  2. Разбиение на подзадачи (Decomposition): если запрос звучит как «Сравни доходы компании X и Y за 2025 год», система отдельно ищет доходы компании X и отдельно доходы компании Y.
  3. Step-Back Prompting (Шаг назад): генерация более общего вопроса для извлечения фундаментальных принципов темы.
  4. Исправление опечаток и сленга: автоматическая нормализация текста до официального словаря.

4. Практические инженерные сценарии в продакшене

Добавление простого этапа Query Expansion перед векторным поиском повышает качество нахождения правильных документов в базе знаний компании с 65% до 90% без необходимости покупать более дорогую базу данных.

01. Оптимизация поиска в корпоративной базе знаний

02. Улучшение качества ответов на технические запросы

03. Автоматизация обработки пользовательских вопросов

/ Частые вопросыSchema.org FAQPage

FAQ: Расширение поискового запроса (Query Expansion & HyDE)

Пользователи часто пишут кратко, разговорно и неточно: например, «как исправить ошибку с деньгами». В корпоративной базе знаний документ называется строго: «Регламент обработки сбоев платежного шлюза». Прямой поиск может не найти ничего общего, поэтому ИИ генерирует профессиональные синонимы.
/ Внутренняя перелинковка
Все термины
Промпты и RAG

Семантический поиск (Поиск по смыслу, а не по буквам)

Технология поиска информации на основе концептуального содержания запроса, а не точного совпадения букв или ключевых слов. Понимает синонимы, перефразирования, ошибки в словах и абстрактные вопросы на естественном языке.

Читать термин
Промпты и RAG

RAG против Fine-Tuning (Вечная дилемма внедрения ИИ)

Фундаментальный архитектурный выбор для бизнеса. RAG (поиск по документам в момент запроса) против Fine-Tuning (изменение весов модели через дообучение). Критерии выбора между актуальностью фактов и специфическим стилем поведения.

Читать термин
Промпты и RAG

Гибридный Поиск (Hybrid Search: Dense + Sparse / BM25)

Архитектура поиска информации, объединяющая векторный семантический поиск (Dense retrieval — понимание содержания и синонимов) с классическим ключевым поиском по точным словам (Sparse retrieval / BM25). Обеспечивает идеальный баланс между концептуальным пониманием и точным поиском артикулов, серийных номеров или имен.

Читать термин