Self-RAG y Corrective RAG (CRAG)
Metodología de búsqueda adaptativa donde el modelo de lenguaje evalúa la relevancia de los documentos encontrados, descarta el ruido y reformula dinámicamente la consulta ante la falta de información.
1. Visión general del concepto y problema sistémico
El pipeline tradicional de RAG actúa como un automatismo ciego: Consulta ➔ Búsqueda ➔ Generación. Sin embargo, en sistemas reales, la búsqueda vectorial comete errores regularmente:
- El usuario pregunta sobre una tecnología que no está en la base de conocimientos interna de la empresa.
- La base devuelve las 5 palabras más similares, pero describen cosas completamente diferentes.
- El modelo recibe este contexto irrelevante, intenta conectar cosas incompatibles y produce una alucinación confiada que puede costarle a la empresa su reputación.
Self-Reflective RAG (Self-RAG & CRAG) introduce el pensamiento crítico en el proceso de búsqueda: el modelo no solo consume documentos, sino que actúa como un censor estricto, evaluando la calidad del conocimiento extraído antes de generar cada oración.
2. Taxonomía arquitectónica y modelo mental
[ CONSULTA DE ENTRADA ]
│
▼
[ Búsqueda Vectorial ]
│
▼
┌──────────────────────────────────────┐
│ EVALUATOR MODEL (CRAG) │
│ Evaluación de documentos encontrados [0..1] │
└───┬──────────────────────────────┬───┘
│ │
▼ (> 0.7: Correct) ▼ (< 0.4: Incorrect)
┌───────────────────────┐ ┌─────────────────────────┐
│ REFINAMIENTO DEL CONOCIMIENTO │ │ REESCRIBIR CONSULTA & FALLBACK│
│ Extracción de frases clave │ │ • Descartar ruido interno │
│ y eliminación de ruido │ │ • Iniciar búsqueda web │
└──────────┬────────────┘ └────────────┬────────────┘
│ └────────────┬────────────┘
└───────────────┬────────────────┘
▼
┌────────────────────────┐
│ GENERACIÓN VERIFICADA │
│ Cada afirmación │
│ respaldada por fuente │
└────────────────────────┘
3. Pipeline técnico y mecánica interna
01. Protección contra documentación desactualizada
El usuario pregunta sobre la configuración de la nueva función React 19. La base interna solo contiene documentos para React 17. Self-RAG evalúa los documentos encontrados como irrelevantes (confidence: 0.12), no los utiliza y responde honestamente: "No hay información en la base interna sobre React 19, estoy buscando en la documentación oficial".
02. Llamada de búsqueda puntual solo cuando es necesario (Dynamic Retrieval)
Si el usuario pregunta "¿Qué es el ciclo for en JavaScript?", Self-RAG entiende que es un conocimiento básico del modelo ([No-Retrieve]), y responde de inmediato sin gastar tiempo ni hacer consultas a la base de vectores.
4. Errores comunes, trampas y seguridad
- Aumento de latencia (Latency Penalty): La etapa de evaluación de documentos y la posible búsqueda de respaldo pueden añadir de 1 a 2 segundos al tiempo de respuesta. Utilice modelos de evaluación ultrarrápidos (por ejemplo, clasificadores de 1B a 3B).
- Descarte erróneo de datos correctos (False Negatives): Un umbral de corte demasiado estricto puede llevar a que el sistema descarte un documento útil solo por una formulación inusual.
5. Estrategia de conclusión para el ingeniero de 2026
Self-RAG ha transformado los sistemas de búsqueda de pipelines ingenuos a agentes de investigación inteligentes. La capacidad del sistema de decir: "Los datos encontrados no responden a su pregunta, estoy buscando más" es un requisito fundamental para una tolerancia cero a las alucinaciones.
FAQ: Self-RAG y Corrective RAG (CRAG)
Términos relacionados
RAG (Generación Aumentada por Recuperación)
Patrón arquitectónico de IA corporativa que enriquece dinámicamente la ventana de contexto del modelo con conocimientos verificados y relevantes de almacenes externos (bases de datos vectoriales, grafos, índices de texto completo) antes de generar la respuesta final.
Reflection Pattern
Patrón arquitectónico que mejora la fiabilidad de los agentes, dividiendo el proceso en generación de soluciones (Generator), auditoría crítica (Critic) y refinamiento iterativo (Refiner).
Búsqueda Híbrida (Dense + Sparse Search)
La arquitectura de recuperación en sistemas RAG modernos que combina la búsqueda semántica vectorial (Dense Embeddings) con la indexación de texto completo basada en palabras clave (Sparse / BM25) a través de algoritmos de fusión de rangos (RRF).
Alucinaciones de IA (Hallucinations & Confabulations)
Generación de información factualmente incorrecta, inventada o inexistente (bibliotecas, métodos de API, citas), expresada con alta confianza probabilística por el modelo de lenguaje.