RAG (Generación Aumentada por Recuperación)
Patrón arquitectónico de IA corporativa que enriquece dinámicamente la ventana de contexto del modelo con conocimientos verificados y relevantes de almacenes externos (bases de datos vectoriales, grafos, índices de texto completo) antes de generar la respuesta final.
1. Visión general del concepto y problema sistémico
Intentar "alimentar" todos los documentos internos de la empresa en los pesos de una red neuronal mediante preentrenamiento o Fine-Tuning es un error de ingeniería fundamental:
- Olvido catastrófico (Catastrophic Forgetting): El modelo puede perder parcialmente habilidades básicas de razonamiento al intentar memorizar artículos corporativos específicos.
- Derecho al olvido (Right to be Forgotten / GDPR): Si un documento confidencial se incorpora a los pesos del modelo, no se puede eliminar sin un reentrenamiento completo que cuesta cientos de miles de dólares.
- Falta de separación de derechos de acceso (RBAC): Un modelo entrenado puede responder a un empleado común con información sobre los salarios de los altos ejecutivos, ya que los datos están mezclados en matrices de pesos generales.
RAG (Generación Aumentada por Recuperación) separa la inteligencia computacional y el almacenamiento de datos: el LLM permanece como un "procesador de razonamiento" imparcial, mientras que todo el conocimiento se almacena en una base de datos externa bajo un estricto control ingenieril.
2. Taxonomía arquitectónica y modelo mental
La evolución de la arquitectura RAG se clasifica en tres generaciones:
- 1. RAG Naive: Pipeline lineal: Chunking -> Embedding -> Vector DB -> Top-K Nearest Neighbors -> Prompt Context. Tiene un alto nivel de ruido, es ciego a coincidencias exactas y sufre de alucinaciones con cortes de texto fallidos.
- 2. RAG Avanzado:
Incluye etapas antes y después de la recuperación:
- Pre-Retrieval: expansión de consultas (Query Expansion), generación de respuestas hipotéticas (HyDE) y enrutamiento a diferentes bases de conocimiento.
- Retrieval: búsqueda híbrida (BM25 + HNSW-vectores).
- Post-Retrieval: filtrado por metadatos, compresión de contexto y re-ranking con cross-encoder.
- 3. RAG Modular y Agente (Modular / Agentic RAG): El agente decide cuándo necesita búsqueda, verifica hechos obtenidos (Self-RAG), ajusta la consulta en caso de falta de datos y utiliza índices gráficos (GraphRAG) para descubrir complejas relaciones intersubjetivas.
3. Pipeline técnico y mecánica interna
El ciclo completo del sistema de producción RAG consta de dos contornos:
Contorno de indexación (Offline Ingestion Pipeline):
- Parsing & Clean: Extracción de texto de PDF, Markdown, Notion o SQL, limpieza de marcas.
- Chunking Consciente de Sintaxis: Segmentación por límites lógicos (AST / encabezados) con un buffer de superposición.
- Vectorización e Indexación: Generación de vectores de embeddings y almacenamiento en la base de datos vectorial con metadatos de acceso.
Contorno de consulta (Online Query Pipeline):
- Transformación de Consulta: Conversión de la pregunta del usuario en una consulta de búsqueda optimizada.
- Recuperación Híbrida: Recuperación simultánea de candidatos a través de vectores e índice de texto completo BM25.
- Re-ranking: Un modelo re-ranker (Cross-Encoder) clasifica los 30 fragmentos encontrados y deja los 5 más relevantes.
- Generación Fundamentada: El LLM recibe un prompt estricto con los fragmentos insertados y forma una respuesta precisa con la obligación de citar las fuentes.
4. Escenarios prácticos de ingeniería en producción
01. Asistente corporativo con separación de derechos (RBAC)
La consulta del usuario viene acompañada de su token JWT. La base de datos vectorial filtra documentos en la etapa de pre-filtrado: WHERE team_id = 'engineering' AND access_level <= user.level. El modelo no recibe físicamente información en el contexto a la que el usuario no tiene acceso.
02. Documentación técnica para ingenieros con enlaces directos
El desarrollador pregunta: “¿cómo configurar la replicación de SQLite?”. RAG devuelve la secuencia exacta de pasos con marcas [fuente: docs/replication.md#L45], permitiendo al ingeniero acceder al código fuente con un solo clic.
03. Auditoría de cumplimiento automatizada de contratos legales
El sistema revisa un contrato de 100 páginas contra el registro de políticas corporativas, extrayendo solo los puntos relevantes sobre fuerza mayor y penalizaciones.
5. Errores comunes, trampas y seguridad
- Envenenamiento de la base de conocimiento (RAG Poisoning): Un atacante carga un archivo en la base de datos interna con instrucciones ocultas (Prompt Injection), que obliga a RAG a emitir instrucciones erróneas a todos los usuarios. Verifique las fuentes de conocimiento y utilice barandillas de seguridad (Guardrails).
- Basura en la entrada — basura en la salida (Garbage In, Garbage Out): Si ha cargado en RAG un PDF mal escaneado con muchas palabras cortadas, ningún modelo podrá proporcionar una respuesta adecuada.
- Pérdida de conexión entre fragmentos: El uso de segmentaciones demasiado finas priva a las oraciones de contexto. Siempre enriquezca los fragmentos con los encabezados de las secciones parentales.
FAQ: RAG (Generación Aumentada por Recuperación)
Términos relacionados
Bases de Datos Vectoriales (Vector DBs & Búsqueda ANN)
Sistemas de gestión de bases de datos especializados y extensiones (Qdrant, pgvector, Milvus, Chroma, Turso), optimizados para almacenar millones de vectores multidimensionales y realizar búsquedas aproximadas de vecinos más cercanos (Approximate Nearest Neighbors) de manera ultrarrápida.
Vector Embeddings (Dense Embeddings)
Proyección matemática de texto, código o datos multimodales en un vector numérico denso y multidimensional, donde el ángulo y la geometría entre las coordenadas reflejan su afinidad semántica.
Estrategias de Chunking de Documentos
Metodología de descomposición de documentos masivos y bases de código en fragmentos informativamente autosuficientes (chunks) para la generación de vector embeddings y búsqueda precisa en sistemas RAG.
Búsqueda Híbrida (Dense + Sparse Search)
La arquitectura de recuperación en sistemas RAG modernos que combina la búsqueda semántica vectorial (Dense Embeddings) con la indexación de texto completo basada en palabras clave (Sparse / BM25) a través de algoritmos de fusión de rangos (RRF).