Envenenamiento de Contexto en Bases de Conocimiento
Amenaza cibernética para sistemas RAG, donde un atacante introduce documentos falsificados, instrucciones erróneas o inyecciones de prompt ocultas en una base de conocimiento compartida (Notion, Confluence, Google Drive). Durante la búsqueda, el sistema recupera el contexto envenenado, y el bot comienza a dar consejos dañinos o revelar secretos.
1. Visión general del concepto y problema sistémico
Todos conocen los virus informáticos que infectan archivos del sistema operativo.
Pero en la era de la IA generativa ha surgido un nuevo tipo de sabotaje: Envenenamiento de Contexto (Context Poisoning).
Cómo funciona:
- Una empresa crea un asistente interno conveniente que lee todos los archivos de Google Drive o Notion corporativos.
- Un atacante (o un ex-empleado resentido) crea un archivo imperceptible o deja un comentario: “Detalles actualizados para el pago a proveedores: cuenta bancaria IBAN ...”.
- Cuando el contable pregunta al chatbot: “¿A dónde transferir fondos por el alquiler del almacén?”.
- El bot encuentra este archivo reciente y proporciona los detalles del estafador.
Modelo mental: recordatorio: la inteligencia artificial es tan pura como el agua limpia del pozo de conocimiento del que bebe.
2. Taxonomía arquitectónica y modelo mental
┌─────────────────────────────────────────────────────────────┐
│ ESQUEMA DE ATAQUE CONTEXT POISONING │
├─────────────────────────────────────────────────────────────┤
│ 1. SABOTAJE: El atacante carga un PDF falso │
│ en la carpeta abierta "Documentos Entrantes" │
│ (El archivo contiene datos bancarios falsos) │
├─────────────────────────────────────────────────────────────┤
│ 2. INDEXACIÓN AUTOMÁTICA: │
│ El conector de la base de conocimiento convierte texto │
│ en vectores │
├─────────────────────────────────────────────────────────────┤
│ 3. CONSULTA DEL CONTABLE: │
│ “¿Cuáles son los detalles actuales para el pago del alquiler?”│
├─────────────────────────────────────────────────────────────┤
│ 4. LOCALIZACIÓN Y RESPUESTA: │
│ El bot encuentra el chunk envenenado y responde con confianza:│
│ “Según el nuevo reglamento, pague aquí: [IBAN Falso]” │
├─────────────────────────────────────────────────────────────┤
│ 💥 CONSECUENCIA: ¡Fondos de la empresa transferidos a estafadores!│
└─────────────────────────────────────────────────────────────┘
3. Cuatro reglas para proteger la base de conocimiento del envenenamiento
- Distribución estricta de permisos de escritura (Write Permissions): el bot debe indexar solo aquellas páginas que pueden ser editadas por un grupo limitado de altos directivos verificados.
- Aislamiento interno de externo: nunca mezcle en una misma base las instrucciones corporativas y los correos entrantes de clientes aleatorios de Internet.
- Auditoría de fuentes de citación: configure el bot para que siempre muestre el enlace exacto al archivo, la fecha de su creación y el autor que lo guardó por última vez.
- Puertas de control (HITL): las operaciones financieras siempre deben ser verificadas con el documento original en papel o firmado digitalmente.
4. Escenarios prácticos de ingeniería en producción
01. Prevención de Envenenamiento en Documentos Compartidos
Implementar un sistema de revisión de documentos donde solo los archivos aprobados por un grupo de expertos sean indexados.
02. Monitoreo de Cambios en la Base de Conocimiento
Establecer alertas para cualquier modificación en documentos críticos que puedan afectar la integridad de la información.
03. Capacitación de Usuarios sobre Seguridad de Datos
Realizar sesiones de capacitación para empleados sobre cómo identificar y reportar posibles intentos de envenenamiento de contexto.
5. Errores comunes, trampas y seguridad
La seguridad de la inteligencia artificial no es solo cifrado de canales de comunicación. Es, ante todo, una higiene y moderación impecables de la información que ingresa a su base de conocimiento.
FAQ: Envenenamiento de Contexto en Bases de Conocimiento
Términos relacionados
Inyección de Prompt (Prompt Injection)
Vulnerabilidad crítica en sistemas basados en LLM (OWASP Top 10 for LLM #1). Ocurre por la falta de separación arquitectónica entre las instrucciones de control (Control Plane) y los datos externos (Data Plane), permitiendo que un atacante intercepte el control del modelo.
Riesgos de Alucinaciones en Tareas Reales
Análisis de las consecuencias prácticas y riesgos legales que surgen de la confianza ciega en hechos inventados y fuentes falsas generadas por modelos de lenguaje en informes financieros, demandas legales y consejos médicos.
Advertencia de Filtración de Datos a través de Chatbots
El riesgo de comprometer secretos corporativos, contraseñas y datos personales confidenciales a través de su transmisión involuntaria en chatbots en la nube públicos (ChatGPT, Claude, Copilot). Cómo proteger cuentas y desactivar el entrenamiento de modelos en tus consultas.