Skip to main content

Caché de Prompts (Prompt Caching & Reutilización de KV Cache)

Tecnología de motores de inferencia modernos y APIs en la nube (Anthropic, OpenAI, DeepSeek, vLLM) que almacena matrices de atención precomputadas (KV Cache) de un prefijo estático, reduciendo el costo de procesamiento en un 80-90% y acortando el tiempo hasta el primer token (TTFT) de 4 a 8 veces.

1. Visión general del concepto y problema sistémico

En el desarrollo moderno utilizando agentes (por ejemplo, Claude Code o Cursor), cada diálogo consta de decenas de iteraciones. En este contexto, el 90-95% de la información en cada solicitud es completamente estática:

  • Prompt del sistema con reglas del proyecto (5,000 tokens).
  • Esquemas de 20 herramientas MCP conectadas (10,000 tokens).
  • Archivos documentales y de código indexados (40,000 tokens).

Sin caché, en cada réplica del desarrollador, el servidor debe volver a procesar los 55,000 tokens estáticos a través de las matrices del transformador (Prefill Phase):

  1. Alto costo financiero: Se paga el precio completo por leer los mismos 55,000 tokens 30 veces por sesión.
  2. Alta latencia (High TTFT): El tiempo hasta el primer carácter de la respuesta se extiende de 5 a 10 segundos, arruinando la sensación de codificación interactiva.
  3. Desperdicio de recursos GPU: La potencia de cálculo de las tarjetas gráficas se consume en la repetición de cálculos deterministas.

Prompt Caching elimina esta sobrecarga: el servidor calcula una vez el estado de atención para el prefijo estático, lo almacena en memoria HBM ultrarrápida y lo recupera instantáneamente en las siguientes invocaciones.

2. Taxonomía arquitectónica y modelo mental

La arquitectura de caché de prompts se construye en torno a las siguientes capas conceptuales:

  • 1. Estructura de prefijos (Prefix Hierarchy): El prompt se proyecta como una matrioska desde lo más estático hasta lo más dinámico: [Static System Prompt] -> [MCP Tool Definitions] -> [Cached Project Context] -> [Dynamic Turn History] -> [User Input].
  • 2. Economía de estados de caché:
    • Cache Write: primera invocación o escritura tras un cambio de prefijo. Cuesta un 25% más que la entrada estándar, ya que requiere fijar el estado en memoria.
    • Cache Hit / Read: invocación repetida a un prefijo inalterado. Ofrece un descuento del 80-90% del costo base de los tokens de entrada.
  • 3. Puntos de guardado (Breakpoints): Marcadores específicos en la estructura de la solicitud que informan al motor de inferencia dónde termina el bloque estable que debe ser almacenado.
  • 4. Mecanismos de búsqueda de caché:
    • Radix Tree / Prefix Trie: estructura de datos en la memoria del servidor de inferencia (por ejemplo, en vLLM / SGLang) que encuentra instantáneamente la cadena común más larga de tokens entre sesiones activas.

3. Pipeline técnico y mecánica interna

El ciclo de vida de una solicitud utilizando Prompt Caching:

  1. Serialization & Hash Verification (Verificación de Hash del Prefijo): El cliente envía un array de mensajes. El servidor toma la secuencia de tokens desde el inicio hasta el primer punto cache_control y calcula un hash criptográfico del prefijo.
  2. Trie Lookup (Búsqueda en el Árbol de Cachés): El gestor de memoria GPU verifica si hay un bloque KV-cache activo para este hash.
    • Si se encuentra (Cache Hit) — se omite el cálculo de Prefill, las matrices almacenadas $K$ y $V$ se conectan instantáneamente al gráfico computacional.
    • Si no se encuentra (Cache Miss) — el servidor realiza el cálculo completo y escribe el resultado de forma asíncrona en el búfer.
  3. Dynamic Suffix Processing (Procesamiento de Sufijos): El transformador calcula la atención exclusivamente para el nuevo fragmento — el último mensaje del usuario (por ejemplo, 200 tokens en lugar de 50,000).
  4. Immediate Decoding & TTL Refresh (Generación): El modelo comienza a generar la respuesta en 200-400 milisegundos, y el temporizador de vida del caché se reinicia a un nuevo intervalo de 5 minutos.

4. Escenarios prácticos de ingeniería en producción

01. Sesiones de desarrollo de múltiples pasos en Claude Code y Cursor

El agente realiza un complejo refactorización de 15 pasos. Gracias al caché, la base de código del proyecto (100,000 tokens) se almacena en el paso 1. En los pasos 2-15, el usuario solo paga por la delta de cambios, ahorrando hasta un 85% del costo total de desarrollo por la noche.

02. Caché de grandes bibliotecas de herramientas MCP

La conexión de 30 herramientas corporativas complejas requiere esquemas JSON detallados que ocupan 12,000 tokens. El caché de bloques de herramientas garantiza que el desarrollador no pague de más por su descripción en cada pregunta trivial en el chat.

03. Asistentes corporativos de alta carga con base de conocimientos

Un chatbot de soporte interno utiliza un único documento del sistema almacenado en caché (reglamentos, instrucciones, FAQ) de 50,000 tokens. Miles de empleados envían solicitudes simultáneamente, accediendo a la misma capa de caché en un clúster de modelos, asegurando un tiempo de respuesta mínimo.

5. Errores comunes, trampas y seguridad

  • Filtración de datos dinámicos en el prefijo (Timestamp Invalidation): El error de ingeniería más común es agregar una cadena dinámica como Current Time: 2026-09-09 12:15:30 al inicio del prompt del sistema. Esto cambia los primeros tokens cada segundo y rompe el caché para todos los módulos siguientes. Mantenga las variables dinámicas en los mensajes finales.
  • Arranque en frío tras inactividad: Si entre los pasos del desarrollador han pasado más de 5 minutos, el caché se evapora. La siguiente solicitud se paga nuevamente al precio de Cache Write con un retraso en la inicialización.
  • Mezcla de derechos de acceso (Multi-Tenant Cache Bleed): En servidores autoalojados (vLLM), asegúrese de que las sesiones de diferentes usuarios no utilicen un prefijo compartido con datos personales confidenciales.
/ Preguntas frecuentesSchema.org FAQPage

FAQ: Caché de Prompts (Prompt Caching & Reutilización de KV Cache)

El caché funciona bajo el principio de coincidencia exacta del prefijo más largo (Exact-Prefix Matching). La codificación posicional (RoPE) vincula cada token a su posición absoluta. Cualquier cambio al inicio de la secuencia altera las coordenadas de todos los tokens subsiguientes, haciendo que las matrices de claves y valores almacenadas (KV Cache) sean inutilizables.
/ Enlaces internos
Todos los términos