Skip to main content

Arquitectura y Economía del Caching de Prompts

Metodología de diseño de prompts enfocada en maximizar la inclusión en el caché de hardware de prefijos (Prefix Caching) en Anthropic, OpenAI y DeepSeek para un 90% de descuento en costos y un 80% de aceleración.

1. Visión general del concepto y problema sistémico

En la era de los agentes autónomos, la interacción con el modelo es un proceso de múltiples pasos:

  • Paso 1: Enviar 80k tokens de código + pregunta.
  • Paso 2: Recibir respuesta + llamar a herramienta + enviar resultado de la herramienta (nuevamente 80k tokens de código + nuevo contexto).
  • Hasta el décimo paso, el desarrollador paga por volver a leer los mismos 80k tokens 10 veces consecutivas.
  • Sin caching, la sesión cuesta $2.50. Con caching — $0.28.

Prompt Caching Economics es una nueva disciplina de ingeniería: diseñar la estructura del diálogo de tal manera que los datos estáticos nunca se vuelvan a calcular en la GPU.

2. Taxonomía arquitectónica y modelo mental

┌─────────────────────────────────────────────────────────────┐
│                 REGLAS DE PREFIJOS DE CACHING DE PROMPTS   │
├─────────────────────────────────────────────────────────────┤
│ 1. PREFIJO ESTÁTICO CACHEABLE (Debe ser 100% idéntico):    │
│    ┌─────────────────────────────────────────────────────┐  │
│    │ • Prompts del Sistema Base & Reglas Estrictas de Agente │  │
│    │ • Esquemas de Proyecto & Definiciones de TypeScript     │  │
│    │ • Documentación Central Inmutable & Especificaciones de Herramientas │  │
│    └─────────────────────────────────────────────────────┘  │
│    ➔ HIT: 90% DESCUENTO & 4x VELOCIDAD DE PREFILL MÁS RÁPIDA │
├─────────────────────────────────────────────────────────────┤
│                          │                                  │
│                          ▼ El Límite de Adición Dinámica     │
├─────────────────────────────────────────────────────────────┤
│ 2. SUFIJO DINÁMICO VOLÁTIL (Se añade exclusivamente al final):│
│    • Consulta actual del usuario & giros de conversación      │
│    • Salidas de herramientas dinámicas & registros de errores en tiempo de ejecución │
│    • Timestamps & IDs efímeros                             │
└─────────────────────────────────────────────────────────────┘

3. Pipeline técnico y mecánica interna

01. Correcta colocación de metadatos dinámicos

Antipatrones (Muerte del caché):

[Prompt del Sistema] Hoy: 2026-09-09 13:42:15. Tu tarea es codificar...

(Cada segundo cambia la hora, el caché se reinicia el 100% de las veces).

Patrón correcto (Caché eterno): La hora y las variables se transmiten en el último mensaje del usuario:

[Prompt del Sistema Estático - 40k tokens] (CACHED)
[Mensaje del Usuario] [Timestamp: 13:42:15] Añade un nuevo botón en el encabezado.

02. Uso de puntos de ruptura de caché (Cache Breakpoints en Anthropic)

Instrucción del encabezado cache_control: {"type": "ephemeral"} en un bloque masivo de documentación:

const messages = [
  {
    role: "system",
    content: [
      {
        type: "text",
        text: massiveCodebaseSnapshot,
        cache_control: { type: "ephemeral" }
      }
    ]
  },
  { role: "user", content: "Corrige el error en el enrutador" }
];

4. Escenarios prácticos de ingeniería en producción

01. Correcta colocación de metadatos dinámicos

Antipatrones (Muerte del caché):

[Prompt del Sistema] Hoy: 2026-09-09 13:42:15. Tu tarea es codificar...

(Cada segundo cambia la hora, el caché se reinicia el 100% de las veces).

Patrón correcto (Caché eterno): La hora y las variables se transmiten en el último mensaje del usuario:

[Prompt del Sistema Estático - 40k tokens] (CACHED)
[Mensaje del Usuario] [Timestamp: 13:42:15] Añade un nuevo botón en el encabezado.

02. Uso de puntos de ruptura de caché (Cache Breakpoints en Anthropic)

Instrucción del encabezado cache_control: {"type": "ephemeral"} en un bloque masivo de documentación:

const messages = [
  {
    role: "system",
    content: [
      {
        type: "text",
        text: massiveCodebaseSnapshot,
        cache_control: { type: "ephemeral" }
      }
    ]
  },
  { role: "user", content: "Corrige el error en el enrutador" }
];

5. Errores comunes, trampas y seguridad

  • Prefijo demasiado corto: La mayoría de los proveedores requieren un tamaño mínimo de texto para el caching (por ejemplo, al menos 1024 tokens en Anthropic o 2048 en DeepSeek). Caching un prompt corto de 100 tokens es inútil.
  • Costo de primer pedido en frío (Cold Start Cost): El primer pedido con un nuevo prefijo cuesta un 25% más que un token de entrada normal (Cargo por escritura en caché). El ahorro comienza con el segundo y siguientes pedidos.

6. Conclusión estratégica para el ingeniero de 2026

El caching de prompts ha cambiado el modelo financiero de la inteligencia artificial. Una estructura de prefijos bien organizada permite mantener contextos de código enormes a un costo accesible incluso para proyectos open-source no comerciales.

/ Preguntas frecuentesSchema.org FAQPage

FAQ: Arquitectura y Economía del Caching de Prompts

En Anthropic y DeepSeek, la lectura desde el caché (Cache Read) cuesta un 90% menos que un token de entrada estándar ($0.30 en lugar de $3.00 por millón de tokens). Para sesiones de agentes prolongadas con múltiples pasos, esto reduce las facturas mensuales de 4 a 8 veces.
/ Enlaces internos
Todos los términos