Tamaño de la Ventana de Contexto (Memoria de la Conversación Actual)
El volumen máximo de texto (en tokens) que un modelo de lenguaje puede mantener en memoria durante una conversación actual. Define la longitud de los documentos que se pueden cargar a la vez sin pérdida de contenido.
1. Visión general del concepto y problema sistémico
Imagina que estás leyendo un libro, pero tu memoria está configurada de tal manera que solo recuerdas las últimas 30 páginas que acabas de leer. En el momento en que pasas a la página 31, los eventos de la página 1 se borran de tu mente de forma irreversible.
Así es como funciona la ventana de contexto (Context Window) de un modelo de lenguaje. Esta es su memoria de trabajo operativa.
Todo lo que entra en la ventana de contexto:
- Instrucción del sistema ("Eres un tutor experimentado").
- Todo el historial de conversación anterior en este chat específico.
- El texto de todos los archivos que has cargado.
- Tu nueva pregunta actual.
Si la suma de todos estos elementos supera el límite del modelo, los datos antiguos comienzan a "ser cortados".
2. Taxonomía arquitectónica y modelo mental
┌─────────────────────────────────────────────────────────────┐
│ EVOLUCIÓN DEL TAMAÑO DE LA VENTANA DE CONTEXTO │
├─────────────────────────────────────────────────────────────┤
│ 📜 2022 (GPT-3.5): │
│ [4,000 tokens] ➔ ~10 páginas de texto │
├─────────────────────────────────────────────────────────────┤
│ 📖 2023 (GPT-4 Turbo): │
│ [128,000 tokens] ➔ ~300 páginas (un libro grueso) │
├─────────────────────────────────────────────────────────────┤
│ 📚 2024–2026 (Claude 3.5 Sonnet): │
│ [200,000 tokens] ➔ ~500 páginas o todo el código del proyecto │
├─────────────────────────────────────────────────────────────┤
│ 🏛️ Google Gemini 1.5 Pro: │
│ [2,000,000 tokens] ➔ Biblioteca de 35 libros o 1 hora de video │
└─────────────────────────────────────────────────────────────┘
3. Por qué la conversación en un solo chat se vuelve "más tonta" con el tiempo (Context Rot)
Muchos principiantes cometen un error típico: mantienen un mismo diálogo interminable durante meses, haciendo preguntas sobre el clima, recetas, correcciones de código y planes de vacaciones.
Con el tiempo, tal chat acumula decenas de miles de tokens de basura antigua e innecesaria. El modelo comienza a:
- Responder más lentamente.
- Confundirse en sus propias instrucciones.
- Gastar significativamente más dinero por cada nueva palabra.
4. Regla de oro de la higiene del contexto
¡Una tarea — un nuevo chat!
Una vez que hayas terminado de trabajar en un tema específico (por ejemplo, escribir un artículo o corregir un error en un script) — abre un nuevo chat limpio. Esto actualizará la memoria operativa del modelo, ahorrará tu presupuesto y garantizará la más alta calidad de respuestas sin residuos de basura antigua.
FAQ: Tamaño de la Ventana de Contexto (Memoria de la Conversación Actual)
Términos relacionados
Ventana de Contexto (Context Window)
El volumen máximo de tokens que un modelo de lenguaje puede mantener simultáneamente en el mecanismo de Self-Attention y en la memoria KV Cache durante el cálculo de una única solicitud de inferencia.
Tokens Explicados (Cuántas Palabras en un Token)
Unidad básica de medida de texto en modelos de lenguaje. Explicación de cómo las palabras se dividen en tokens, cómo esto afecta el costo de las consultas y por qué las palabras en ucraniano consumen más tokens que las palabras en inglés.
Desbordamiento y Compresión de la Ventana de Contexto
Patrones de ingeniería para prevenir fallos fatales al alcanzar el límite de contexto: Resúmenes Deslizantes (Rolling Summaries), Compresión de Estados y Desalojo Selectivo de Historia Obsoleta.