TTFT vs TPS (Métricas de Latencia de Inferencia)
Dos métricas clave de rendimiento de inferencia: Time To First Token (latencia de inicio de respuesta) y Tokens Per Second (capacidad de generación de código).
1. Visión general del concepto y problema sistémico
Al evaluar el rendimiento de un modelo de inteligencia artificial, los desarrolladores a menudo se fijan en una cifra general de velocidad: "Genera rápido". Sin embargo, en producción, la latencia se divide en dos fases de hardware completamente diferentes:
- Fase de Pre-fill (Procesamiento del contexto): El modelo debe "leer" un prompt de entrada de 50,000 tokens de código. Esta es una operación intensiva en cómputo (Compute-Bound), que determina el TTFT (Time To First Token).
- Fase de Decode (Generación de respuesta): El modelo escribe nuevo código token por token de manera secuencial. Esta es una operación limitada por el ancho de banda de memoria (Memory-Bound), que determina el TPS (Tokens Per Second).
2. Taxonomía arquitectónica y modelo mental
[ EL USUARIO ENVÍA UNA SOLICITUD ]
│
▼
┌───────────────────────────────────────────────────────────────────────┐
│ 1. FASE DE PREFILL (Procesamiento paralelo de todo el prompt de entrada)│
│ • GPU FLOPs utilizados al 100% │
│ • Tiempo hasta el primer símbolo: ➔ [ TTFT = 420 ms ] │
└───────────────────────────────────┬───────────────────────────────────┘
│
▼
┌───────────────────────────────────────────────────────────────────────┐
│ 2. FASE DE DECODE (Generación secuencial token por token) │
│ • Ancho de banda de memoria utilizado al 100% │
│ • Velocidad de streaming: ➔ [ TPS = 85 tokens/seg ] │
└───────────────────────────────────┬───────────────────────────────────┘
│
▼
[ RESPUESTA COMPLETA FINALIZADA ]
3. Pipeline técnico y mecánica interna
01. Optimización de un asistente interactivo en IDE
El desarrollador espera sugerencias de código en tiempo real (Inline Completion). Si el TTFT supera los 300 ms, el desarrollador comenzará a escribir por su cuenta, y la sugerencia se vuelve inútil. Para este rol, se eligen modelos con TTFT mínimo (Gemini Flash o modelos locales de 3B).
02. Selección de proveedor para refactorización de la base de código
Para la tarea de escribir 500 líneas de código en segundo plano, un modelo con TTFT = 5 segundos, pero TPS = 120 tokens/seg, completará la tarea en 9 segundos, mientras que un modelo con inicio instantáneo (TTFT = 0.2s), pero TPS lento = 25 tokens/seg, requerirá 20 segundos.
4. Errores comunes, trampas y seguridad
- TPS promedio engañoso: Los proveedores a menudo publicitan un TPS máximo para respuestas cortas. A medida que el texto de salida se vuelve más largo (el KV Cache crece), el TPS puede caer un 30-40%.
- Impacto de la cola (Queue Latency): Si el servidor está sobrecargado de solicitudes, un TTFT alto puede ser causado no por la lentitud del modelo, sino porque la solicitud estuvo 2 segundos en la cola del planificador. Siempre separe el Queue Time del tiempo puro de GPU Prefill.
5. Estrategia de conclusión para el ingeniero de 2026
TTFT y TPS son coordenadas de ingeniería para la arquitectura de selección de modelos. Comprender la diferencia entre las fases de Prefill y Decode permite construir sistemas que se sientan instantáneos para el usuario en la interfaz y que proporcionen la máxima velocidad de generación para agentes autónomos.
FAQ: TTFT vs TPS (Métricas de Latencia de Inferencia)
Términos relacionados
Velocidad de Generación (TPS / TTFT / Latencia)
Métricas clave de rendimiento de modelos de lenguaje: Time to First Token (tiempo de reacción al contexto de entrada) y Tokens Per Second (velocidad de generación de texto de salida en streaming).
vLLM (Motor de Inferencia de Alto Rendimiento)
Servidor de inferencia y servicio LLM de código abierto líder que ha revolucionado el rendimiento gracias al algoritmo de virtualización de memoria PagedAttention y el batching continuo.
Gemini Flash & Pro (Google Gemini)
Familia de modelos multimodales de Google DeepMind que combina una ventana de contexto récord (hasta 2 millones de tokens), velocidad de generación extrema (más de 150 tokens/s) y percepción nativa de video y audio.
Parámetros de Muestreo (Temperature, Top-p, Min-p)
Hiperparámetros matemáticos del decodificador estocástico (Temperature, Top-P, Min-P, Penalties) que controlan la distribución de probabilidades para seleccionar el siguiente token, determinando el nivel de determinismo, precisión y creatividad del modelo.