Skip to main content

Límites de Tasa y Error 429 (Too Many Requests)

Restricciones de los proveedores sobre la velocidad y cantidad de solicitudes a los modelos (RPM — solicitudes por minuto, TPM — tokens por minuto). Explicación de las causas del error 429 y estrategias para sortearlo.

1. Visión general del concepto y problema sistémico

Cualquiera que use activamente inteligencia artificial, tarde o temprano, ha visto el mensaje de error en rojo:

  • En el chat: “Has enviado demasiados mensajes. Intenta de nuevo en 2 horas.”
  • En el código o editor Cursor: “Error 429: Too Many Requests.”

Límites de Tasa (Rate Limits) son las reglas de tráfico para los servidores de inteligencia artificial. Dado que los centros de datos tienen una cantidad limitada de tarjetas gráficas físicas, los proveedores establecen "contadores" para que una persona o un script colgado no puedan acaparar toda la potencia de cálculo del servidor, dejando a otros sin acceso.

Para un principiante, entender los límites de tasa es saber cómo organizar el trabajo sin paradas y bloqueos incómodos.

2. Taxonomía arquitectónica y modelo mental

Cuando creas una nueva cuenta de pago en OpenAI o Anthropic, no se te confía de inmediato una gran potencia:

┌─────────────────────────────────────────────────────────────┐
│                 NIVELES DE CONFIANZA DE CUENTAS (TIERS)   │
├─────────────────────────────────────────────────────────────┤
│ 🥉 Tier 1 (Principiante, pago desde $5):                   │
│    • Límite: ~500 solicitudes por día / 30,000 tokens/min    │
│    • Fácilmente puedes alcanzar el límite al analizar archivos grandes │
├─────────────────────────────────────────────────────────────┤
│ 🥈 Tier 2 (Usuario Activo, pago desde $50):                 │
│    • Los límites aumentan 5 veces                            │
│    • Suficiente para el trabajo regular de todo un equipo    │
├─────────────────────────────────────────────────────────────┤
│ 🥇 Tier 3–5 (Producción / Corporaciones):                   │
│    • Millones de tokens por minuto, tráfico prioritario      │
└─────────────────────────────────────────────────────────────┘

3. Pipeline técnico y mecánica interna

01. Cambia a modelos más ligeros (Mini / Flash)

Si ves una advertencia sobre el límite de mensajes en ChatGPT, cambia el menú desplegable a GPT-4o mini o en Claude a Haiku: los modelos ligeros tienen cuotas de 5 a 10 veces mayores o no tienen límite para tareas simples.

02. Usa OpenRouter como un aeropuerto alternativo

Si tienes trabajo importante en Cursor o en tu propia aplicación, conecta el gateway OpenRouter: si se agota el límite en OpenAI, el sistema redirigirá automáticamente la siguiente solicitud a través de Google Gemini o DeepSeek en una fracción de segundo.

03. Divide documentos grandes

No intentes enviar 10 archivos diferentes en una sola solicitud. Envíalos secuencialmente uno por uno con una pausa de unos segundos, para que el contador de tokens por minuto (TPM) pueda reiniciarse.

4. Escenarios prácticos de ingeniería en producción

01. Manejo de errores en producción

Implementa un sistema de manejo de errores que registre y notifique a los desarrolladores cuando se alcance el límite de tasa, permitiendo ajustes en tiempo real.

02. Optimización de solicitudes API

Desarrolla un algoritmo que agrupe solicitudes similares para reducir la cantidad de llamadas a la API, maximizando el uso de los límites de tasa disponibles.

03. Monitoreo de uso de tokens

Implementa un sistema de monitoreo que rastree el uso de tokens en tiempo real, alertando a los usuarios antes de alcanzar los límites establecidos.

5. Errores comunes, trampas y seguridad

Evita la sobrecarga de solicitudes simultáneas, ya que esto puede llevar a bloqueos temporales de la cuenta. Asegúrate de implementar un manejo adecuado de errores para el código que interactúa con APIs, utilizando la estrategia de Exponential Backoff para reintentos. Además, mantén un registro de las cuotas de uso para evitar sorpresas y planificar el crecimiento de la aplicación.

/ Preguntas frecuentesSchema.org FAQPage

FAQ: Límites de Tasa y Error 429 (Too Many Requests)

Significa que has agotado la cuota temporal de mensajes para el modelo actual (por ejemplo, 40 mensajes en 3 horas para el modelo insignia GPT-4o). El sistema protege sus servidores de sobrecargas y sugiere esperar o cambiar temporalmente a un modelo más ligero como Mini.
/ Enlaces internos
Todos los términos