Skip to main content

Puertas de Enlace LLM y Enrutamiento (LiteLLM y Portkey)

Proxies de ingeniería centralizados para gestionar una flota de modelos: conmutación automática entre proveedores (Anthropic/OpenAI/Groq), almacenamiento en caché semántico de respuestas y cuotas presupuestarias.

1. Visión general del concepto y problema sistémico

Cuando una empresa crea decenas de diferentes servicios basados en inteligencia artificial, sin un centro de gestión único, se produce un desorden infraestructural:

  • Cada repositorio tiene su propia clave API, lo que dificulta entender qué equipo está consumiendo más recursos.
  • Cuando Anthropic o OpenAI sufren una falla técnica o superan los límites 429, todos los agentes internos y servicios de la empresa caen repentinamente.
  • La misma pregunta típica se formula al modelo 50 veces al día, consumiendo dinero cada vez por la falta de un caché compartido.

LLM Gateways (LiteLLM y Portkey) actúan como un conmutador inteligente único de tráfico entre las aplicaciones de su empresa y cientos de modelos en la nube y locales.

2. Taxonomía arquitectónica y modelo mental

┌─────────────────────────────────────────────────────────────┐
│                 GATEWAY LLM CENTRALIZADO                    │
├─────────────────────────────────────────────────────────────┤
│ 1. LLAMADAS DE APLICACIÓN ENTRANTES (Todas usan la API estándar de OpenAI) │
│    • Cursor IDE, Bots Internos, Aplicaciones de Clientes    │
├─────────────────────────────────────────────────────────────┤
│                          │                                  │
│                          ▼ NÚCLEO DEL GATEWAY LITELLM / PORTKEY   │
│    ┌─────────────────────────────────────────────────────┐  │
│    │ • Caché Semántica de Redis (Verificar si hay un hit instantáneo)      │  │
│    │ • Rastreador de Gastos (Cuotas presupuestarias de Usuario/Equipo)           │  │
│    │ • Comprobador de Salud y Motor de Conmutación Automática:       │  │
│    │   Intentar: Claude 3.7 ➔ Si 429/500 ➔ Conmutar: DeepSeek-R1 │
│    └─────────────────────────────────────────────────────┘  │
├─────────────────────────────────────────────────────────────┤
│ 2. PROVEEDORES DESCENDENTES:                                    │
│    • Anthropic | OpenAI | Bedrock | vLLM autoalojado en VPS │
└─────────────────────────────────────────────────────────────┘

3. Pipeline técnico y mecánica interna

01. Configuración de enrutamiento a prueba de fallos en LiteLLM

Configuración de conmutación automática en config.yaml:

model_list:
  - model_name: production-coder
    litellm_params:
      model: anthropic/claude-3-7-sonnet
      api_key: os.environ/ANTHROPIC_KEY
  - model_name: production-coder
    litellm_params:
      model: openrouter/deepseek/deepseek-r1
      api_key: os.environ/OPENROUTER_KEY

router_settings:
  routing_strategy: "latency-based-routing"
  fallbacks: [{"production-coder": ["openrouter/deepseek/deepseek-r1"]}]

Si Claude supera la latencia o genera un error, la solicitud se conmutará de manera transparente a DeepSeek.

02. Clave virtual única para empleados

El gateway genera un token virtual separado para cada desarrollador con un saldo de $50 al mes. El desarrollador conecta esta clave en Cursor o Cline, y la empresa ve la analítica de manera centralizada y controla los gastos.

4. Escenarios prácticos de ingeniería en producción

01. Implementación de un sistema de caché semántico

El gateway verifica la similitud semántica de las solicitudes y almacena respuestas comunes, reduciendo costos y mejorando la eficiencia.

02. Monitoreo de salud y conmutación automática

Se implementa un sistema de verificación de salud que permite la conmutación automática a proveedores de respaldo en caso de fallos, garantizando la disponibilidad continua del servicio.

03. Gestión de cuotas presupuestarias

Se establece un sistema de seguimiento de gastos que permite a los equipos gestionar sus cuotas de uso de API, evitando sobrecostos y optimizando el uso de recursos.

5. Errores comunes, trampas y seguridad

  • Gateway como Punto Único de Falla: Si el servidor LiteLLM falla, todos los servicios de la empresa se detendrán. Despliegue el gateway en al menos dos réplicas detrás de un balanceador de carga (Caddy/Traefik).
  • Caché semántico ciego: El almacenamiento en caché semántico es útil para hechos estables, pero peligroso para el código: dos preguntas similares con pequeñas diferencias en el nombre de la variable no deben recibir el mismo código en caché. Ajuste el umbral de similitud no inferior a 0.96.
/ Preguntas frecuentesSchema.org FAQPage

FAQ: Puertas de Enlace LLM y Enrutamiento (LiteLLM y Portkey)

Si un proveedor (por ejemplo, OpenAI) experimenta una falla (Outage) o se alcanza el límite de solicitudes (Rate Limit 429), su aplicación dejará de funcionar por completo. El gateway redirige automáticamente la solicitud a un proveedor de respaldo (Anthropic o DeepSeek) en 50 milisegundos sin error para el cliente.
/ Enlaces internos
Todos los términos