Skip to main content

LLM Gateways & Routing (LiteLLM & Portkey)

Централизованные инженерные прокси для управления флотом моделей: автоматический фолбек между провайдерами (Anthropic/OpenAI/Groq), семантическое кэширование ответов и бюджетные квоты.

1. Обзор концепции и системная проблема

Когда компания создает десятки различных сервисов на базе искусственного интеллекта, без единого центра управления наступает инфраструктурный беспорядок:

  • В каждом репозитории свой собственный API-ключ, из-за чего невозможно понять, какая именно команда тратит больше всего средств.
  • Когда Anthropic или OpenAI переживают технический сбой или превышают лимиты 429, все внутренние агенты и сервисы компании внезапно падают.
  • Одинаковый типовой вопрос задается модели 50 раз в день, каждый раз тратя деньги из-за отсутствия общего кэша.

LLM Gateways (LiteLLM & Portkey) выступают единым разумным коммутатором трафика между приложениями вашей компании и сотнями облачных и локальных моделей.

2. Архитектурная таксономия и ментальная модель

┌─────────────────────────────────────────────────────────────┐
│                 CENTRALIZED LLM GATEWAY                     │
├─────────────────────────────────────────────────────────────┤
│ 1. INCOMING APPLICATION CALLS (All use standard OpenAI API) │
│    • Cursor IDE, Internal Bots, Customer Facing Apps        │
├─────────────────────────────────────────────────────────────┤
│                          │                                  │
│                          ▼ LITELLM / PORTKEY GATEWAY CORE   │
│    ┌─────────────────────────────────────────────────────┐  │
│    │ • Semantic Redis Cache (Check for instant hit)      │  │
│    │ • Spend Tracker (User/Team budget quotas)           │  │
│    │ • Health Checker & Automatic Fallback Engine:       │  │
│    │   Try: Claude 3.7 ➔ If 429/500 ➔ Fallback: DeepSeek-R1 │
│    └─────────────────────────────────────────────────────┘  │
├─────────────────────────────────────────────────────────────┤
│ 2. DOWNSTREAM PROVIDERS:                                    │
│    • Anthropic | OpenAI | Bedrock | Self-hosted vLLM on VPS │
└─────────────────────────────────────────────────────────────┘

3. Технический пайплайн и внутренняя механика

01. Настройка отказоустойчивого роутинга в LiteLLM

Конфигурация автоматического переключения в config.yaml:

model_list:
  - model_name: production-coder
    litellm_params:
      model: anthropic/claude-3-7-sonnet
      api_key: os.environ/ANTHROPIC_KEY
  - model_name: production-coder
    litellm_params:
      model: openrouter/deepseek/deepseek-r1
      api_key: os.environ/OPENROUTER_KEY

router_settings:
  routing_strategy: "latency-based-routing"
  fallbacks: [{"production-coder": ["openrouter/deepseek/deepseek-r1"]}]

Если Claude превышает задержку или выдает ошибку, запрос прозрачно переключается на DeepSeek.

02. Единый виртуальный ключ для сотрудников

Шлюз генерирует каждому разработчику отдельный виртуальный токен с балансом $50 на месяц. Разработчик подключает этот ключ в Cursor или Cline, а компания централизованно видит аналитику и контролирует расходы.

4. Подводные камни, типовые ошибки и безопасность

  • Шлюз как Single Point of Failure: Если сам сервер LiteLLM упадет, остановятся все сервисы компании. Разворачивайте шлюз как минимум в двух репликах за балансировщиком нагрузки (Caddy/Traefik).
  • Слепое семантическое кэширование: Семантическое кэширование полезно для стабильных фактов, но опасно для кода: два похожих вопроса с мелкой разницей в названии переменной не должны получать одинаковый кэшированный код. Настраивайте порог сходства не ниже 0.96.

5. Стратегический вывод для инженера 2026 года

LLM Gateways — это обязательный слой зрелой архитектуры. Отделение логики приложения от конкретных вендоров моделей обеспечивает непрерывную доступность сервисов, контроль бюджета и свободу переключения на лучшие модели рынка за считанные секунды.

/ Частые вопросыSchema.org FAQPage

FAQ: LLM Gateways & Routing (LiteLLM & Portkey)

Если у поставщика (например, OpenAI) произойдет сбой (Outage) или закончится лимит запросов (Rate Limit 429), ваше приложение полностью перестанет работать. Шлюз автоматически перенаправит запрос на резервного провайдера (Anthropic или DeepSeek) за 50 миллисекунд без ошибки для клиента.
/ Внутренняя перелинковка
Все термины
Модели и Инференс

OpenRouter (Унифицированный API-шлюз моделей)

Унифицированный шлюз искусственного интеллекта, предоставляющий стандартизированный доступ к сотням закрытых и открытых языковых моделей от десятков провайдеров через единый баланс, единый API-ключ и механизм автоматического отказоустойчивого переключения (Fallback).

Читать термин
VPS и DevOps

Rate Limiting (Ограничение частоты запросов и защита API)

Системный механизм контроля интенсивности входящего и исходящего трафика (Token Bucket, Sliding Window) для защиты бэкенда от исчерпания ресурсов, брутфорса, Layer 7 DDoS и финансового овердрафта на AI-эндпоинтах.

Читать термин
Вайбкодинг и IDE

Бюджетирование Токенов и Управление Расходами

Система финансового менеджмента, устанавливающая жесткие лимиты на расходы токенов (Hard Limits) и оптимизацию стоимости одного успешного задания при работе с ИИ-моделями.

Читать термин
VPS и DevOps

Disaster Recovery (Восстановление после катастрофы и резервное копирование)

Комплексная инженерная методология и набор автоматизированных инструментов для создания неизменных резервных копий (RPO/RTO) с гарантированным и регулярно тестируемым регламентом восстановления работоспособности систем.

Читать термин