TTFT против TPS (Метрики задержки вывода)
Две ключевые инженерные метрики производительности вывода: Time To First Token (латентность начала ответа) и Tokens Per Second (пропускная способность генерации кода).
1. Обзор концепции и системная проблема
Оценивая производительность модели искусственного интеллекта, разработчики-практики часто смотрят на одну общую цифру скорости: "Она генерирует быстро". Однако в реальном продакшене задержка делится на две абсолютно разные аппаратные фазы:
- Фаза Pre-fill (Обработка контекста): Модель должна "прочитать" входной промпт из 50 000 токенов кода. Это вычислительно-интенсивная операция (Compute-Bound), которая определяет TTFT (Time To First Token).
- Фаза Decode (Генерация ответа): Модель последовательно токен за токеном пишет новый код. Это операция, ограниченная пропускной способностью памяти (Memory-Bound), которая определяет TPS (Tokens Per Second).
2. Архитектурная таксономия и ментальная модель
[ ПОЛЬЗОВАТЕЛЬ ОТПРАВЛЯЕТ ЗАПРОС ]
│
▼
┌───────────────────────────────────────────────────────────────────────┐
│ 1. PREFILL PHASE (Параллельная обработка всего входного промпта) │
│ • GPU FLOPs использованы на 100% │
│ • Время до появления первого символа: ➔ [ TTFT = 420 ms ] │
└───────────────────────────────────┬───────────────────────────────────┘
│
▼
┌───────────────────────────────────────────────────────────────────────┐
│ 2. DECODE PHASE (Последовательная генерация токен за токеном) │
│ • Memory Bandwidth использована на 100% │
│ • Скорость стриминга: ➔ [ TPS = 85 tokens/sec ] │
└───────────────────────────────────┬───────────────────────────────────┘
│
▼
[ ПОЛНЫЙ ОТВЕТ ЗАВЕРШЕН ]
3. Практические инженерные сценарии в продакшене
01. Оптимизация интерактивного ассистента в IDE
Разработчик ожидает подсказки кода в реальном времени (Inline Completion). Если TTFT превышает 300 мс, разработчик уже продолжает печатать сам, и подсказка становится бесполезной. Для этой роли выбираются модели с минимальным TTFT (Gemini Flash или локальные 3B модели).
02. Выбор провайдера для рефакторинга кодовой базы
Для задачи написания 500 строк кода в фоне модель с TTFT = 5 секунд, но TPS = 120 токенов/сек, справится за 9 секунд, тогда как модель с мгновенным стартом (TTFT = 0.2с), но медленным TPS = 25 токенов/сек, потребует 20 секунд.
4. Подводные камни, типовые ошибки и безопасность
- Оманчивый средний TPS: Провайдеры часто указывают в рекламе пиковый TPS для коротких ответов. По мере того как выходной текст становится длиннее (KV-кеш разрастается), TPS может падать на 30–40%.
- Влияние очереди (Queue Latency): Если сервер перегружен запросами, высокий TTFT может быть вызван не медлительностью модели, а тем, что запрос 2 секунды находился в очереди планировщика. Всегда отделяйте Queue Time от чистого GPU Prefill Time.
5. Стратегический вывод для инженера 2026 года
TTFT и TPS — это инженерные координаты архитектуры выбора моделей. Понимание разницы между фазами Prefill и Decode позволяет строить системы, которые одновременно ощущаются мгновенными для человека в интерфейсе и обеспечивают максимальную скорость генерации для автономных агентов.
FAQ: TTFT против TPS (Метрики задержки вывода)
Связанные термины
Скорость генерации (TPS / TTFT / Latency)
Ключевые инженерные показатели производительности языковых моделей: Time to First Token (время реакции на входной контекст) и Tokens Per Second (скорость потоковой генерации выходного текста).
vLLM (Высокопроизводительный движок инференса)
Ведущий открытый серверный движок инференса и обслуживания LLM, который произвел революцию в пропускной способности благодаря алгоритму виртуализации памяти PagedAttention и непрерывному батчингу.
Gemini Flash & Pro (Google Gemini)
Семейство мультимодальных моделей от Google DeepMind, объединяющее рекордное контекстное окно (до 2 млн токенов), экстремальную скорость генерации (более 150 токенов/с) и нативное восприятие видео и аудио.
Параметры Семплирования (Температура, Top-p, Min-p)
Математические гиперпараметры стохастического декодирования (Temperature, Top-P, Min-P, Penalties), управляющие распределением вероятностей выбора следующего токена, определяя уровень детерминизма, точности и креативности модели.