Skip to main content

TTFT против TPS (Метрики задержки вывода)

Две ключевые инженерные метрики производительности вывода: Time To First Token (латентность начала ответа) и Tokens Per Second (пропускная способность генерации кода).

1. Обзор концепции и системная проблема

Оценивая производительность модели искусственного интеллекта, разработчики-практики часто смотрят на одну общую цифру скорости: "Она генерирует быстро". Однако в реальном продакшене задержка делится на две абсолютно разные аппаратные фазы:

  1. Фаза Pre-fill (Обработка контекста): Модель должна "прочитать" входной промпт из 50 000 токенов кода. Это вычислительно-интенсивная операция (Compute-Bound), которая определяет TTFT (Time To First Token).
  2. Фаза Decode (Генерация ответа): Модель последовательно токен за токеном пишет новый код. Это операция, ограниченная пропускной способностью памяти (Memory-Bound), которая определяет TPS (Tokens Per Second).

2. Архитектурная таксономия и ментальная модель

                       [ ПОЛЬЗОВАТЕЛЬ ОТПРАВЛЯЕТ ЗАПРОС ]
                                     │
                                     ▼
 ┌───────────────────────────────────────────────────────────────────────┐
 │ 1. PREFILL PHASE (Параллельная обработка всего входного промпта)      │
 │    • GPU FLOPs использованы на 100%                                   │
 │    • Время до появления первого символа: ➔ [ TTFT = 420 ms ]         │
 └───────────────────────────────────┬───────────────────────────────────┘
                                     │
                                     ▼
 ┌───────────────────────────────────────────────────────────────────────┐
 │ 2. DECODE PHASE (Последовательная генерация токен за токеном)        │
 │    • Memory Bandwidth использована на 100%                           │
 │    • Скорость стриминга: ➔ [ TPS = 85 tokens/sec ]                   │
 └───────────────────────────────────┬───────────────────────────────────┘
                                     │
                                     ▼
                       [ ПОЛНЫЙ ОТВЕТ ЗАВЕРШЕН ]

3. Практические инженерные сценарии в продакшене

01. Оптимизация интерактивного ассистента в IDE

Разработчик ожидает подсказки кода в реальном времени (Inline Completion). Если TTFT превышает 300 мс, разработчик уже продолжает печатать сам, и подсказка становится бесполезной. Для этой роли выбираются модели с минимальным TTFT (Gemini Flash или локальные 3B модели).

02. Выбор провайдера для рефакторинга кодовой базы

Для задачи написания 500 строк кода в фоне модель с TTFT = 5 секунд, но TPS = 120 токенов/сек, справится за 9 секунд, тогда как модель с мгновенным стартом (TTFT = 0.2с), но медленным TPS = 25 токенов/сек, потребует 20 секунд.

4. Подводные камни, типовые ошибки и безопасность

  • Оманчивый средний TPS: Провайдеры часто указывают в рекламе пиковый TPS для коротких ответов. По мере того как выходной текст становится длиннее (KV-кеш разрастается), TPS может падать на 30–40%.
  • Влияние очереди (Queue Latency): Если сервер перегружен запросами, высокий TTFT может быть вызван не медлительностью модели, а тем, что запрос 2 секунды находился в очереди планировщика. Всегда отделяйте Queue Time от чистого GPU Prefill Time.

5. Стратегический вывод для инженера 2026 года

TTFT и TPS — это инженерные координаты архитектуры выбора моделей. Понимание разницы между фазами Prefill и Decode позволяет строить системы, которые одновременно ощущаются мгновенными для человека в интерфейсе и обеспечивают максимальную скорость генерации для автономных агентов.

/ Частые вопросыSchema.org FAQPage

FAQ: TTFT против TPS (Метрики задержки вывода)

Человек воспринимает задержку более 1–2 секунд как 'зависание' интерфейса. Поэтому для чат-ботов TTFT должен быть меньше 500 мс. Для фонового headless-агента, работающего ночью, TTFT не имеет значения — там решающим является высокий TPS для быстрого завершения задачи.
/ Внутренняя перелинковка
Все термины
Модели и Инференс

Скорость генерации (TPS / TTFT / Latency)

Ключевые инженерные показатели производительности языковых моделей: Time to First Token (время реакции на входной контекст) и Tokens Per Second (скорость потоковой генерации выходного текста).

Читать термин
Модели и Инференс

vLLM (Высокопроизводительный движок инференса)

Ведущий открытый серверный движок инференса и обслуживания LLM, который произвел революцию в пропускной способности благодаря алгоритму виртуализации памяти PagedAttention и непрерывному батчингу.

Читать термин
Модели и Инференс

Gemini Flash & Pro (Google Gemini)

Семейство мультимодальных моделей от Google DeepMind, объединяющее рекордное контекстное окно (до 2 млн токенов), экстремальную скорость генерации (более 150 токенов/с) и нативное восприятие видео и аудио.

Читать термин
Модели и Инференс

Параметры Семплирования (Температура, Top-p, Min-p)

Математические гиперпараметры стохастического декодирования (Temperature, Top-P, Min-P, Penalties), управляющие распределением вероятностей выбора следующего токена, определяя уровень детерминизма, точности и креативности модели.

Читать термин