Skip to main content

TTFT vs TPS (Inference Latency Metrics)(Час до першого токена (TTFT) проти швидкості генерації (TPS))

Дві ключові інженерні метрики продуктивності інференсу: Time To First Token (латентність початку відповіді) та Tokens Per Second (пропускна здатність генерації коду).

1. Огляд концепції та системна проблема

Оцінюючи продуктивність моделі штучного інтелекту, розробники-початківці часто дивляться на одну загальну цифру швидкості: "Вона генерує швидко". Проте в реальному продакшені затримка ділиться на дві абсолютно різні апаратні фази:

  1. Фаза Pre-fill (Обробка контексту): Модель повинна "прочитати" вхідний промпт із 50 000 токенів коду. Це обчислювально-інтенсивна операція (Compute-Bound), яка визначає TTFT (Time To First Token).
  2. Фаза Decode (Генерація відповіді): Модель послідовно токен за токеном пише новий код. Це операція, обмежена пропускною здатністю пам'яті (Memory-Bound), яка визначає TPS (Tokens Per Second).

2. Архітектурна таксономія та ментальна модель

                       [ КОРИСТУВАЧ НАДСИЛАЄ ЗАПИТ ]
                                     │
                                     ▼
 ┌───────────────────────────────────────────────────────────────────────┐
 │ 1. PREFILL PHASE (Паралельна обробка всього вхідного промпту)          │
 │    • GPU FLOPs утилізовані на 100%                                    │
 │    • Час до появи найпершого символу: ➔ [ TTFT = 420 ms ]             │
 └───────────────────────────────────┬───────────────────────────────────┘
                                     │
                                     ▼
 ┌───────────────────────────────────────────────────────────────────────┐
 │ 2. DECODE PHASE (Послідовна генерація токен за токеном)               │
 │    • Memory Bandwidth утилізована на 100%                             │
 │    • Швидкість стримінгу: ➔ [ TPS = 85 tokens/sec ]                   │
 └───────────────────────────────────┬───────────────────────────────────┘
                                     │
                                     ▼
                       [ ПОВНА ВІДПОВІДЬ ЗАВЕРШЕНА ]

3. Практичні інженерні сценарії в продакшені

01. Оптимізація інтерактивного асистента в IDE

Розробник очікує підказки коду в реальному часі (Inline Completion). Якщо TTFT перевищує 300 мс, розробник уже продовжує друкувати сам, і підказка стає марною. Для цієї ролі обираються моделі з мінімальним TTFT (Gemini Flash або локальні 3B моделі).

02. Вибір провайдера для рефакторингу кодової бази

Для задачі написання 500 рядків коду в бекграунді модель з TTFT = 5 секунд, але TPS = 120 токенів/сек, впорається за 9 секунд, тоді як модель із миттєвим стартом (TTFT = 0.2с), але повільним TPS = 25 токенів/сек, вимагатиме 20 секунд.

4. Підводні камені, типові помилки та безпека

  • Оманливий середній TPS: Провайдери часто вказують у рекламі піковий TPS для коротких відповідей. У міру того, як вихідний текст стає довшим (KV-кеш розростається), TPS може просідати на 30–40%.
  • Вплив черги (Queue Latency): Якщо сервер перевантажений запитами, високий TTFT може бути спричинений не повільністю моделі, а тим, що запит 2 секунди стояв у черзі планувальника. Завжди відокремлюйте Queue Time від чистого GPU Prefill Time.

5. Стратегічний висновок для інженера 2026 року

TTFT та TPS — це інженерні координати архітектури вибору моделей. Розуміння різниці між фазами Prefill та Decode дозволяє будувати системи, які одночасно відчуваються миттєвими для людини в інтерфейсі та забезпечують максимальну швидкість генерації для автономних агентів.

/ Часті запитанняSchema.org FAQPage

FAQ: TTFT vs TPS (Inference Latency Metrics)

Людина сприймає затримку понад 1–2 секунди як 'зависання' інтерфейсу. Тому для чат-ботів TTFT має бути менше 500 мс. Для фонового headless-агента, що працює вночі, TTFT не має значення — там вирішальним є високий TPS для швидкого завершення таски.
/ Внутрішня перелінковка
Всі терміни
Моделі & Інференс

Швидкість генерації (TPS / TTFT / Latency)

Ключові інженерні показники продуктивності мовних моделей: Time to First Token (час реакції на вхідний контекст) та Tokens Per Second (швидкість потокової генерації вихідного тексту).

Читати термін
Моделі & Інференс

vLLM (Високопродуктивний рушій інференсу)

Провідний відкритий серверний рушій інференсу та обслуговування LLM, що здійснив революцію у пропускній здатності завдяки алгоритму віртуалізації пам'яті PagedAttention та неперервному батчингу.

Читати термін
Моделі & Інференс

Gemini Flash & Pro (Google Gemini)

Сімейство мультимодальних моделей від Google DeepMind, що поєднує рекордне контекстне вікно (до 2 млн токенів), екстремальну швидкість генерації (понад 150 токенів/с) та нативне сприйняття відео й аудіо.

Читати термін
Моделі & Інференс

Sampling Parameters (Temperature, Top-p, Min-p)

Математичні гіперпараметри стохастичного декодування (Temperature, Top-P, Min-P, Penalties), що керують розподілом ймовірностей вибору наступного токена, визначаючи рівень детермінізму, точності та креативності моделі.

Читати термін