TTFT vs TPS (Inference Latency Metrics)(Час до першого токена (TTFT) проти швидкості генерації (TPS))
Дві ключові інженерні метрики продуктивності інференсу: Time To First Token (латентність початку відповіді) та Tokens Per Second (пропускна здатність генерації коду).
1. Огляд концепції та системна проблема
Оцінюючи продуктивність моделі штучного інтелекту, розробники-початківці часто дивляться на одну загальну цифру швидкості: "Вона генерує швидко". Проте в реальному продакшені затримка ділиться на дві абсолютно різні апаратні фази:
- Фаза Pre-fill (Обробка контексту): Модель повинна "прочитати" вхідний промпт із 50 000 токенів коду. Це обчислювально-інтенсивна операція (Compute-Bound), яка визначає TTFT (Time To First Token).
- Фаза Decode (Генерація відповіді): Модель послідовно токен за токеном пише новий код. Це операція, обмежена пропускною здатністю пам'яті (Memory-Bound), яка визначає TPS (Tokens Per Second).
2. Архітектурна таксономія та ментальна модель
[ КОРИСТУВАЧ НАДСИЛАЄ ЗАПИТ ]
│
▼
┌───────────────────────────────────────────────────────────────────────┐
│ 1. PREFILL PHASE (Паралельна обробка всього вхідного промпту) │
│ • GPU FLOPs утилізовані на 100% │
│ • Час до появи найпершого символу: ➔ [ TTFT = 420 ms ] │
└───────────────────────────────────┬───────────────────────────────────┘
│
▼
┌───────────────────────────────────────────────────────────────────────┐
│ 2. DECODE PHASE (Послідовна генерація токен за токеном) │
│ • Memory Bandwidth утилізована на 100% │
│ • Швидкість стримінгу: ➔ [ TPS = 85 tokens/sec ] │
└───────────────────────────────────┬───────────────────────────────────┘
│
▼
[ ПОВНА ВІДПОВІДЬ ЗАВЕРШЕНА ]
3. Практичні інженерні сценарії в продакшені
01. Оптимізація інтерактивного асистента в IDE
Розробник очікує підказки коду в реальному часі (Inline Completion). Якщо TTFT перевищує 300 мс, розробник уже продовжує друкувати сам, і підказка стає марною. Для цієї ролі обираються моделі з мінімальним TTFT (Gemini Flash або локальні 3B моделі).
02. Вибір провайдера для рефакторингу кодової бази
Для задачі написання 500 рядків коду в бекграунді модель з TTFT = 5 секунд, але TPS = 120 токенів/сек, впорається за 9 секунд, тоді як модель із миттєвим стартом (TTFT = 0.2с), але повільним TPS = 25 токенів/сек, вимагатиме 20 секунд.
4. Підводні камені, типові помилки та безпека
- Оманливий середній TPS: Провайдери часто вказують у рекламі піковий TPS для коротких відповідей. У міру того, як вихідний текст стає довшим (KV-кеш розростається), TPS може просідати на 30–40%.
- Вплив черги (Queue Latency): Якщо сервер перевантажений запитами, високий TTFT може бути спричинений не повільністю моделі, а тим, що запит 2 секунди стояв у черзі планувальника. Завжди відокремлюйте Queue Time від чистого GPU Prefill Time.
5. Стратегічний висновок для інженера 2026 року
TTFT та TPS — це інженерні координати архітектури вибору моделей. Розуміння різниці між фазами Prefill та Decode дозволяє будувати системи, які одночасно відчуваються миттєвими для людини в інтерфейсі та забезпечують максимальну швидкість генерації для автономних агентів.
FAQ: TTFT vs TPS (Inference Latency Metrics)
Пов'язані терміни
Швидкість генерації (TPS / TTFT / Latency)
Ключові інженерні показники продуктивності мовних моделей: Time to First Token (час реакції на вхідний контекст) та Tokens Per Second (швидкість потокової генерації вихідного тексту).
vLLM (Високопродуктивний рушій інференсу)
Провідний відкритий серверний рушій інференсу та обслуговування LLM, що здійснив революцію у пропускній здатності завдяки алгоритму віртуалізації пам'яті PagedAttention та неперервному батчингу.
Gemini Flash & Pro (Google Gemini)
Сімейство мультимодальних моделей від Google DeepMind, що поєднує рекордне контекстне вікно (до 2 млн токенів), екстремальну швидкість генерації (понад 150 токенів/с) та нативне сприйняття відео й аудіо.
Sampling Parameters (Temperature, Top-p, Min-p)
Математичні гіперпараметри стохастичного декодування (Temperature, Top-P, Min-P, Penalties), що керують розподілом ймовірностей вибору наступного токена, визначаючи рівень детермінізму, точності та креативності моделі.