Token Burn Rate (Скорость сжигания токенов)
Критическая инженерная и финансовая метрика скорости потребления контекстных и генерационных токенов (и долларов в час) в агентских сессиях разработки с учетом кэширования промптов.
1. Обзор концепции и системная проблема
В обычных чат-ботах потребление токенов незначительно: один вопрос и ответ потребляют несколько сотен токенов. Однако в вайбкодинге и автономных агентских циклах (Cursor Composer, Claude Code, OpenHands) динамика потребления токенов радикально меняется. Агент загружает в контекст правила проекта, фрагменты кодовой базы через индекс, схемы инструментов и логи терминала, отправляя 50 000–150 000 токенов на каждой итерации.
Если агент делает 25 шагов для исправления бага, суммарный объем входных токенов легко достигает нескольких миллионов. Если инженер не понимает метрики Token Burn Rate (скорость сжигания токенов), проект быстро сталкивается с финансовым шоком: сотни долларов за день работы на одну рабочую станцию или блокировка лимитов корпоративного API-ключа в середине рабочего дня.
2. Архитектурная таксономия и ментальная модель
Структура затрат токенов в современных агентских системах делится на четыре неравнозначные категории:
┌─────────────────────────────────────────────────────────────┐
│ TOKEN BURN RATE COST BREAKDOWN │
├─────────────────────────────────────────────────────────────┤
│ 1. Cached Input Tokens (Prompt Caching Hit) ➔ -90% стоимости │
│ Статические правила репозитория, базовые файлы, системный промпт│
├─────────────────────────────────────────────────────────────┤
│ 2. Fresh Input Tokens (Uncached Cache Miss) ➔ 100% стоимости │
│ Новые файлы, логи терминала, свежие сообщения инженера │
├─────────────────────────────────────────────────────────────┤
│ 3. Generation Tokens (Output / Code Blocks) ➔ 3-5x тариф │
│ Генерируемый код, вызовы инструментов в формате JSON │
├─────────────────────────────────────────────────────────────┤
│ 4. Thinking / Reasoning Tokens (Extended CoT) ➔ Премиум │
│ Внутренние скрытые размышления моделей Claude 3.7 / o1 │
└─────────────────────────────────────────────────────────────┘
- Базовое входное потребление (Context Ingestion):
- Объем контекста, который модель перечитывает на каждом шаге. Чем длиннее диалог, тем больше вес каждого следующего запроса.
- Кэшированный контекст (Cached Prefix):
- Токены, сохраненные в KV-кэше видеокарт провайдера. Имеют сниженную стоимость (например, $0.30 за 1M вместо $3.00 в Claude Sonnet), если префикс запроса не изменяется в течение нескольких минут.
- Генерационные токены кода (Output Tokens):
- Код, который возвращает модель. Тарифируется значительно дороже за входные токены (в 3–5 раз), поскольку требует последовательного авторегрессионного расчета на GPU.
- Токены расширенного мышления (Thinking Tokens):
- Внутренние цепочки размышлений моделей нового поколения. Сложная задача может сгенерировать 10 000 токенов мыслей еще до того, как модель напишет первую строку кода.
3. Технический пайплайн и внутренняя механика
Жизненный цикл мониторинга и контроля Token Burn Rate:
- Пре-инференсный подсчет токенов (Token Counting):
Локальный токенизатор (например,
tiktokenили библиотека токенизации провайдера) рассчитывает длину сформированного промпта перед отправкой. - Проверка лимитов (Circuit Breaker & Guardrails): Система сравнивает текущие затраты с установленным бюджетом: если текущая сессия превысила порог в $5.00, отправляется предупреждение инженеру.
- Оптимизация структуры промпта для сохранения кэша: Архитектура запроса упорядочивается так, чтобы статические данные (правила, манифесты инструментов) шли в начале, а динамические (свежий вывод терминала) — в конце. Это предотвращает инвалидизацию кэша провайдера.
- Получение телеметрии после ответа:
Из заголовков ответа API считываются точные показатели:
prompt_tokens,completion_tokens,cache_read_input_tokens,cache_creation_input_tokens. - Расчет текущей скорости сжигания: Вычисляется скорость затрат ($/минуту или $/задачу) и выводится в строке состояния IDE или терминала.
4. Практические инженерные сценарии в продакшене
01. Архитектурное структурирование промптов под сохранение 90% скидки кэша
Инженер настраивает работу с Claude 3.7 Sonnet:
- Если поместить динамический
timestampили изменяющиеся логи в начало системного промпта, весь 100k контекст будет считаться новым, сжигая $0.30 на каждом шаге. - Переместив изменяющиеся переменные в последний блок запроса, инженер обеспечивает 95% попадания в кэш (Cache Hit), снижая стоимость 20-шагового цикла с $6.00 до $0.80.
02. Корпоративный шлюз контроля бюджетов разработчиков
Технический директор компании внедряет прокси-сервер (LiteLLM / Portkey):
- Каждый инженер получает персональный суточный лимит в $15.
- При достижении 80% лимита разработчик получает уведомление в Slack.
- При 100% инструмент автоматически переключает некритические задачи на сверхдешевые модели (DeepSeek V3 или Claude Haiku).
03. Обнаружение аварийного цикла (Infinite Loop Detection)
Автономный агент попал в циклическую попытку установить несовместимую библиотеку:
- Детектор Token Burn Rate замечает, что за последние 3 минуты было отправлено 8 запросов без изменения результирующего кода, что сожгло 1.2M токенов.
- Процесс аварийно прерывается, сохраняя средства компании.
5. Подводные камни, типовые ошибки и безопасность
- Случайная инвалидизация префиксного кэша: Добавление случайных UUID или текущего времени в начале разговора разрушает весь KV-кэш, увеличивая финансовый счет в 10 раз.
- Невидимый овердрафт на моделях мышления (Thinking Budget Overflow): Если не ограничить параметр
max_thinking_tokens, модель может размышлять на протяжении 30 000 токенов над тривиальным изменением названия кнопки, сжигая средства без добавленной стоимости. - Оставленные фоновые сессии в терминале: Запуск нескольких CLI-агентов в разных терминальных вкладках без мониторинга может привести к незаметному исчерпанию корпоративного баланса, если один из процессов застрянет.
- Неправильная настройка уведомлений провайдера: Отсутствие настроенных жестких лимитов (Hard Limits) в кабинетах Anthropic или OpenAI создает риск неожиданного списания тысяч долларов с привязанной банковской карты.
FAQ: Token Burn Rate (Скорость сжигания токенов)
Связанные термины
Кеширование Промптов (Prompt Caching & KV Cache Reuse)
Технология современных инференс-движков и облачных API (Anthropic, OpenAI, DeepSeek, vLLM), которая сохраняет предварительно вычисленные матрицы внимания (KV Cache) статического префикса, уменьшая стоимость обработки на 80–90% и сокращая время до первого токена (TTFT) в 4–8 раз.
OpenRouter (Унифицированный API-шлюз моделей)
Унифицированный шлюз искусственного интеллекта, предоставляющий стандартизированный доступ к сотням закрытых и открытых языковых моделей от десятков провайдеров через единый баланс, единый API-ключ и механизм автоматического отказоустойчивого переключения (Fallback).
Скорость генерации (TPS / TTFT / Latency)
Ключевые инженерные показатели производительности языковых моделей: Time to First Token (время реакции на входной контекст) и Tokens Per Second (скорость потоковой генерации выходного текста).
Контекстное Окно (Context Window)
Максимальный рабочий объем токенов, который языковая модель может одновременно удерживать в механизме Self-Attention и памяти KV Cache во время вычисления одного инференс-запроса.