Размер контекстного окна (Память текущего разговора)
Максимальный объем текста (в токенах), который языковая модель может одновременно удерживать в памяти во время текущего разговора. Определяет, какую длину документов можно загрузить за один раз без потери содержания.
1. Обзор концепции и системная проблема
Представьте, что вы читаете книгу, но ваша память устроена так, что вы помните только последние 30 страниц, которые только что прочитали. Как только вы переворачиваете 31-ю страницу, события с 1-й страницы безвозвратно стираются из вашей головы.
Именно так устроено контекстное окно (Context Window) языковой модели. Это ее оперативная рабочая память.
Все, что попадает в контекстное окно:
- Системная инструкция («Ты опытный репетитор»).
- Вся предыдущая история переписки в этом конкретном чате.
- Текст всех загруженных вами файлов.
- Ваш текущий новый вопрос.
Если сумма всех этих элементов превышает лимит модели, старые данные начинают «отсекаться».
2. Эволюция размеров окна памяти
┌─────────────────────────────────────────────────────────────┐
│ ЭВОЛЮЦИЯ РАЗМЕРА КОНТЕКСТНОГО ОКНА │
├─────────────────────────────────────────────────────────────┤
│ 📜 2022 год (GPT-3.5): │
│ [4 000 токенов] ➔ ~10 страниц текста │
├─────────────────────────────────────────────────────────────┤
│ 📖 2023 год (GPT-4 Turbo): │
│ [128 000 токенов] ➔ ~300 страниц (целая толстая книга) │
├─────────────────────────────────────────────────────────────┤
│ 📚 2024–2026 годы (Claude 3.5 Sonnet): │
│ [200 000 токенов] ➔ ~500 страниц или весь код проекта │
├─────────────────────────────────────────────────────────────┤
│ 🏛️ Google Gemini 1.5 Pro: │
│ [2 000 000 токенов] ➔ Библиотека из 35 книг или 1 час видео│
└─────────────────────────────────────────────────────────────┘
3. Почему разговор в одном чате со временем становится «глупее» (Context Rot)
Многие новички делают одну типичную ошибку: они ведут один и тот же бесконечный диалог в течение месяца, задавая туда вопросы о погоде, рецепты, исправления кода и планы на отпуск.
Со временем такой чат накапливает десятки тысяч токенов старого ненужного мусора. Модель начинает:
- Отвечать медленнее.
- Путаться в собственных инструкциях.
- Тратить значительно больше денег за каждое новое слово.
4. Золотое правило гигиены контекста
Одно задание — один новый чат!
Как только вы закончили работать над одной конкретной темой (например, написали статью или исправили ошибку в скрипте) — откройте новый чистый чат. Это обновит оперативную память модели, сэкономит ваш бюджет и гарантирует высочайшее качество ответов без остатков старого мусора.
FAQ: Размер контекстного окна (Память текущего разговора)
Связанные термины
Контекстное Окно (Context Window)
Максимальный рабочий объем токенов, который языковая модель может одновременно удерживать в механизме Self-Attention и памяти KV Cache во время вычисления одного инференс-запроса.
Токены простыми словами (Сколько слов в токене)
Базовая единица измерения текста в языковых моделях. Объяснение того, как слова разбиваются на токены, почему это влияет на стоимость запросов и почему украинские слова потребляют больше токенов, чем английские.
Переполнение и адаптивное сжатие контекстного окна
Инженерные паттерны предотвращения фатальных сбоев при исчерпании лимита контекста: Rolling Summaries, свертка состояний и селективное вытеснение устаревшей истории.