Что такое контекстное окно: лимиты токенов по моделям (2026)
Контекстное окно — это бюджет токенов на один запрос, вход плюс выход. Один и тот же документ на 9 моделях: от 614 до 957 токенов, разброс в 1.56 раза.
Контекстное окно — это максимальное число токенов, которое модель обрабатывает в одном запросе, считая вход и выход вместе.
Единица: токены, не слова и не символы (~4 английских символа на токен, но по-разному)
Область действия: один запрос; это не память, между вызовами не сохраняется
Что входит: системный промпт, вся история, определения инструментов, их результаты, рассуждения, ответ
Типичный размер: 200K на старых и дешёвых моделях, 1M на большинстве текущих флагманов
Максимум в 2026: 1 131 072 (Qwen 3.8 Max); ровно 1 000 000 — это нижняя граница сегмента 1M
Если превысить: HTTP 400 и никакого вывода; ничего не обрезается молча
О чём не говорит: насколько точно модель использует дальний край этого окна
Что такое контекстное окно?
Это бюджет токенов на один запрос к API. Всё, что модель читает, и всё, что она пишет, должно уместиться в одно число.
API не хранит состояние и не помнит предыдущий вызов. На каждом шаге приложение заново отправляет весь диалог, а контекстное окно ограничивает сумму этой отправки и будущего ответа.
Поэтому окно не является памятью в сколько-нибудь полезном смысле. Чат-продукт, который будто бы помнит ваше имя между сессиями, хранит этот текст отдельно и подставляет его в окно при каждом запросе.
Что расходует контекстное окно?
Всё содержимое запроса плюс всё содержимое ответа. Забывают обычно как раз о самых дорогих частях.
- Системный промпт. Учитывается на каждом шаге, а не один раз за сессию.
- Вся история сообщений. Каждая предыдущая реплика пользователя и ассистента, которую вы отправляете снова.
- Определения инструментов. Имена, описания и JSON-схемы всех объявленных инструментов. У Claude к этому добавляется системный промпт для работы с инструментами, свой для каждой модели: от 286 токенов на Opus 5 до 675 на Opus 4.7.
- Результаты инструментов. В агентном цикле это чаще всего самый крупный элемент: листинг каталога или ответ API легко занимает тысячи токенов.
- Токены рассуждений. На моделях с включённым thinking рассуждения считаются и оплачиваются, даже если текст вам не возвращают.
- Сам ответ. Поэтому
max_tokensи контекстное окно связаны: запрос, не оставивший места под вывод, обрывается на середине.
На последнем пункте спотыкаются чаще всего. У Claude Opus 5 thinking включён по умолчанию, поэтому запрос, впритык рассчитанный под ответ на более старой модели, теперь может упереться в потолок посреди генерации.
Насколько велико контекстное окно у каждой модели?
1M токенов — потолок массового сегмента, а самый распространённый размер вообще — 256K. Среди 119 текстовых моделей каталога ofox на 2026-08-12 у 25 окно 256K, у 22 — 1M.
Флагманский сегмент, числа как их публикуют сами вендоры:
| Модель | Контекстное окно | Максимальный вывод |
|---|---|---|
| Qwen 3.8 Max | 1 131 072 | 131 072 |
| GPT-5.6 Sol | 1 050 000 | 128 000 |
| Gemini 3.1 Pro | 1 048 576 | 65 536 |
| GLM-5.2 | 1 048 576 | 128 000 |
| Kimi K3 | 1 048 576 | 1 048 576 |
| Claude Opus 5 | 1 000 000 | 128 000 |
| DeepSeek V4 Flash | 1 000 000 | 384 000 |
| Grok 4.20 | 1 000 000 | не опубликовано |
| Claude Haiku 4.5 | 200 000 | 64 000 |
Здесь стоит заметить две вещи. У Qwen 3.8 Max самое большое заявленное окно в группе, а Kimi K3 — единственная модель, у которой максимальный вывод равен всему окну, то есть в принципе она может выдать миллион токенов за один ответ. DeepSeek V4 Flash второй по выводу с 384 000, втрое больше, чем позволяет большинство этого сегмента, и это важно, если вы генерируете длинные документы, а не читаете их. И «1M» на деле оказывается девятью разными числами, от ровных 1 000 000 до 1 131 072, то есть разброс в 13% ещё до всяких замеров.
Одно предостережение об источниках. Каталоги шлюзов и документация вендоров сходятся не всегда: 2026-08-12 каталог ofox показывал у Grok 4.20 окно 2 000 000, тогда как собственная документация xAI указывает 1 000 000. В таблице выше приведены числа вендоров. Когда цифра критична, проверяйте её на странице вендора.
Почему «1M токенов» означает разное на разных моделях?
Потому что токен — не фиксированный объём текста, а разница между токенизаторами больше, чем принято думать. Мы отправили один и тот же английский документ на 2638 символов (420 слов, разбор инцидента) через один эндпоинт на девять моделей и прочитали prompt_tokens из каждого ответа.
| Модель | Токенов на один и тот же документ | Символов на токен |
|---|---|---|
| Grok 4.20 | 614 | 4.30 |
| GPT-5.6 Sol | 626 | 4.21 |
| GLM-5.2 | 632 | 4.17 |
| DeepSeek V4 Flash | 634 | 4.16 |
| Gemini 3.1 Pro | 684 | 3.86 |
| Claude Opus 4.6 | 698 | 3.78 |
| Qwen 3.8 Max | 706 | 3.74 |
| Kimi K3 | 716 | 3.68 |
| Claude Opus 5 | 957 | 2.76 |
Замер от 2026-08-12. Разброс в 1.56 раза на одинаковом входе. Claude Opus 5 выбивается из ряда потому, что Anthropic прямо пишет: Claude 4.7 и новее используют обновлённый токенизатор, дающий «примерно на 30% больше токенов на том же тексте».
Совместите две таблицы, и заявленное окно перестанет быть полезным числом. Вот сколько копий того же документа на 420 слов помещается на самом деле:
| Модель | Заявленное окно | Копий тестового документа |
|---|---|---|
| GPT-5.6 Sol | 1 050 000 | 1677 |
| GLM-5.2 | 1 048 576 | 1659 |
| Grok 4.20 | 1 000 000 | 1629 |
| Qwen 3.8 Max | 1 131 072 | 1602 |
| DeepSeek V4 Flash | 1 000 000 | 1577 |
| Gemini 3.1 Pro | 1 048 576 | 1533 |
| Kimi K3 | 1 048 576 | 1464 |
| Claude Opus 4.6 | 1 000 000 | 1432 |
| Claude Opus 5 | 1 000 000 | 1045 |
Все они заявляют примерно 1M, а реальная вместимость для этого документа отличается в 1.60 раза.
Соотношение непостоянно и зависит от типа содержимого, так что не переносите эти числа на другую нагрузку. На файле TypeScript разброс составил 1.53 раза, и экономнее всех оказался GLM-5.2, а не Grok. На китайской прозе разброс вырос до 1.88 раза, и обе модели Claude подошли вплотную к одному токену на иероглиф: 1.00 символа на токен на той выборке против 1.87 у Grok. Считайте это выборкой, а не правилом: на втором китайском фрагменте, более насыщенном пунктуацией, те же две модели дали 0.98 и 0.96 символа на токен, то есть отдельные символы стоят дороже одного токена. Если у вас код или текст не на английском, измеряйте, а не предполагайте.
Практическое правило: измеряйте своё содержимое на тех моделях, между которыми выбираете. Один запрос с max_tokens: 1 возвращает prompt_tokens и стоит сущие копейки.
Что происходит при превышении контекстного окна?
Вы получаете HTTP 400 и никакого вывода. Ничего не обрезается молча. Мы отправили заведомо избыточный запрос модели с окном 32 000, чтобы увидеть точное поведение:
{"error":{"code":null,
"message":"<400> InternalError.Algo.InvalidParameter: Range of input length should be [1, 30720]",
"type":"invalid_request_error"}}
Прочитайте этот лимит внимательно. Модель заявляет 32 000, а фактический потолок входа равен 30 720, остальное зарезервировано под вывод. Заявленное окно — это общий объём, а не ваш лимит на вход, и реально применяемое число может быть меньше рекламного.
Форма ошибки различается у вендоров, поэтому не опирайтесь на строку сообщения:
- OpenAI-совместимые эндпоинты обычно возвращают 400 с кодом вида
context_length_exceeded. - Claude может вместо этого штатно завершить шаг с
stop_reason: "model_context_window_exceeded", и это не то же самое, чтоmax_tokens: в коде нужна отдельная ветка.
Обрабатывайте оба случая. Ответ, оборвавшийся из-за заполненного окна, и ответ, оборвавшийся из-за маленького max_tokens, — разные сбои, и чинятся они по-разному.
Дороже ли обходится большое контекстное окно?
Иногда да, и это целиком зависит от вендора. В 2026 году в ходу две модели тарификации:
- Плоская. Anthropic тарифицирует всё окно в 1M по стандартным ставкам без надбавки за длинный контекст, поэтому запрос на 900K токенов стоит за токен столько же, сколько запрос на 9K.
- Со ступенью после 200K. Gemini 3.1 Pro переходит с $2 на $4 за миллион входных токенов и с $12 на $18 за выходные, как только промпт пересекает 200K. Grok 4.20 на том же пороге поднимает вход с $1.25 до $2.50, а выход с $2.50 до $5.00.
Так что модель с более дешёвым ценником может оказаться дороже на длинных документах. Если ваша нагрузка регулярно переходит 200K, проверьте наличие ступени до сравнения прайсов, и учтите, что наш расчёт экономии на кешировании промпта работает поверх любой из ступеней.
Заявленное окно и реально используемый контекст — одно и то же?
Нет, и это самая важная оговорка на странице. Модель, принимающая 1M токенов, и модель, надёжно находящая факт, закопанный на 800 000-м токене, — не одно и то же.
Точность извлечения падает с расстоянием у всех публичных моделей, а величина этого провала относится к бенчмаркам, а не к спецификации. Мы разобрали это отдельно в статье контекстные окна LLM: реальная точность после 200K токенов, где разбирается, что на самом деле измеряют RULER, MRCR v2 и NoLiMa.
Считайте заявленное окно верхней границей того, что примет API, а числа бенчмарков — ориентиром того, что модель использует хорошо.
Как поместить больше в то окно, которое есть?
Ни один из приёмов не увеличивает окно, все они сокращают расход внутри него. Примерно по убыванию отдачи:
- Кеширование промпта. Стабильный префикс (системный промпт, определения инструментов, документ, о котором вы спрашиваете снова и снова) при попадании в кеш тарифицируется примерно в 10% от входной ставки у Anthropic и ряда других вендоров, хотя конкретная скидка различается и где-то глубже. Для повторяющихся вызовов это самый мощный рычаг, и меняет он стоимость, а не вместимость.
- Compaction. Серверное сжатие ранних реплик в резюме, когда диалог приближается к лимиту, чтобы длинная агентная сессия продолжала работать вместо ошибки.
- Context editing. Удаление устаревших результатов инструментов и старых блоков рассуждений из истории. Агентные циклы забиваются выводом инструментов сильнее, чем диалогом, а случай кодового агента разобран в наших заметках про оптимизацию токенов в Claude Code.
- Подбирайте токенизатор под своё содержимое. Как показывают таблицы выше, одно это решение стоит до 1.6 раза эффективной вместимости, ещё до любой другой оптимизации.
Как сравнить расход токенов у разных вендоров без девяти аккаунтов?
Честное сравнение требует одного и того же запроса к моделям разных вендоров, а каждый вендор обычно означает свой ключ, свой SDK и свою строку в счёте. В этом и трение: никто не заводит девять аккаунтов ради вопроса о размерах, поэтому на него обычно отвечают эмпирическим правилом вместо замера.
Поскольку все перечисленные модели говорят на одном OpenAI-совместимом HTTP, достаточно одного клиента и цикла по идентификаторам моделей. Отправьте max_tokens: 1 и прочитайте prompt_tokens: модель не пишет ответ, поэтому замер стоит доли цента.
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.run/v1", api_key="YOUR_OFOX_KEY")
text = open("your_document.txt").read()
for model in [
"anthropic/claude-opus-5",
"openai/gpt-5.6-sol",
"google/gemini-3.1-pro-preview",
"moonshotai/kimi-k3",
"z-ai/glm-5.2",
]:
r = client.chat.completions.create(
model=model, max_tokens=1,
messages=[{"role": "user", "content": text}],
)
n = r.usage.prompt_tokens
print(f"{model:32} {n:>7,} tokens {len(text)/n:.2f} chars/token")
Этот цикл дал все замеры на странице. Прогоните его на своём содержимом до того, как выбирать модель по размеру окна: по приведённым данным заявленное число ошибается до 1.6 раза в любую сторону.
Источники
Часто задаваемые вопросы
- Контекстное окно — это то же самое, что память?
- Нет. Контекстное окно действует в пределах одного запроса и не сохраняется между вызовами. API не хранит состояние: на каждом шаге вы заново отправляете весь диалог, а окно ограничивает то, что помещается в один запрос. Всё, что вышло за окно, исчезает, если приложение само не сохранило это и не отправило снова. Продукты, которые будто бы помнят вас между сессиями, просто подставляют сохранённый текст обратно в окно, а не пользуются памятью модели.
- Сколько слов в 1 миллионе токенов?
- Для английской прозы примерно от 440 000 до 685 000 слов, и это шире привычного эмпирического правила. По нашим замерам на одном и том же документе восемь из девяти протестированных моделей укладываются в 587 000–684 000 слов на миллион токенов; Claude Opus 5 выбивается вниз, около 439 000, из-за более нового токенизатора. Измеренный диапазон на том же английском документе составил 2.76–4.30 символа на токен. Код плотнее (около 2.4–3.6 символа на токен), китайский ещё плотнее (0.9–1.9), поэтому того же окна в 1M на такой текст хватает заметно меньше.
- Какое самое большое контекстное окно доступно в 2026 году?
- Потолок массового сегмента — 1M токенов, и несколько вендоров стоят чуть выше круглого числа: Qwen 3.8 Max с 1 131 072, GPT-5.6 с 1 050 000, а Gemini, GLM и Kimi K3 с 1 048 576. Claude, Grok 4.20 и DeepSeek V4 Flash заявляют ровно 1 000 000. Среди 119 текстовых моделей каталога ofox на 2026-08-12 самое частое окно — 256K (25 моделей), на 1M приходится 22 модели.
- Почему один и тот же файл расходует на Claude больше токенов, чем на GPT?
- Разные токенизаторы. Anthropic отмечает, что Claude 4.7 и новее используют обновлённый токенизатор, который выдаёт примерно на 30% больше токенов на том же тексте. На нашем английском тестовом документе Claude Opus 5 израсходовал 957 токенов там, где GPT-5.6 Sol обошёлся 626, то есть разница в 1.53 раза на одинаковом входе. Это не поломка, модели просто считают по-разному, и сравнивать цену за токен между вендорами без поправки на это бессмысленно.
- Замедляется ли модель, если заполнить контекстное окно?
- Да, и обычно каждый шаг обходится дороже. Каждый токен в окне обрабатывается заново при каждом запросе, поэтому диалог, разросшийся до 400K токенов, оплачивается как 400K токенов на каждом новом шаге, если не работает кеширование промпта. Двое вендоров вдобавок повышают ставку после 200K: Gemini 3.1 Pro переходит с $2 на $4 за миллион входных токенов, а Grok 4.20 с $1.25 на $2.50.
- Можно ли увеличить контекстное окно модели?
- Нет. Оно зафиксировано в модели, и параметра для его расширения не существует. Менять можно только расход внутри окна: кеширование промпта удешевляет повторную отправку стабильного префикса, context editing вычищает устаревшие результаты инструментов, а compaction сжимает старые реплики в резюме. Всё это управление бюджетом, а не его расширение.


