Лучшие поставщики LLM API 2026: 4 типа и цена каждого
Четыре способа купить одни и те же токены. Claude Opus 5 стоит $5/$25 на трёх из них, gpt-oss-120B идёт по $0.15/M, комиссии за пополнение до 5.5%.
TL;DR: В 2026 году есть четыре способа покупать LLM-токены, и они конкурируют не по одной оси. Нативные API продают каноническую цену и возможности с нулевого дня. Хостеры открытых весов продают дешёвые токены, начиная с $0.05/M на gpt-oss-20B у Together. Роутеры продают один ключ для множества вендоров, обычно по прайс-листу, а затраты перенесены в платёжные комиссии, 5.5% на пополнение картой у OpenRouter. Облачные платформы продают закупку и берут за неё плату: региональные эндпоинты в партнёрских облаках идут на 10% дороже глобальных, а приоритетный уровень Vertex это 1.8x стандартного. Один и тот же вызов Claude Opus 5 стоит $5/$25 за 1M токенов на трёх из четырёх. Реально различается всё вокруг токена.
TL;DR: У какого типа стоит покупать?
| Ваша ситуация | Покупать у | Почему |
|---|---|---|
| Вам нужна модель на неделе её выхода | Нативный API | Партнёрские облака и роутеры отстают по новым SKU и по новым возможностям |
| Ваш счёт в основном формирует одна модель открытых весов | Хостер открытых весов | Бессерверная оплата за токен, затем выделенные GPU, когда вы их насытите |
| Вы вызываете четырёх вендоров и хотите один счёт | Роутер | Один ключ, один баланс, один формат провода, если хотите |
| Финансы уже одобрили облачное обязательство | Облачная платформа | Расходы попадают в счёт, который существует, и это часто весь аргумент |
| Вам нужны первые токены за доли секунды на маленькой модели | Хостер открытых весов | Groq публикует 560 tok/s на своей llama-3.1-8b-instant и 1000 tok/s на своей openai/gpt-oss-20b, по своим ценам |
| Вам нужен запасной маршрут без второго контракта | Роутер | Переключение при отказе это продукт, а не возможность, которую вы строите |
| Ваши данные должны оставаться в одном юридическом регионе | Облачная платформа или нативная резидентность | Обе предлагают это, обе берут около 10% за это |
| Вы ещё выбираете, какую модель использовать | Роутер | Замена ID модели дешевле замены интеграции |
Есть два повода дальше не читать. Если вы тратите менее примерно $200 в месяц на токены, покупайте напрямую у той лаборатории, которая делает нравящуюся вам модель, и вернитесь к этому, когда цифры станут интересными; любая оптимизация ниже стоит меньше, чем полдня, которые вы бы на неё потратили. Если вы уже гоняете продакшн-трафик более чем через двух вендоров, переходите к таблице скрытых затрат, потому что именно туда уходят ваши деньги.

Четыре типа, бок о бок
Полезное различие не в бренде. Оно в том, кто запускает GPU, кто устанавливает цену и кто выставляет счёт.
| Нативный API | Хостер открытых весов | Роутер / агрегатор | Облачная платформа | |
|---|---|---|---|---|
| Примеры | OpenAI, Anthropic, Google, DeepSeek | Together, Fireworks, Groq | OpenRouter, ofox | Bedrock, Vertex AI, Microsoft Foundry |
| Выполняет инференс | Да | Да | Нет | Да, либо перепродаёт лабораторию |
| Каталог моделей | Модели одной лаборатории | Только открытые веса | Много лабораторий, 100+ ID | Партнёрский список облака |
| Устанавливает цену | Да, это прайс | Да, конкурентно | В основном копирует прайс | Прайс плюс платформенные надбавки |
| Новая модель в первый день | Да | Для открытых весов да | Обычно в течение дней | Часто недели |
| Аутентификация | Bearer-токен | Bearer-токен | Bearer-токен | IAM-роли, SigV4, сервисные аккаунты |
| Биллинг | Карта или счёт, по лаборатории | Карта, по хостеру | Один предоплаченный баланс | Ваш существующий облачный счёт |
| Переключение между вендорами | Строите сами | Строите сами | Встроено | В рамках каталога одного облака |
| Силён в | Новейшие возможности, самые высокие потолки | Стоимость за токен | Широта и стоимость переключения | Закупка и комплаенс |
Всё, что ниже, это та же таблица подробно, с числами, которые я смог проверить.
Тип 1: Нативные API
Покупка у лаборатории, обучившей модель, это вариант по умолчанию, и для большинства команд он остаётся правильным ответом дольше, чем подсказывает интернет.
Вы получаете три вещи, которые больше нигде надёжно не дают. Новые модели в день релиза. Возможности, существующие только у первоисточника, вроде fast mode у Anthropic, о котором документация по ценам утверждает, что он доступен только в Claude API и не на платформах, управляемых партнёрами. И самые высокие опубликованные потолки лимитов, потому что любой другой маршрут покупает мощности там же, где покупали бы вы.
Вот что три крупные лаборатории реально берут, за 1M токенов, проверено 2026-08-02.
| Модель | Вход | Кешированный вход | Выход |
|---|---|---|---|
| Claude Fable 5 | $10 | $1 | $50 |
| Claude Opus 5 | $5 | $0.50 | $25 |
| Claude Sonnet 5 | $2 (до Aug 31, затем $3) | $0.20 | $10 (затем $15) |
| Claude Haiku 4.5 | $1 | $0.10 | $5 |
| gpt-5.6-sol | $5 | $0.50 | $30 |
| gpt-5.6-terra | $2 | $0.20 | $12 |
| gpt-5.6-luna | $0.20 | $0.02 | $1.20 |
| gpt-5.5 | $5 | $0.50 | $30 |
| Gemini 3.6 Flash | $1.50 | $0.15 | $7.50 |
| Gemini 3.5 Flash-Lite | $0.30 | $0.03 | $2.50 |
Две оговорки, прежде чем вы используете эти числа. OpenAI публикует отдельные колонки для короткого и длинного контекста, и цифры выше это уровень короткого контекста. Длинный контекст не является равномерным множителем: gpt-5.6-luna идёт с $0.20/$1.20 до $0.40/$1.80, так что вход удваивается, а выход растёт наполовину. Цифры Gemini это уровень Global у Vertex, и несколько моделей в этой линейке оценивают неглобальные эндпоинты на 10% дороже, Gemini 3.5 Flash за $1.65/$9.90 против $1.50/$9.00.
Две вещи в этой таблице стоят больше, чем заголовочные цены. Каждая из этих лабораторий даёт скидку на пакетную обработку 50% и на вход, и на выход, и это самый крупный рычаг из доступных, если хоть какая-то часть вашей нагрузки может подождать. И кешированный вход идёт по десятой части свежего входа у всех трёх, так что агент со стабильным системным промптом платит долю того, что предполагает прайс. Мы разобрали эту математику подробно в Anthropic vs OpenAI prompt caching.
Цена нативного пути административная, и она тихо накапливается. Четыре лаборатории означают четыре ключа, четыре панели, четыре биллинговых отношения и четыре разных свода правил по лимитам, у которых нет общей терминологии. Мы сравнили пять таких сводов бок о бок в LLM API rate limits compared, и они расходятся почти во всём, включая то, что такое «запрос».
Идите нативным путём, если вы стандартизированы на одной лаборатории, если вам нужен доступ в день релиза, или если ваш объём достаточно велик, чтобы вы захотели прямой коммерческий разговор с кем-то. Он перестаёт быть комфортным в тот момент, когда вы ещё оцениваете модели, когда вам нужно куда переключиться в тот день, когда у одной лаборатории неудачный день, или когда у вас четыре ключа, а финансовый отдел начал о них спрашивать.
Тип 2: Хостеры инференса открытых весов
Эта категория существует потому, что часть весов моделей публична, а значит цену задаёт экономика GPU, а не тот, кто владеет моделью. Конкуренция здесь реальная, и цены это показывают.
| Модель | Хостер | Вход /1M | Выход /1M |
|---|---|---|---|
| gpt-oss-20B | Together | $0.05 | $0.20 |
| gpt-oss-20B | Groq (openai/gpt-oss-20b) | $0.075 | $0.30 |
| LFM2.5-8B-A1B | Together | $0.03 | $0.12 |
| gpt-oss-120B | Together | $0.15 | $0.60 |
| gpt-oss-120B | Groq (openai/gpt-oss-120b) | $0.15 | $0.60 |
| Qwen3.5-397B-A17B | Together | $0.60 | $3.60 |
| Llama 3.3 70B | Together | $1.04 | $1.04 |
| Llama 3.3 70B | Groq (llama-3.3-70b-versatile) | $0.59 | $0.79 |
| DeepSeek V4 Flash | DeepSeek (нативно) | $0.14 | $0.28 |
Цены как опубликованы на странице цен каждого вендора, проверено 2026-08-02.
Читайте эту таблицу парами строк, потому что дублирующиеся имена моделей это и есть суть. Одни и те же опубликованные веса, и сколько вы платите, зависит от того, на чьём кластере они запущены. Together дешевле на gpt-oss-20B, $0.05/$0.20 против $0.075/$0.30. Groq дешевле на Llama 3.3 70B, $0.59/$0.79 против плоских $1.04/$1.04. Они на равных на gpt-oss-120B. Никто не выигрывает категорию, и это то, что вы получаете на рынке, где продукт коммодитизирован, а дифференциация в планировании. Это также означает, что пропускная способность и цена не идут вместе: 1000 tok/s у Groq относятся к gpt-oss-20B у Groq по цене Groq, а не к более дешёвому листингу тех же весов у Together.
Две структурные вещи отделяют эту категорию от остальных.
Первая в том, что вы можете выйти за пределы оплаты за токен. Together публикует выделенные инстансы H100 по $5.49/час по запросу и GPU-кластеры по $3.99 за GPU-час, падающие до $3.19 при резервировании. Fireworks указывает GPU по запросу по $7.00/час за H100 или H200, $10.00 за B200 и $12.00 за B300. Это даёт вам точку безубыточности, которую можно посчитать: один H100 по $5.49/час это около $4,000 в месяц, так что как только ваш бессерверный счёт на модели класса 20B перешагнёт это и ваш трафик станет стабильным, а не рваным, выделенные начинают выигрывать. Рваный трафик держит вас на бессерверном дольше, чем подсказывает арифметика, потому что вы платите и за простаивающие часы.
Вторая это ловушка, которую стоит назвать. Доступность модели у этих хостеров не является обещанием. Документация моделей Groq делит каталог на production и preview, и формулировка про preview необычно прямая: эти модели «intended for evaluation purposes only and should not be used in production environments as they may be discontinued at short notice». На момент проверки 2026-08-02 этот список включал qwen/qwen3.6-27b. Если вы прибиваете ID preview-модели в продакшене, вы приняли зависимость, которую вендор письменно просил не принимать.
Эта категория заслуживает своего места на большом объёме против публичных весов, на задачах с маленькими моделями, критичных к задержке, и на всём, что вы, возможно, захотите однажды забрать внутрь и хостить у себя с теми же выходами. Это неправильное место, если вам нужна фронтир-модель с закрытыми весами, или если вам нужно, чтобы один конкретный ID модели всё ещё существовал в следующем квартале.
Тип 3: Роутеры и агрегаторы
Роутер не выполняет инференс. Он принимает ваш запрос, решает, какому апстриму его отдать, пересылает его и возвращает вам нормализованный ответ. Вы покупаете отсутствие работы по интеграции: один ключ, один баланс, один формат провода и запасной путь, который вам не пришлось строить.
Вопрос по ценам, который люди задают об этой категории, в том, есть ли наценка, и ответ для двух крупнейших интереснее, чем «да» или «нет».
OpenRouter прямо заявляет, что не делает наценку на инференс: «We pass through the pricing of the underlying providers; there is no markup on inference pricing (however we do charge a fee when purchasing credits).» Доход перемещается на уровень оплаты. Его FAQ ставит комиссию по карте на «a 5.5% ($0.80 minimum) fee when you purchase credits», крипту на 5%, а маршрутизацию через собственный ключ на «5% of what the same model and provider would normally cost on OpenRouter», как только вы перейдёте первый 1M BYOK-запросов в месяц. При месячных тратах на токены в $600 комиссия по карте составляет около $33. При $10,000 это $550. Мы расписали каждую комиссию в OpenRouter pricing: the hidden 5.5% fee и отдельно посмотрели на продакшн-надёжность в Is OpenRouter reliable?.
Поскольку ofox тоже в этой категории, честно проверить наш собственный прайс-лист тем же способом. Каждая страница модели, которую я вытянул 2026-08-02, против опубликованного прайса вендора:
| ID модели | Указано у ofox | Прайс вендора | Совпадает |
|---|---|---|---|
anthropic/claude-opus-5 | $5 / $25 | $5 / $25 | Да |
anthropic/claude-sonnet-5 | $2 / $10 | $2 / $10 | Да |
openai/gpt-5.5 | $5 / $30 | $5 / $30 | Да |
google/gemini-3.6-flash | $1.50 / $7.50 | $1.50 / $7.50 | Да |
deepseek/deepseek-v4-flash | $0.14 / $0.28 | $0.14 / $0.28 | Да |
openai/gpt-5.6-luna | $1 / $6 | $0.20 / $1.20 | Нет, 5x выше |
Пять из шести по прайсу, одна существенно выше. Строка Luna это не ошибка округления: OpenAI снизил прайс этой модели на 80% 2026-07-30, а листинг всё ещё показывал уровень до снижения три дня спустя. Урок применим к каждому роутеру, включая этот. Прайс-лист шлюза это снимок, а прайсы вендоров меняются без предупреждения, так что проверяйте страницу модели для точного ID модели в тот день, когда планируете её вызывать, а не экстраполируйте из чьей-то репутации дешёвого. То же наблюдение мы отметили в DeepSeek V4 Flash vs Gemini 3.6 Flash.
Другое, что стоит проверить перед выбором роутера, это какие форматы провода он поддерживает, потому что ваш инструментарий не имеет права голоса. Claude Code хочет формат Anthropic Messages. Codex CLI хочет OpenAI. Роутер, отдающий только один из них, ставит слой трансляции на ваш путь. ofox документирует три базовых URL, по одному на протокол: https://api.ofox.run/v1 для OpenAI Chat Completions, https://api.ofox.run/anthropic для Messages, https://api.ofox.run/gemini для Gemini. Его /v1/models вернул 122 model IDs по 12 provider prefixes, когда я вызвал его 2026-08-02.
Роутер окупается, пока вы ещё выбираете модели, как только вы вызываете более двух вендоров, когда вам нужно переключение при отказе, которое вам не пришлось строить, или когда один предоплаченный баланс легче защитить, чем четыре отношения с картой на файле. Это неправильный уровень, если вам нужен совершенно новый SKU в первый день, если вам нужна фирменная возможность только у первоисточника, или если вы напрямую договорились об объёмной скидке с лабораторией. В последнем случае идти через кого-то ещё строго хуже.
В этой категории больше двух продуктов. Мы проранжировали семь из них, с заметками по миграции, в 7 best OpenRouter alternatives, а общий фреймворк выбора в гайде по шлюзам LLM API.
Тип 4: Облачные платформы
Amazon Bedrock, Google Vertex AI и Microsoft Foundry продают другой продукт, чем все выше, и делать вид, что нет, это как команды разочаровываются в них. Они продают закупку. Модель это строка в счёте, который ваша компания уже платит, внутри аккаунта, который ваша команда безопасности уже проверила, списываемая против обязательства, которое вы, возможно, уже подписали. Для достаточно крупной организации это стоит реальных денег, а цена токена почти нерелевантна.
Надбавки реальны и они задокументированы.
| Надбавка | Где | Размер |
|---|---|---|
| Региональный или мультирегиональный эндпоинт | Bedrock, Google Cloud | 10% над глобальными эндпоинтами. Документация Anthropic ограничивает это Claude Sonnet 4.5, Haiku 4.5, Opus 4.5 «and all future models», так что Opus 5 и Sonnet 5 включены |
| Приоритетный уровень сервиса | Vertex AI | 1.8x стандартного. Google не печатает множитель, но каждая строка Gemini делится ровно на него: 3.6 Flash идёт с $1.50/$7.50 до $2.70/$13.50 |
| Инференс-география только для США | Claude API, Claude Platform на AWS, Foundry | 1.1x на всех категориях токенов, Claude 4.6 и позднее |
| Провижн-пропускная способность | Bedrock | За единицу модели в час, с ставками без обязательств, на 1 месяц и на 6 месяцев. В таблице Provisioned Throughput раздела Cohere, Cohere Command идёт по $49.50, $39.60 и $23.77 соответственно |
| Уровень Batch / Flex | Bedrock, Vertex AI | Скидка, а не надбавка: 50% от стандарта |
Механика биллинга тоже различается, способами, важными для того, кто сверяет счёт. Claude Platform на AWS и Claude в Microsoft Foundry оба выставляют счёт в Claude Consumption Units по фиксированной $0.01 за CCU, с почасовым замером и месячным счётом. Документация Anthropic описывает это как «Arrears only (postpaid); no prepaid credits», и ваш облачный счёт показывает одну строку CCU, а не разбивку по моделям. Если ваше распределение затрат зависит от того, чтобы видеть, какая модель сколько потратила, эта сверка происходит в консоли вендора, а не в Cost Explorer.
Bedrock также назначает цены по регионам, с отдельными таблицами для US East, Frankfurt, Sydney и других, и делит инференс на уровни Standard, Flex, Priority и Reserved. Провижн-пропускная способность указывается за единицу модели в час, а не за токен, и для моделей Anthropic страница вообще не публикует ставку: она говорит вам обратиться в свою аккаунт-команду, что является справедливым итогом всей категории. Vertex назначает кешированный вход по 10% от стандарта, тот же коэффициент, что и у первоисточника.
Покупайте здесь, когда у вас есть законтрактованные расходы на выработку, когда закупка воспринимает нового вендора как проект на квартал, или когда комплаенс становится легче в тот момент, когда трафик остаётся внутри аккаунта, которым вы уже владеете. Покупайте в другом месте, когда хотите новейшую модель, самую низкую цену, или API-ключ вместо IAM-роли. Аутентификация в этой категории это реальная работа: подписание SigV4 или учётные данные сервисного аккаунта вместо bearer-токена, день инженерии в первый раз и немного больше каждый раз, когда новому сервису нужен доступ.
Математика цен: одна и та же нагрузка, четырьмя способами
Прайс-листы не отвечают на вопрос, который люди на самом деле задают, а именно что говорит счёт. Три нагрузки, которые я вижу постоянно, по проверенным выше ставкам.
Нагрузка A. Клиентский ассистент на фронтир-модели. 20M входных и 5M выходных токенов в месяц на Claude Opus 5.
| Маршрут | Расчёт | В месяц |
|---|---|---|
| Anthropic напрямую, глобальный эндпоинт | 20 × $5 + 5 × $25 | $225 |
| Роутер по прайсу | Те же ставки | $225 |
| Партнёрское облако, региональный эндпоинт | $225 × 1.10 | $247.50 |
| Anthropic Batch API, если работа может подождать | 20 × $2.50 + 5 × $12.50 | $112.50 |
Тип, у которого вы покупаете, двигает этот счёт на 10%. То, можно ли работу пакетировать, двигает его на 50%. Этот порядок держится для большинства команд, и поэтому «какой провайдер дешевле» это неправильный первый вопрос.
Нагрузка B. Бэкенд агента на объёме. 200M входных и 50M выходных токенов в месяц, дешёвый уровень.
| Маршрут | Расчёт | В месяц |
|---|---|---|
| DeepSeek V4 Flash, нативные ставки | 200 × $0.14 + 50 × $0.28 | $42 |
| gpt-oss-120B на Together | 200 × $0.15 + 50 × $0.60 | $60 |
| gpt-5.6-luna, прайс OpenAI | 200 × $0.20 + 50 × $1.20 | $100 |
| gpt-5.6-luna, через листинг всё ещё на уровне до снижения | 200 × $1 + 50 × $6 | $500 |
| Gemini 3.6 Flash | 200 × $1.50 + 50 × $7.50 | $675 |
Разброс внутри одного уровня качества это 16x, и одна его строка это не что иное, как устаревший прайс-лист. Именно здесь проверка конкретной страницы модели окупается за полдня.
Нагрузка C. Офлайн-классификация. 500M входных и 20M выходных токенов в месяц на Claude Haiku 4.5.
| Маршрут | Расчёт | В месяц |
|---|---|---|
| Claude Haiku 4.5, Batch API со скидкой 50% | 500 × $0.50 + 20 × $2.50 | $300 |
| Claude Haiku 4.5, стандартные ставки | 500 × $1 + 20 × $5 | $600 |
| Gemini 3.6 Flash на Vertex, стандартный уровень | 500 × $1.50 + 20 × $7.50 | $900 |
| Gemini 3.6 Flash на Vertex, приоритетный уровень | 500 × $2.70 + 20 × $13.50 | $1,620 |
Первые две строки это один и тот же запрос к одной и той же модели, различающийся вдвое, разделённый только тем, готовы ли вы были подождать. Добавьте выбор модели и уровня, и разброс на одной ничем не примечательной нагрузке идёт от $300 до $1,620. Почти никто из тех, кто мог бы гонять нагрузку C в пакетном режиме, этого не делает.
Затраты, которых нет на странице цен
У каждой категории есть одна статья расходов, невидимая, пока не придёт.
| Тип | Невидимая затрата | Как это выглядит |
|---|---|---|
| Нативный | Интеграция, умноженная на число вендоров | Четыре SDK, четыре политики повторов, четыре свода правил по лимитам без общей терминологии |
| Нативный | Изменения токенизатора | Документация Anthropic отмечает, что Claude 4.7 и позднее используют токенизатор, производящий примерно на 30% больше токенов на тот же текст, так что обновление модели по той же цене всё равно может повысить ваш счёт |
| Хостер открытых весов | Простаивающие часы GPU | Выделенная мощность выставляет счёт и за впадину, и за пик; рваный трафик сжигает точку безубыточности |
| Хостер открытых весов | Отток каталога | ID preview-модели может быть отозван в короткий срок, по собственному предупреждению вендора |
| Роутер | Платёжные комиссии | 5.5% на пополнение картой у OpenRouter, плюс 5% за BYOK свыше 1M запросов в месяц |
| Роутер | Отставание прайс-листа | Строка Luna выше: 5x над прайсом три дня после снижения вендором |
| Облако | Инженерия аутентификации | IAM-роли и подписание запросов вместо bearer-токена, по разу на сервис |
| Облако | Сложение надбавок | Региональный 1.10 × приоритетный 1.8 складываются, прежде чем вы заметите |
| Все четыре | Отказ от пакетирования | 50% оставлено на столе на каждой нагрузке, которая могла бы подождать час |
Строка про токенизатор это та, которую никто не планирует. Обновление модели при идентичной цене за токен всё равно может повысить ваш счёт, если новый токенизатор плотнее, и никакая таблица сравнения цен вам этого не покажет.
Когда нужны два типа, и когда одного достаточно
Одного типа достаточно, когда ваш трафик идёт на одной или двух моделях, час простоя это раздражение, а не инцидент, и ваши месячные траты достаточно малы, чтобы разница в 10% не стоила интеграции. Это описывает большинство команд дольше, чем они ожидают.
Второй тип нужен, как только становится верным одно из трёх. Сбой модели обходится вам дороже, чем стоило бы построить запасной вариант, и в этом случае роутер это самый дешёвый второй маршрут, потому что переключение при отказе это то, что он продаёт. Ваш финансовый процесс не может переварить ещё одного вендора, и в этом случае облачная платформа решает проблему, которую никакая ценовая оптимизация не решит. Или ваш объём на одной конкретной модели достаточно велик, чтобы выделенное развёртывание обыгрывало оплату за токен, что ставит вас на хостера открытых весов независимо от того, что ещё вы гоняете.
Пара, которая появляется чаще всего, это нативный ключ плюс роутер. Нативный ключ несёт основной трафик и даёт вам модели в день релиза и самый высокий потолок лимитов. Роутер это аварийный выход, уже интегрированный, держащий небольшой баланс, в одной строке ID модели от того, чтобы взять на себя работу.
Чего вам делать не стоит, так это покупать второго вендора того же типа и называть это резервированием. Два роутера, направленные на один и тот же апстрим-провайдер, отказывают вместе.
Смена типов без переписывания клиента
Выбор типа обратим, потому что три из четырёх категорий говорят на формате OpenAI Chat Completions. Нативный OpenAI, большинство хостеров открытых весов и большинство роутеров принимают одно и то же тело запроса, так что базовый URL и строка модели это единственное, что меняется.
Python
import os
from openai import OpenAI
ROUTES = [
("https://api.openai.com/v1", "gpt-5.6-luna"),
("https://api.ofox.run/v1", "deepseek/deepseek-v4-flash"),
("https://api.ofox.run/v1", "anthropic/claude-opus-5"),
]
for base_url, model in ROUTES:
client = OpenAI(base_url=base_url, api_key=os.environ["API_KEY"])
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": "Summarize this in one line."}],
)
print(model, r.usage.total_tokens, r.choices[0].message.content[:80])
Node
import OpenAI from "openai";
const routes = [
["https://api.openai.com/v1", "gpt-5.6-luna"],
["https://api.ofox.run/v1", "deepseek/deepseek-v4-flash"],
["https://api.ofox.run/v1", "anthropic/claude-opus-5"],
];
for (const [baseURL, model] of routes) {
const client = new OpenAI({ baseURL, apiKey: process.env.API_KEY });
const r = await client.chat.completions.create({
model,
messages: [{ role: "user", content: "Summarize this in one line." }],
});
console.log(model, r.usage.total_tokens, r.choices[0].message.content.slice(0, 80));
}
Прогоните этот цикл на своих собственных промптах, прежде чем зафиксировать тип. Число токенов различается между моделями сильнее, чем цены, и модель, которая в 3x дешевле за токен, но тратит в 4x больше выходных токенов, не дешевле. В каталоге моделей ofox есть текущие ставки по каждой модели, если вам нужны сегодняшние числа, а не числа этой статьи.
Облачные платформы это категория, которая не вписывается в этот паттерн, и это честная причина, почему с ними больше работы. Bedrock и Vertex хотят подписанные запросы и платформенные SDK, так что переход на них или с них это миграция, а не две отредактированные строки.
Источники, проверенные для этого обновления
- Цены на модели Anthropic, пакетирование, кеширование, партнёрские облака и биллинг CCU: platform.claude.com/docs/en/about-claude/pricing (проверено 2026-08-02)
- Прайс-лист GPT-5.x у OpenAI и скидка на пакетирование: developers.openai.com/api/docs/pricing (проверено 2026-08-02)
- Цены Vertex AI Gemini, таблицы стандартного и приоритетного уровня, глобальные против неглобальных ставок, скидка на пакетирование: cloud.google.com/vertex-ai/generative-ai/pricing, что теперь перенаправляет на страницу цен Agent Platform (проверено 2026-08-02)
- Уровни цен Amazon Bedrock, скидка на пакетирование, обязательства по провижн-пропускной способности, таблицы по регионам: aws.amazon.com/bedrock/pricing (проверено 2026-08-02)
- Структура комиссий OpenRouter, все цитаты:
openrouter.ai/docs/faq(проверено 2026-08-02) - Бессерверные, выделенные и кластерные цены Together:
together.ai/pricing(проверено 2026-08-02) - Цены на GPU по запросу у Fireworks:
fireworks.ai/pricing(проверено 2026-08-02) - Политика production против preview у Groq, цены за токен и цифры пропускной способности:
console.groq.com/docs/models(проверено 2026-08-02) - Цены по каждой модели и размер каталога ofox: страницы моделей под
ofox.ai/ru/models/, плюс живой вызовGET /v1/models; базовые URL протоколов изofox.ai/llms-full.txt(проверено 2026-08-02)


