01.08.2026

Большие модели и цена миллиона токенов

server one
Иван Богданов

Иван Богданов | Технический писатель

Последнее обновление: 01.08.2026
HOSTKEY

Каждый раз, когда выходит новая нейросетевая модель, в комментариях к новости начинается спор про цену использования. «Китайские дешевле на порядок», «у Anthropic грабительский подход», «подписка выгоднее API» и так далее. Заканчиваются такие споры, как правило, ничем, и дело тут не только во вкусовщине, но в личном опыте, который основывается на разных задачах применения. Сравнивают при этом обычно не одно и то же, ведь цены публикуются в разных валютах, часть тарифов временная и через месяц вырастет, одна и та же модель через посредника может стоить в разы дороже (а иногда дешевле), чем у разработчика, а балл на бенчмарке зависит от того, кто именно его измерял и на каком стенде, и по каким методикам.

Работа с моделями давно стала повседневностью, и на размеры счетов эти споры не влияют никак, так что считать итоговые затраты всё равно приходится самостоятельно.

Например, Wall Street Journal в своей статье разбирает иск, который житель Вашингтона Карл Кан подал к Anthropic. По словам Кана, реальные лимиты тарифов Max с пятикратным и двадцатикратным запасом заметно ниже обещанных на сайте, а за один пятичасовой сеанс работы с Claude Code у него ушло пятнадцать процентов недельного лимита. Иск был подан с расчётом на статус коллективного от имени всех пользователей, кто покупал эти тарифы с апреля 2025 года, и чем закончится дело, пока неясно.

В этом же материале приводится случай с противоположной стороны, когда американская компания за месяц потратила пятьсот миллионов долларов на токены Claude просто потому, что не выставила сотрудникам лимиты. История поучительная и забавная для всех, кроме ее участников. Ни та компания, ни Кан со своей подпиской заранее не знали, во что им обойдется доступ к модели.

Цифры для этой статьи, вместо того чтобы сверяться с чужими сводными таблицами, мы собрали сами со страниц самих компаний и из технических отчётов и документации. Мы рассмотрели больше десятка моделей с трёх площадок, определив начальные тарифы, цену кэша и плату за длинный контекст и баллы бенчмарков. Заодно сверились с собственной статистикой аренды открытых моделей, которая, как оказалось, часто не похожа на публичные рейтинги.

LLM-модели на вашем сервере

Последние версии популярных LLM-моделей уже предустановлены на вашем сервере.

Почему сравнивать цены стало сложнее, чем год назад

Еще еще год назад разговор о ценах сводился как правило к трем-четырем семействам моделей, то сейчас их около десятка, и внутри каждого есть несколько уровней, различающихся по стоимости в разы. Насколько всё разрослось, проще всего увидеть на примере Alibaba, чей прайс-лист Model Studio на момент проверки содержит сто девяносто четыре позиции в одном только разделе генерации текста, причём вместе с моделями сторонних разработчиков. Боковое меню того же раздела при этом показывает двести двадцать две единицы, суммируя двести пятнадцать моделей от Qwen и семь сторонних, так что даже эта страница в данных расходится сама с собой.

Anthropic публикует тарифы в долларах США, OpenAI в европейской версии страницы показывает цены евро, а прайс Alibaba переключается между зонами, из-за чего цифры для материкового Китая, США и Евросоюза различаются между собой, и для сравнения их приходится приводить к единой валюте по текущему курсу. Данные Alibaba, приведенные ниже, взяты с международного раздела. 

Цена на тот же Sonnet 5 сейчас начинается от двух долларов за миллион входных токенов и десяти долларов США за миллион выходных, однако это акционный тариф, действующий до тридцать первого августа 2026 года, после чего ставки станут три и пятнадцать долларов США соответственно, то есть цена модели по API подорожает в полтора раза. Причем узнаётся такое из сноски под таблицей, а не из строки с ценой.

Модель

Вход, за 1 млн токенов (долларов США)

Выход, за 1 млн токенов (долларов США)

Claude Fable 5

10

50

Claude Opus 4.8

5

25

Claude Sonnet 5 (акционная цена)

2

10

Claude Haiku 4.5

1

5

DeepSeek-V4-Pro (напрямую) 

0,435

0,87

DeepSeek-V4-Flash (напрямую) 

0,14

0,28

deepseek-v4-pro (через Alibaba)

2,4

4,8

deepseek-v4-flash (через Alibaba)

0,2

0,4

glm-5.2

1,4

4,4

kimi-k2.7-code

0,95

4

qwen3.6-max-preview (до 128k)

1,3

7,8

qwen3.6-max-preview (128k–256k) 

12 

qwen-turbo 

0,05

0,2

Цены Claude взяты со страницы Anthropic, цены DeepSeek из документации самой компании, остальные из прайса Alibaba Model Studio.

Разница по входу между qwen-turbo и Fable 5 составляет двести раз, и сопоставлять их напрямую бессмысленно, поскольку это инструменты для разных задач. Нижняя граница при этом уходит и вовсе в ноль, поскольку открытые модели типа GLM-4.7-Flash и GLM-4.5-Flash распространяются бесплатно целиком, вместе их весами. Порядок величин при этом хорошо объясняет, почему в разговорах про экономию так часто всплывают китайские модели. Оправдывается ли дешевизна результатом, по прайсу не видно вовсе, и к этому мы вернемся ниже.

Одна и та же модель по двум разным ценам

Строчки с DeepSeek в таблице выше дублируются намеренно, поскольку одна и та же модель продаётся сразу в двух местах и стоит там по-разному. Через Alibaba Model Studio deepseek-v4-pro обходится в два доллара сорок центов за миллион входных токенов, тогда как в прайсе самой DeepSeek та же модель стоит сорок три с половиной цента при промахе мимо кэша, то есть в пять с половиной раз дешевле. Такой же множитель держится и на выходе, где посредник берёт четыре доллара восемьдесят центов против восьмидесяти семи центов напрямую. У Flash разрыв заметно скромнее и составляет около сорока процентов.

Ровной наценка остается, впрочем, только на этих строках, а на кэше она ведёт себя иначе, причем у каждой модели по-своему. Попадание в кэш у Flash через посредника стоит четыре цента за миллион против трёх десятых цента напрямую, что даёт разрыв примерно в четырнадцать раз при сорока процентах на обычном входе. У Pro та же операция обходится в двадцать центов вместо трети цента, и здесь разрыв доходит до пятидесяти пяти раз при пятикратной разнице на входе. Тот, кто выбирал площадку по цене за токен и рассчитывал добрать экономию на кэше, обнаружит, что вторая половина расчёта устроена совсем не так, как первая.

Похожее происходит и на второй модели. У glm-5.2 витринные цены совпадают на обеих площадках до цента, доллар сорок за вход и четыре сорок за выход, а расходится только попадание в кэш, двадцать шесть центов у самой Z.ai против двадцати восьми через Alibaba.

Объяснение у такой наценки простое, так как через площадку от Alibaba продаются модели разных разработчиков в одном интерфейсе, с общим счётом и без отдельного договора с каждым из них, а сам посредник при этом тоже хочет что-то заработать. Практический вывод отсюда следует скорее про саму процедуру сравнения, чем про Alibaba. Прежде чем сопоставлять цены, имеет смысл выяснить, чей это прайс, потому что обзоры, где DeepSeek идет одной строкой без указания площадки, ошибаются в разы. Мы и сами в первой версии таблицы при написании данной статьи по ошибке взяли цифры именно посредника.

кэш меняет арифметику сильнее, чем выбор модели

Скидка за попадание в кэш у DeepSeek оказывается настолько крупной, что рядом с ней разница между соседними моделями линейки почти теряет значение. Миллион входных токенов, попавших в кэш, стоит около трёх десятых цента для Flash и чуть больше трети цента для Pro, тогда как те же токены мимо кэша обходятся в четырнадцать центов и сорок три с половиной соответственно, то есть в пятьдесят и в сто двадцать раз дороже. Выигрыш такого порядка получается если у вас в запросе есть много повторяющихся данных, вроде большого системного описания или одного и того же куска документации, которые уходят в модель при каждом обращении.

Устроен механизм у DeepSeek к тому же довольно прозрачно. Кэширование на диске включено по умолчанию для всех, отдельного параметра в запросе не требуется, а платы за запись в кэш прайс не предусматривает, так что кэш здесь работает только в плюс. Но рассчитывать на него как на гарантию экономии средств не стоит, поскольку документация прямо называет такую систему «работающей по мере возможности» и стопроцентной доли попаданий не обещает. Удешевляет она к тому же только вход, а выход считается заново при каждом обращении.

Из-за механизма «скользящего окна внимания» сохраненный фрагмент является самостоятельной завершенной единицей, и попадание в кэш засчитывается только при полном совпадении с ней. Простого пересечения данных недостаточно. Сохраняются такие единицы на границах запроса, т. е. в конце пользовательского ввода, в конце ответа модели, затем при обнаружении общего начала у нескольких обращений, и, наконец, через фиксированные интервалы токенов. 

Такой подход позволяет избежать ситуации, при которой длинный запрос не остался не кэширующим целиком из-за того, что граница запроса не была достигнута. Помнить стоит и про срок жизни, так как неиспользуемый кэш очищается автоматически. Обычно это происходит за время от нескольких часов до нескольких дней, из-за чего редкая нагрузка оплачивается по полной каждый раз. Отслеживать фактическую долю попаданий удобно по полям prompt_cache_hit_tokens и prompt_cache_miss_tokens в ответе.

У Anthropic та же логика реализована иначе, и пропорции скромнее. Чтение из кэша у Anthropic стоит десятую часть обычного входа, то есть доллар за миллион у Fable 5, а запись на четверть дороже входа, двенадцать долларов пятьдесят центов. Из-за платной записи выгода появляется только начиная со второго обращения к одному и тому же содержимому, причем правило это работает одинаково для всей линейки от Haiku 4.5 до Fable 5. 

Глубина скидки у остальных разработчиков различается сильнее. У kimi-k2.7-code попадание в кэш стоит девятнадцать центов против девяноста пяти на обычном входе, у glm-5.2 двадцать шесть центов против доллара сорока по прайсу самой Z.ai, и в обоих случаях экономия выходит пятикратной. Хранение кэша Z.ai сейчас объявлено «временно бесплатным» по всей линейке, так что однажды за него все таки начнут брать деньги. У qwen3.6-max-preview соотношение почти в точности повторяет логику Anthropic, где чтение обходится в тринадцать центов при входе в доллар тридцать, а запись стоит доллар шестьдесят две с половиной. 

Что еще видно в документации, а не в прайсе

Цена в прайсе указывается за миллион токенов, и читающий его обычно предполагает, что она едина для всех случаев, тогда как у части моделей Alibaba ставка растет вместе с длиной запроса, о чём короткие обзоры обычно умалчивают. У qwen3-coder-30b-a3b-instruct таких ступеней градации четыре, и на входе до тридцати двух тысяч токенов данный «миллион» обходится в сорок пять центов США, дальше идут семьдесят пять центов, доллар двадцать и наконец два доллара сорок центов при размере входных данных от двухсот пятидесяти шести тысяч до миллиона токенов, то есть верхняя ступень дороже нижней в пять с лишним раз. Выход дорожает еще быстрее, с двух долларов двадцати пяти центов до четырнадцати долларов сорока центов США, а это уже более чем в шесть раз.

У qwen3.6-max-preview указанные в таблице выше доллар тридцать центов и семь долларов восемьдесят центов действуют до размера входных данных до ста двадцати восьми тысяч токенов, а на диапазоне до двухсот пятидесяти шести тысяч ставки становятся уже два доллара и двенадцать центов, то есть растут примерно в полтора раза и на входе, и на выходе. У qwen3-coder-480b-a35b-instruct разброс куда шире, и на последней ступени ставки ведут себя по-разному. Вход дорожает с четырёх с половиной долларов до девяти, ровно вдвое, тогда как выход прыгает с двадцати двух с половиной до девяноста, вчетверо за один шаг. Соотношение выхода ко входу держится пятикратным на первых трёх ступенях и становится десятикратным на последней, так что нагрузка с длинным контекстом и развёрнутыми ответами дорожает быстрее, чем следует из нижних строк прайса.

У DeepSeek длина запроса на ставку не влияет вовсе, и обе модели V4 работают с контекстом в миллион токенов и ответом до трёхсот восьмидесяти четырёх тысяч токенов по единой цене, что для длинных задач само по себе преимущество. Зато обе поддерживают режим рассуждения, который включен по умолчанию, пока его не отключат явно, из-за чего модель успевает выдать тысячи невидимых токенов рассуждения прежде короткого ответа, и оплачиваются они все по ставке выхода.

У Alibaba режим рассуждения влияет на счёт с двух сторон сразу, поскольку меняет не только количество выходных токенов, но и саму ставку за них, тогда как вход остаётся прежним. Ниже в таблице приведен множитель расчета, который применяется к той или иной модели при включении или выключении режима рассуждения.

Модель

Выход, обычный режим

Выход, режим рассуждения

qwen-turbo

0,2

0,5

qwen3-30b-a3b

0,8

2,4 

qwen3-14b

1,4

4,2

qwen3-235b-a22b

2,8

8,4

Множитель у моделей в таблице держится тройным, а у qwen-turbo составляет два с половиной, причём на счёт режим рассуждения действует дважды, поскольку токенов становится больше и каждый из них дороже, так что итоговое расхождение с расчетом по обычному режиму выходит заметно крупнее самого множителя. Общего правила при этом не существует, и по остальному прайсу разброс идёт от единицы до тройки. У qwen3-32b обе строки одинаковы, шестнадцать центов на входе и шестьдесят четыре на выходе независимо от режима, а у сборок qwen3-235b-a22b с индексом 2507 множитель составляет два с половиной вместо трёх у той же модели без индекса. Размер модели о нём ничего не говорит, поскольку qwen3-32b с единицей стоит ровно между qwen3-14b и qwen3-235b-a22b, у которых тройка.

Разошлись модели DeepSeek и по пределу одновременных запросов, где Flash допускает две с половиной тысячи против пятисот у Pro. Упереться в этот потолок интерактивная нагрузка способна раньше, чем в бюджет, из-за чего он временами оказывается важнее цены за токен.

В корзину параметров, которых в прайсе нет вовсе, попадают окно контекста и скорость выдачи. На странице Qwen для qwen3.6-max-preview указано окно в двести шестьдесят две тысячи токенов, тогда как у преемника Qwen3.7-Max там же стоит миллион, и у большинства соседей по нашей таблице тоже миллион. Выдаёт модель около пятидесяти токенов в секунду по замерам Artificial Analysis и занимает по этому показателю сто девятнадцатое место из ста восьмидесяти шести. Для чата или редактора кода задержка такого порядка ощущается сильнее, чем разница в несколько центов на миллион.

Имена deepseek-chat и deepseek-reasoner соответствуют обычному режиму и режиму рассуждения у deepseek-v4-flash, и двадцать четвёртого июля 2026 года их вывели из обращения. Сама DeepSeek оговаривает, что оставляет за собой право менять цены, и советует пополнять счёт по фактическому расходу, сверяясь со страницей тарифов.

Разные стенды дают разные баллы

Балл на бенчмарке в обзорах приводят одной цифрой, будто модель показывает его сама по себе, тогда как получают всегда такую цифру всегда по данным прогона чьих-то тестов, которые зависят от конкретного железа испытательного стенда и конкретных  настроек. Насколько это меняет дело, видно, если глянуть на одну и ту же модель при одинаковом наборе задач.

У SWE-bench Pro семьсот тридцать одна задача из живых репозиториев, причём патч засчитывается, только если новые тесты на исправление пройдены, а старые не упали. Claude Opus 4.6 закрывает на нём пятьдесят одну и девять десятых процента задач по замеру Scale, тогда как Moonshot в карточке своей K2.6 ставит той же модели пятьдесят три и четыре, а DeepSeek в техническом отчёте пятьдесят семь и три, то есть на пять и четыре десятых пункта больше, чем получилось у Scale. Рядом со своим числом Scale печатает доверительный интервал в три и шесть десятых пункта в обе стороны, и замер Moonshot в этот коридор попадает целиком, так что половина разрыва объясняется обычной погрешностью измерения. Результат DeepSeek при этом за выходит верхнюю границу.

Настройками рассуждения остаток разрыва не объясняется, ведь Moonshot и DeepSeek обе подписывают свой замер как максимально возможный, расходясь при этом на 3.9 пункта. У Scale строка помечена «звёздочкой», а звёздочка означает прогон через mini-swe-agent вместо SWE-Agent из основной методики.

Та же история повторяется на модели другого разработчика, поскольку в своём отчёте DeepSeek оценивает V4-Pro в режиме Max в 55.5%, а в сравнительной таблице, опубликованной Alibaba к выходу Qwen3.7-Max, той же модели стоит уже 59%, то есть на три с половиной пункта больше. Придраться тут не к чему, так как условия замера у них был попросту разные.

Конфигурацию испытательного стенда и методику DeepSeek описывает подробно в том же техническом отчете, и это внутренняя разработка с двумя инструментами, командной оболочкой и редактированием файлов, с потолком в пятьсот шагов взаимодействия и контекстом до пятисот двенадцати тысяч токенов. Scale прогоняет модели через собственную обвязку, выложенную вместе с набором задач на GitHub, из-за чего эти данные дают адекватную картину по все моделям, зато отстают по их составу, ведь на момент сбора данных новейших моделей Claude там не было вовсе и старшей оставалась Opus 4.6.

Однородность этого сравнения тоже относительна, в чём убеждает сноска под таблицей результатов. Часть моделей прогонялась с ограничением по стоимости и потолком в пятьдесят итераций, остальные без ограничения по стоимости и с потолком в двести пятьдесят итераций, а строки со звёздочкой, включая интересующий нас Opus 4.6, оценивались через mini-swe-agent, а не через SWE-Agent, описанный в основной методике. Влияет на порядок мест и выбор набора задач, поскольку на том же закрытом наборе из проприетарных репозиториев Opus 4.1 в своё время опустился с 22.7 до 17.8 пунктов, тогда как GPT-5 съехал с 23.1 до 14.9, поменявшись с ним местами.

K2.6 в отчёте DeepSeek идёт с оценкой 58.6, ровно как и в карточке самой Moonshot, а GLM-5.1 с 58.4, как в публикации Z.ai. Точность до десятой по двум строкам подряд наводит на мысль, что чужие результаты в такие таблицы переносят из публикаций, а не перепроверяют, тем более что DeepSeek прямо оговаривает, что до части моделей достучаться через программные интерфейсы не смогла.

Для моделей из нашей таблицы цен картина выглядит так:

Модель из прайса

SWE-bench Pro

Чей прогон

Claude Fable 5

80,0

Anthropic, системная карта

Claude Opus 4.8 

69,2

Anthropic

glm-5.2 

62,1

Z.ai

DeepSeek-V4-Pro

55,4

DeepSeek, технический отчёт

kimi-k2.7-code

нет данных

замер не публиковался

qwen3.6-max-preview

нет данных

заявлено первое место без цифры

Значения собраны двадцать второго июля 2026 года, и ни одно из них не получено в единой процедуре оценки. Балл DeepSeek вдобавок снят в режиме Max, тогда как в прайсе выше та же модель идет без указания режима, а он влияет и на результат, и на количество выходных токенов, то есть на итоговый счет.

80 процентов для Fable 5 воспроизводит система оценок BenchLM из раздела 8.2 системной карты Anthropic, где результат усреднён по пяти прогонам, тогда как в анонсе та же модель идет как 80.3, то есть расхождение возникает ещё до всякого сравнения с конкурентами. Значение 62.1 для glm-5.2 взяты из публикации Z.ai, где рядом поставлены GPT-5.5 с 58.6 и собственный предшественник GLM-5.1. Claude Opus 4.8 в этой строке не участвует, хотя на соседних бенчмарках той же публикации присутствует, и на Terminal-Bench 2.1 GLM-5.2 ему уступает, 81 против 85. Соперников под каждый бенчмарк подбирают отдельно, и эта общая практика для всех публикаций такого рода.

В анонсе K2.7 Code Moonshot привела прирост по трём собственным наборам, Kimi Code Bench v2, Program Bench и MLS Bench Lite, а в независимые параметры модель не отправила вовсе. Alibaba в блоге Qwen заявила для qwen3.6-max-preview первое место сразу на шести бенчмарках, включая SWE-bench Pro, причём QwenClawBench и QwenWebBench разработала сама, и конкретных численных результатов не привела ни по одному, ограничившись приростом относительно предшественника.

В сводных обзорах K2.7 уже проставлен результат 58.6, хотя Moonshot его для этой модели не публиковала. Взялся он с карточки предыдущей K2.6, где ровно это значение стоит в таблице оценок. Мы и сами чуть не перенесли его дальше по цепочке.

На форуме Moonshot один из разработчиков пишет, что прогнал K2.5 через mini-swe-agent и получил результат ниже указанного в карточке модели. Исследователь Эллиот Арледж сравнил K2.7-Code с предшественницей на открытом наборе KernelBench-Hard и выложил полные журналы прогонов, обнаружив, что новая модель чаще пишет настоящие ядра вместо оберток над библиотеками, зато на задаче со смесью экспертов ее результат просел с 0.222 тысячных до 0.157. Там же разработчики публично спросили Moonshot, отправит ли она K2.7 на тесты в независимый DeepSWE, где ее предшественница набрала 24%, и ответа так и не получили.

По этому бенчмарку в сводной таблице собрана сорок одна запись, и проверенных среди них ноль, так что все значения там похоже взяты из публикаций самих авторов. 

Цена за решенную задачу

Artificial Analysis прогоняет модели на своём стенде и считает средневзвешенную стоимость одной задачи на основании собственного индекса, благодаря чему цена и результат впервые оказываются в одной системе координат, без смешивания чужих прогонов.

Модель

Индекс интеллекта

Стоимость задачи, долларов

Время генерации, минут

Скорость, токенов в секунду

Токенов на задачу

Достоверность

Claude Fable 5

60

2,75

4,8

74

~21 000

40

GPT-5.6 Sol (max)

59

1,04

3,9

64

~15 000

22

Kimi K3

57

0,95

10,2

33

~20 000

18

GLM-5.2 (max)

51

0,32

3,3

179

~35 000

4

DeepSeek V4 Pro (max)

44

0,04

8,0

69 

~33 000 

−10 

* Индекс версии 4.1, данные на двадцать второе июля 2026 года. Столбец с токенами посчитан нами перемножением времени на скорость, остальные значения взяты со страницы. Достоверность это сводный индекс AA-Omniscience, где ноль означает равное число верных и неверных ответов, а отрицательные значения означают перевес неверных.

Стоимость задачи у DeepSeek V4 Pro и Fable 5 различается почти в семьдесят раз, тогда как по самому индексу разрыв не дотягивает и до полутора раз, сорок четыре против шестидесяти. Отсюда и берутся разговоры про экономию на китайских моделях, только экономия эта не бесплатная. Четыре цента за задачу выглядят убедительно ровно до того момента, пока не выяснится, что DeepSeek единственный в наборе уходит по достоверности в минус, то есть на его ответы приходится больше неверных утверждений, чем верных. Перепроверять результат придётся руками, а эти трудозатраты ни в одном прайсе не учтены.

Списывать это на происхождение модели не выйдет, что видно по соседней строке той же таблицы. GLM-5.2 держит достоверность на уровне четырёх пунктов, оставаясь при этом второй по дешевизне и первой по скорости. Обе модели китайские, обе заметно дешевле американских флагманов, а по надёжности ответов расходятся так, что попадают в разные половины шкалы. Разница идёт не по географии, а по конкретной модели, и проверять её приходится поштучно.

Время генерации складывается из двух независимых величин, из количества выданных токенов и из скорости выдачи. На одну задачу индекса DeepSeek выдаёт около тридцати трёх тысяч токенов, большинство которых уходит на рассуждение и в ответе их не видно, и при скорости в шестьдесят девять токенов в секунду генерация занимает восемь минут. Kimi K3 выдает заметно меньше, около двадцати тысяч, зато ползёт на скорости в тридцат три токена в секунду и тратит десять минут, больше всех замеренных моделей. GLM-5.2 выдаёт больше всех, тридцать пять тысяч, и укладывается в три с небольшим минуты за счёт скорости в сто семьдесят девять токенов в секунду, оставаясь при этом второй по дешевизне. Многословность и медлительность между собой не связаны, и оценивать их приходится по отдельности.

Показатель времени учитывает только генерацию, без задержки до первого токена и накладных расходов, так что настоящее ожидание выходит длиннее. Для пакетной ночной обработки разница в минутах роли не играет, но для работы того же интерактивного помощника решает больше цены за токен.

Строка Claude Fable 5 подписана в исходной таблице как измерение связки с запасным маршрутом, где часть запросов уходит на Opus 4.8, так что измеряется не чистая модель, а конструкция целиком. Для расчёта расходов это даже честнее, поскольку в работе будет ровно такая конструкция.

Состав таблицы при этом отличается от нашего прайса, и совпадают в них ровно три строки, Fable 5, GLM-5.2 и DeepSeek V4 Pro. Остальное расходится: Artificial Analysis меряет Kimi K3 и GPT-5.6 Sol, которых в прайсе нет вовсе, а из Kimi в прайсе стоит другая версия, k2.7-code, и напрямую с K3 она не сопоставляется. Qwen3.6-max-preview на странице есть, только помечен как снятый с поддержки и замеры по нему продолжаются лишь для нагрузки по умолчанию, а сама Alibaba рекомендует переходить на Qwen3.7-Max. Прямого пересчета стоимости задачи для всех строк первой таблицы, таким образом, не получится.

Подписки

При работе в напрямую в чате тарифная картина устроена иначе. У Anthropic за бесплатным уровнем идёт Pro по семнадцать долларов США в месяц при годовой оплате, причём списываются они разом, двумя сотнями вперёд, а при помесячной оплате тариф стоит двадцать. Дальше начинается Max от ста долларов, где предлагается выбрать пятикратный или двадцатикратный запас относительно Pro, и двадцатикратный обходится в двести, причем годовой оплаты у Max нет вовсе и подписка идет помесячно. Командные тарифы собраны из двух видов мест, стандартное стоит двадцать долларов при годовой оплате и двадцать пять при помесячной, премиальное сто и сто двадцать пять, а места разных видов разрешено смешивать внутри одной команды.

В подписку Pro при этом входят Claude Code, Cowork, Design и Science, то есть агентные инструменты доступны уже на младшем платном уровне. Расходуют они лимит быстрее всего, и к этому мы вернемся ниже.

OpenAI на европейской странице считает в евро, и цифры оттуда приходится пересчитывать в доллары по текущему курсу, прежде чем ставить рядом с долларовыми тарифами Anthropic. Бесплатный уровень там дополнен планом Go за восемь евро, дальше идут Plus за двадцать три и Pro от ста трёх, а командный Business стоит двадцать один евро за пользователя при годовой оплате и двадцать шесть евро при помесячной. Ступеней у Pro две, и отличаются они между собой одним только объёмом работы, поскольку набор возможностей на обеих справка описывает как одинаковый. Годовой оплаты у Go, Plus и Pro нет вовсе, предоплата за несколько месяцев вперёд тоже не предусмотрена, так что семнадцати долларам Anthropic за год вперёд противопоставить здесь нечего.

До подписок у китайских компаний дело чаще всего не доходит. DeepSeek публикует только тарифы API с оплатой по фактическому расходу, советуя пополнять счёт по мере трат и регулярно сверяться со страницей, а Z.ai в документации для разработчиков перечисляет цены за токены и при этом выкладывает веса GLM-5.2 под лицензией MIT, из-за чего вопрос о подписке во многом теряет смысл.

Подписки Max у Anthropic и Pro у OpenAI описаны одинаково и предоставляют пятикратное или двадцатикратное увеличение квоты токенов, при этом базу обе компании также называют, поскольку у Anthropic множитель отсчитывается от тарифа Pro, а у OpenAI от тарифа Plus. Величину самой базы обе компании не раскрывают. Эта формулировка и стала предметом иска, о котором шла речь во вступлении.

Расширить квоту доплатой внутри тарифа OpenAI не позволят, поскольку настройки для повышения или обхода лимита не предусмотрено вовсе. У Anthropic такая настройка есть с мая, и подписчик Pro или Max может включить кредиты, чтобы работать сверх включенного в тариф объёма по ставкам API.

План Go в описании OpenAI может включать рекламу. Для дешевого тарифа потребительского уровня это обычная история, но для рабочего инструмента это является новшеством.

Названия моделей в тарифах разошлись с теми, что содержат обзоры даже полугодовой давности, и справка OpenAI расписывает доступность по ступеням рассуждения, где Medium и High входят в Plus, тогда как Extra High вместе с режимом Pro достаются только тарифам Pro, Business и Enterprise. Бесплатному уровню и плану Go модель GPT-5.6 Sol не полагается совсем, так что за задачу там берётся GPT-5.5 Instant, а режим рассуждения на Go включается отдельной кнопкой, дает десять сообщений за пять часов и работает на другой модели.

Младшая подписка перестает покрывать старшую модель

Девятнадцатого июля 2026 года Anthropic закончила акцию, по которой работа с Fable 5 списывалась из недельного лимита подписки, и перевела модель на отдельную оплату. На Pro и на стандартных местах командных тарифов модель по-прежнему доступна, только платить за неё теперь приходится сверх подписки и по фактическому расходу токенов.

Механизм оплаты сверх лимита появился не вместе с Fable 5, ведь статья справки про кредиты опубликована восемнадцатого мая 2026 года и описывает их как общую возможность для Pro, Max 5x и Max 20x. Июльский переход на модель воспользовался уже готовым механизмом, который до того выручал только при исчерпании недельного или сеансового лимита.

Взамен Anthropic единоразово начислила по сто долларов США в пересчете на кредиты владельцам Pro и столько же за каждое купленное стандартное место, причём больше двух с половиной тысяч одна компания не получила, сколько бы мест она ни купила, так что после двадцать пятого места начисление остановилось. Сейчас эти деньги лежат на общем балансе аккаунта, и забрать их можно с двадцатого июля по второе августа, а сгорают они семнадцатого сентября, когда бы вы их ни забрали. Потратить подарочные кредиты разрешено на любую модель, не только на Fable 5, и они же выручают, когда недельный лимит подписки закончился. 

Max и премиальные места в командных и корпоративных планах акция не задела. Fable 5 там остался внутри подписки, и тратить на него разрешено до половины недельного лимита без доплаты, поэтому и денег на счёт этим тарифам не клали. Цена подписки в семнадцать или двадцать долларов теперь ничего не говорит о том, во сколько обойдётся старшая модель, ведь часть работы оплачивается сверху. В бюджете команды это отдельная строка.

Корпоративный тариф был так устроен и без всякой акции. На странице Anthropic он расписан как двадцать долларов за место плюс расход по ставкам интерфейса программирования приложений, а сколько выйдет сверху, зависит от того, какую модель гоняют и на какой задаче. На младших тарифах то же самое стало видно только сейчас. 

Лимиты как невидимая часть цены

Anthropic обещает на тарифе Pro минимум впятеро больший объём работы за один сеанс по сравнению с бесплатным уровнем, оговариваясь, что считает по часам пик, а сколько при этом выйдет отправка данных, зависит от длины запроса вместе с приложенными файлами, от того, насколько успел разрастись чат, и от выбранной модели. Сеанс длится пять часов, после чего счётчик обнуляется. Сколько сообщений чата помещается в бесплатный уровень, компания не публикует нигде.

Множители в названиях старших тарифов относятся к тому же пятичасовому сеансу, и Max 5x даёт впятеро больший лимит относительно Pro, а двадцатикратный тариф соответственно в двадцать раз больший.

Недельный лимит живёт своей жизнью и никаким множителем в документации не описан. На Pro он один и распространяется на все модели, на Max их два, общий и отдельный для моделей Sonnet, а размеры не названы ни там, ни там. Сбрасывается недельный счётчик в фиксированное время, свое для каждой учётной записи, и посмотреть ближайший сброс можно в настройках. Компания также вправе ограничить расход и другими способами, включая недельные и месячные потолки, на своё усмотрение.

Сто шестьдесят сообщений за три часа для GPT-5.5 Instant на тарифах Plus и Go это единственное абсолютное число во всей справке OpenAI по лимитам частных подписок. Бесплатный уровень описан пятичасовым окном без цифры, причем ограничения там прямо названы динамическими и зависящими от нагрузки на систему, от рынка и от характера использования конкретной учетной записи. Квоты старших режимов рассуждения не названы вообще, и сообщается про них только то, что на сотенной ступени Pro они ниже, чем на двухсотенной.

Исчерпав лимит на Plus, работу можно продолжать, ведь беседа переключается на более простую модель GPT-5.5 Instant mini, а при исчерпании лимита на режимах рассуждения в дело идёт уже GPT-5.4 Thinking mini. Отвечает дальше другая модель, и узнать об этом получится разве что по качеству ответов. Время сброса лимитов ChatGPT также показывает.

Расход токенов идёт из общего запаса, поскольку веб-версия, настольное и мобильное приложения и Claude Code «питаются из одного котла», при этом Claude Code за одну задачу читает файлы, запускает команды, разбирает вывод, правит снова, и так десятки итераций подряд. В июле 2025 года Anthropic ввела для агента отдельные недельные лимиты, а поводом, по данным Wall Street Journal, стали жалобы на тех, кто держал его запущенным сутками. Кан в иске говорит про пятнадцать процентов недельного лимита за один пятичасовой сеанс работы.

Влияние политики на выбор модели

Двенадцатого июня 2026 года Anthropic получила предписание в рамках экспортного контроля и отключила Fable 5 вместе с Mythos 5. Закрыть доступ требовалось любому иностранному гражданину, где бы он ни находился, включая сотрудников самой компании с иностранным паспортом. Предупреждения и переходного периода не дали.

Гражданство в реальном времени компания проверять не умела, поэтому выключила обе модели для всех сразу. Метили в часть аудитории, доступ потеряли все. С Fable 5 контроль сняли тридцатого июня, и первого июля она вернулась. Mythos 5, которая рассчитана на специалистов по кибербезопасности, по данным Reuters так и осталась доступна лишь части доверенных организаций в США. В результате мы имеем три недели простоя для одной модели, для второй история не кончилась вовсе, и ни оплаченная подписка, ни договор тут ничего не решали.

Список поддерживаемых стран Anthropic ведёт отдельно для интерфейса программирования приложений и отдельно для веб-версии, и между собой они не совпадают. Куда важнее перечня одна оговорка: компания оставляет за собой право отказать организации, которой прямо или косвенно преимущественно владеют из страны за пределами списка. То есть смотрят не только на то, откуда уходят запросы, а ещё и на то, кому принадлежит юрлицо. Арендовать сервер в разрешенной стране и на этом успокоиться в случае с Anthropic недостаточно.

С китайской стороны происходит похожая ситуация. Седьмого июля 2026 года Reuters написал, что Минкоммерции Китая месяц вёл встречи с Alibaba, ByteDance и Z.ai о том, чтобы ограничить зарубежный доступ к самым сильным моделям, в том числе ещё не вышедшим и открытым по весам. Обсуждали там и вариант приравнять утечку или кражу такой модели к нарушению закона о национальной безопасности. Через две недели Reuters со ссылкой на Financial Times добавил, что рассматривается внесение передовых моделей в перечень технологий, ограниченных к экспорту, а вместе с ним и запрет на экспорт обучающих данных и на доступ к скачиванию весов моделей иностранцами. Но пока все происходит на уровне консультаций и сбора отзывов отрасли, а не является принятым решением.

Дело вдобавок не только в самих моделях, но и в том, кто владеет разработчиком. В апреле Пекин вынудил Meta свернуть покупку китайского стартапа Manus, а в июне ввел контроль над сделками, где замешаны иностранные инвесторы, технологии и данные. Выходит, оговорка Anthropic про преимущественное владение и китайские правила про иностранных инвесторов бьют в одну точку с разных сторон.

Достается и тем, кто китайские модели просто использует. Восьмого июля 2026 года CNBC сообщил, что Комитет по внутренней безопасности и профильный комитет по Китаю вместе расследуют применение китайских моделей в американских компаниях и уже разослали запросы, в том числе в Cursor и Airbnb. Запрета на использование при этом нет, хотя отдельные ведомства свои запреты уже ввели. Тайвань закрыл DeepSeek для государственных органов третьего февраля 2025 года решением кабинета министров, сославшись на риск утечки данных в Китай и на цензуру в ответах.

Открытые веса меняют профиль риска еще сильнее, чем выбор конкретной компании. GLM-5.2, обе модели DeepSeek-V4 и линейка Kimi лежат под свободными лицензиями, и раз скачанные веса остаются у того, кто их скачал, что бы дальше ни решили регуляторы с любой стороны, запретить разошедшиеся веса технически трудно. Это признают сами инициаторы проверок: файлы свободно лежат в сети, а запрет упирается ещё и в свободу слова. Модель с открытыми весами оказывается таким образом неподвластной чужим предписаниям, причём цена этой независимости у каждой модели своя, поскольку по достоверности ответов DeepSeek и GLM-5.2 расходятся сильно, хотя веса открыты у обеих.

Спрос на аренду открытых моделей у нас в HOSTKEY распределяется совсем не так, как расставлены места в публичных рейтингах. Четыре пятых заказов приходится на DeepSeek-R1 в варианте на четырнадцать миллиардов параметров, оставшаяся пятая часть на qwen3-coder на тридцать миллиардов, и обеими позициями список исчерпывается.

Ни одной модели из нашей таблицы цен в этом перечне нет вовсе, поскольку арендуют не флагманы с открытыми весами вроде GLM-5.2 или DeepSeek-V4-Pro, а компактные варианты, которые можно запустить на относительно недорогих GPU серверах. Строка прайса за миллион токенов к такому выбору отношения не имеет никакого, ведь платят здесь за час работы видеокарты, а решает размер модели, который в нее помещается.

Правда, запас прочности этот есть не всегда. Qwen3.6-Max-Preview существует только как размещенный сервис, без открытых весов, и для флагманов Alibaba это сознательный отход от прежней практики. Раз модель живет лишь на чужой площадке, вместе с площадкой её и ограничат.

Лучше всех суть выразил один из инициаторов расследования, посетовав, что мир будет строить на той модели, которая дешевле и доступнее, а сегодня это модель китайская. Перед тем же выбором стоит и отдельная команда, только без большой политики за спиной. 

Поэтому кроме цены за токен стоит заранее выяснить еще несколько вещей: 

  • Чья юрисдикция у разработчика и чьи предписания ему приходится исполнять?
  • Открыты ли веса и разрешает ли лицензия поднять модель у себя?
  • Есть ли живой запасной маршрут на модель из другой юрисдикции, который проверяли под нагрузкой, а не «держат в уме»?
  • Пройдёт ли по правилам выбранной компании ваше собственное юрлицо, а не только адрес сервера.

Выводы

Числа в этом разборе сняты 22 июля 2026 года со страниц самих разработчиков, причём у части из них заранее объявлена дата окончания, ведь имена deepseek-chat и deepseek-reasoner вывели из обращения 24 июля, окно промо-кредитов Anthropic закроется 2 августа, а вводная цена Sonnet 5 доживёт до 31 августа, после чего вход подорожает с двух долларов за миллион токенов до трёх, а выход — с десяти до пятнадцати.

Дважды за время работы над текстом мы повторили ровно ту ошибку, о которой сами же пишем. В первой версии таблицы цены DeepSeek стояли по прайсу Alibaba Model Studio, где та же самая модель обходится в пять с половиной раз дороже, чем в документации самой DeepSeek, а чуть позже результат K2.6 по SWE-bench Pro едва не переехал у нас в строку K2.7 вслед за сводными обзорами, где он проставлен модели, которая его не показывала. Оба раза число выглядело правдоподобно и стояло в чужой готовой таблице, из-за чего проверять его хотелось в последнюю очередь.

За рамками остались корпоративные договоры с индивидуальными ставками, стоимость обучения на своих данных и расходы на собственное развёртывание открытых по весам моделей, где счёт идёт уже за железо и электричество. Требования к обработке персональных данных в разных юрисдикциях мы тоже не разбирали, поскольку тема эта заслуживает отдельного разговора, как и ограничились только одним китайским агрегатором.

За пределами статьи также остались и отечественные модели и их цена, но если будет интересно, мы готовы расширить публикацию.

А доступ к каким LLM или подпискам на них вы используете в собственной работе или в вашей компании?

LLM-модели на вашем сервере

Последние версии популярных LLM-моделей уже предустановлены на вашем сервере.

Другие статьи

20.07.2026

Внутренняя документация, которую никто не читает. Как сделать, чтобы читали (на примере ONLYOFFICE Workspace)

Документация умирает не от лени сотрудников, а из-за неудобства и потери доверия к данным. Разбираем «два кита» качественной базы знаний: удобство использования и контроль актуальности. Показываем на примере ONLYOFFICE Workspace, как превратить хаос в работающий процесс с помощью шаблонов, ролевой модели доступа и дисциплины пересмотра.

17.07.2026

Что такое AI-агенты: создание, примеры и возможности в 2026 году

Вокруг AI-агентов сейчас слишком много шума, но мало кто объясняет, почему без жестких лимитов они способны за ночь сжечь весь бюджет. Разбираем архитектуру, стандарт MCP и актуальные фреймворки 2026 года. Показываем рабочий код и честно говорим о скрытых расходах и рисках, о которых молчат в презентациях.

01.07.2026

Что выбрать для сервера, EPYC или Ryzen?

Ryzen быстрее в однопоточных задачах, EPYC уверенно лидирует в многопоточной нагрузке, работе с памятью и серверных функциях. Разбираем результаты 25 тестов и объясняем, когда переплата за EPYC действительно оправдана.

22.06.2026

Как в 1915 году взялись собирать базу данных на всю страну без единого компьютера

В 1915 году Владимир Вернадский запустил проект, который сегодня назвали бы национальной базой данных ресурсов. Без компьютеров и цифровых технологий комиссия КЕПС собрала сведения о недрах, лесах, водах и энергии страны, заложив основы подхода «сначала данные, потом решения».

05.06.2026

Маленький файл robots.txt и большие последствия одной строки

Разбираемся, как работает robots.txt, почему его часто путают с инструментами индексации и какую роль он играет в эпоху ИИ-сканеров.

Upload