Одинаковый прайс, разный счёт: почему агент на GPT-6 Astra может обойтись втрое дороже, чем на Claude Fable 5.1
В начале сентября OpenAI и Anthropic за два дня выпустили по новому флагману и поставили на них одинаковый прайс: $10 за миллион входных токенов, $50 за миллион выходных. Если выбирать по прайсу, разницы нет. Если по счёту за агента, который часами работает с большим проектом, — одна модель обходится втрое дороже другой.
Разбираю, где эта разница сидит и как понять, касается ли она вашей задачи.
Что вышло
1 сентября Anthropic выпустила Claude Fable 5.1, 3 сентября OpenAI начала раскатывать GPT-6 Astra. Обе модели встали на новый ценовой этаж: до сентября верх рынка держался около $5 за миллион входных токенов.
Прежние флагманы при этом никуда не делись. Claude Opus 5 стоит $5 и $25, GPT-5.6 Sol — $4 и $20, причём Sol в августе ещё и подешевел с $5 и $30. Поэтому реальный выбор сейчас не «старая модель или новая», а «доплачивать ли вдвое за верхний этаж».
Почему одинаковый прайс даёт разный счёт
Агент тратит деньги не столько на новый текст запроса, сколько на повторное чтение того, что уже видел: кодовую базу, документ, историю переписки. Это кэш-чтение, и именно на нём вендоры разошлись.
- Кэш. У Fable 5.1 кэш-чтение стоит 2,5% от цены входа — $0,25 за миллион токенов. У Astra стандартные 10% — $1,00. Разница вчетверо.
- Длинный контекст. У Astra запрос длиннее 272 тысяч токенов считается с наценкой: вход и кэш вдвое дороже, выход — в полтора раза. У Anthropic наценки нет на всём миллионе токенов.
Считаем на одном запросе
Возьмём агента с контекстом 500 тысяч токенов: 450 тысяч приходят из кэша, 50 тысяч — новые.
GPT-6 Astra. Контекст больше порога, включается двойная наценка. Кэш — $0,90, новый вход — $1,00. Итого $1,90 за вход одного запроса.
Claude Fable 5.1. Наценки нет. Кэш — около $0,11, новый вход — $0,50. Итого около $0,61.
Больше чем втрое при одинаковой цифре в прайсе. На агенте, который делает сотни таких запросов в день, это уже строка бюджета, а не погрешность.
Google в эту гонку не пошёл
У Google модели за $10 нет вообще. Gemini 3.1 Pro стоит $2 за вход и $12 за выход, самая дорогая позиция прайса — Gemini 3.8 Flash — $2,25 и $18. Google держит цены там, где модель можно гонять на потоке, и зарабатывает объёмом внутри своих сервисов. Наценка за длинный контекст у него тоже есть, и порог ниже: удвоение после 200 тысяч токенов.
Кому что выгодно
Короткие разовые запросы — чат-поддержка, генерация текстов, классификация. Кэша и длинного контекста почти нет, разница между вендорами на счёте почти не видна. Выбирать стоит по качеству ответа, а не по прайсу.
Агенты с большим общим контекстом — работа с кодовой базой, длинными документами, многошаговые задачи. Здесь счёт определяют цена кэша и порог наценки. На профиле из примера Fable 5.1 выходит заметно дешевле при том же прайсе.
Большинство остальных задач спокойно закрываются прежними флагманами за полцены: Opus 5 и Sol не стали хуже оттого, что сверху появился новый этаж.
Практический совет один: прежде чем сравнивать модели, выгрузите свой профиль нагрузки — какая доля токенов идёт из кэша и какой длины бывает контекст. Цена за токен без этих двух цифр больше ничего не говорит о счёте.
Два нюанса, о которых не пишут в прайсе
Astra — первая модель OpenAI, для которой компания не смогла исключить «критический» уровень киберспособностей. Продвинутые возможности в этой области доступны только участникам закрытой программы, массовая версия часть таких запросов отклоняет. У Anthropic аналогичные возможности вынесены в отдельную модель Mythos 5.1 с доступом по заявке.
И для команд из России: официально ни одна из новых моделей здесь не работает, российской картой не оплатить ни подписку, ни API. У Google оплата тоже идёт через зарубежный биллинг. Так что вопрос платёжного посредника встаёт раньше, чем вопрос цены за токен.
Источник: vc.ru
Похожие записи
Оцените материал:
Похожие записи
Долго работающие ИИ-агенты незаметно отменяют правила соответствия, и увеличение контекстных окон это не исправит.
14.09.2026
Локальный ИИ класса Opus 4.6 «задешево»: две Tesla P100, 28-поточный Xeon и тесты на реальных задачах
14.09.2026
Ваш телефон здесь бесполезен. Большой обзор транкинговой связи. Часть 1
14.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
