Qwen 3.8-Max и Claude Opus 5 показывают, почему необработанные результаты бенчмарков не позволяют предсказать сумму счета.
Лори Восс
На этой неделе Alibaba выпустила Qwen 3.8-Max и позиционировала предварительную версию как вторую по производительности после Claude Fable 5 (в таблице, представленной в день запуска, ситуация была более неоднозначной: модель лидировала в одной из 12 строк, содержащих информацию о программистах). Однако независимый тест показал результаты, близкие к противоположным: при запуске, по-видимому, с использованием предварительной версии, наилучшие настройки Qwen 3.8-Max оказались в середине списка, а настройки по умолчанию — на последнем месте.
Оба результата реальны и обоснованы. Разница между ними связана с лимитами токенов и времени, и это важно, поскольку эти цифры обычно не являются главными показателями. В сносках Alibaba указано пятичасовое ограничение по времени выполнения кода и до 12 часов на PaperBench. Независимый бенчмарк VulcanBench выдал от 45 до 60 минут реального времени. Разница в результатах объясняется тем, что у Alibaba лимит времени выполнения в 5-16 раз больше.
Чтобы начать учитывать эти различия при выборе моделей, необходимо сделать две вещи. Во-первых, следует использовать показатель стоимости успешно выполненной задачи: общие затраты, включая все расходы на неудачные попытки, деленные на количество задач, прошедших проверку приемки. Во-вторых, необходимо явно включить бюджеты времени или токенов в критерии приемки, а не оставлять их в качестве скрытой детали.
Цена за токен перестала прогнозировать законопроект.
В первую неделю продаж Qwen 3.8-Max все публиковали сравнение цен, поскольку это были единственные доступные данные. Это не дешевая модель. DeepSeek-V4-Flash-0731, который вышел в бета-версию публичного API 31 июля, стоит 14 центов за миллион входных токенов и 28 центов за выход. Qwen 3.8-Max стоит 2 и 6 долларов. Kimi K3 стоит 3 и 15 долларов.
Эти цены говорят меньше, чем раньше, по причине, специфичной для моделей, основанных на рассуждениях, таких как Qwen: получение результата требует затрат на мышление. Модель, которая тратит большую часть своих токенов на рассуждения, может достичь лимита токенов, прежде чем выведет ответ, в результате чего вы получите пустой результат, неотличимый от полного провала, ценой полного запуска.
Компания Artificial Analysis располагает наиболее точными опубликованными данными о том, как это может повлиять на реальные затраты агентов: запуск её индекса интеллекта на DeepSeek-V4-Flash с максимальными усилиями потребовал 210 миллионов выходных токенов против медианного значения в 100 миллионов для данного класса. Абсолютные затраты всё равно оставались низкими, поскольку токены были очень дешевыми. Но многословие отнимает время, а не только деньги, и в зависимости от конкретного случая это может привести к краху.
Вам нужен показатель, который учитывает все затраченные средства, включая неудачные попытки, и сопоставляет их с задачами, которые были фактически выполнены в рамках указанного вами временного и ресурсного бюджета. Именно это помогает увидеть метрика «стоимость за успешное выполнение».
Частота отказов частично зависит от настроек конфигурации.
Выполнение задания с неверным ответом и выполнение задания с превышением бюджета — это разные события, требующие разных способов исправления. Практически ни один инструмент для сравнения не позволяет их различить, и почти ни одна таблица лидеров не сообщает о таком разделении. Я столкнулся с этим при создании собственного теста производительности агентов: инструмент зафиксировал сбой, но ничего не сказал о причинах, и мне пришлось самому добавлять это различие. Когда же удается их различить, оказывается, что исчерпание бюджета является доминирующим событием.
В исследовании Long-Horizon-Terminal-Bench, опубликованном в июле, были протестированы 17 перспективных моделей в 46 задачах с использованием общей тестовой среды, при этом каждая попытка длилась 90 минут. Тайм-ауты составили 79% от всех незавершенных запусков, 19% для агентов, остановившихся самостоятельно, и 3% для ошибок тестовой среды. Авторы осторожно уточняют, что это означает, а что нет: запуски с тайм-аутами были далеки от завершения, со средним вознаграждением от 0,10 до 0,35, поэтому нельзя предполагать, что большее время привело бы к успеху. Но вывод таков: бенчмарки неявно измеряют эффективность по времени, независимо от того, насколько явно это демонстрируется.
Наиболее наглядный опубликованный пример этого механизма можно найти в VulcanBench, том же самом открытом инструменте, который используется для построения диаграммы Qwen. В отчете от 26 июля Claude Opus 5 показал лучшие результаты в режиме наименьших усилий, решив 20 из 23 задач против 18 в режиме высоких усилий. Дополнительные рассуждения оказались не бесполезными: режим высоких усилий дал наименьшее количество неправильных ответов по сравнению с любым другим режимом — один против трех. Вместо этого закончилось время, а превышение времени оценивается в ноль. Два из трех случаев регрессии были связаны с ограничениями по задачам, которые решаются в режиме низких усилий, и при неограниченном времени на обоих режимах он лишь сравнялся с самым дешевым режимом, который в 3,1 раза дороже.
Это имеет прямые последствия для любого, кто строит маршрутную лестницу. Стандартная конструкция переходит к более сложным рассуждениям, когда дешевая попытка терпит неудачу, исходя из предположения, что следующая ступень лучше и просто стоит дороже. Для значительной части комбинаций моделей и задач это предположение неверно, и вы платите цену более высокой ступени, чтобы в итоге столкнуться с таймаутом или превышением лимита.
Кто уже проводит измерения этого?
За последние несколько месяцев несколько групп независимо друг от друга определили стоимость выполнения одной успешно завершенной задачи, что является наиболее убедительным признаком того, что это становится стандартом.
VulcanBench указывает стоимость решенной задачи в долларах в качестве заголовка, и так было с самых первых его отчетов. Long-Horizon-Terminal-Bench публикует стоимость задачи рядом с точностью, и наиболее показательная строка — GPT-5.4, примерно 26 долларов за задачу, с гораздо более низким процентом успешного прохождения, чем Grok 4.5, около 11 долларов. TestEvo-Bench запускает агенты с ограничением стоимости, и оценка генерации тестов Claude Code падает с 71% до 44% при более жестком ограничении.
Поставщики уже поддерживают идею измерения эффективности за каждое успешно выполненное задание. В апреле HubSpot снизил стоимость обработки обращения в Breeze Customer Agent до 50 центов за завершенное обращение с 1 доллара за обработанное обращение. Zendesk выставляет счета за автоматизированное решение проблемы. Fin взимает 99 центов за результат и выставляет счета только за полное завершение процесса.
Что изменить на этой неделе
-
В каждом запуске агента необходимо указывать причину сбоя в качестве обязательного поля, при этом исчерпание бюджета, сбой верификатора и ошибка проверяющей среды должны быть отдельными значениями, а не одним флагом сбоя. Пока вы не сможете отделить тайм-аут от неправильного ответа, ваш показатель успешности будет измерять сразу две вещи, и вы не сможете определить, какую из них нужно исправить.
-
Рассчитайте стоимость за успешно выполненную задачу в зависимости от уровня сложности, а не только за модель. Общие затраты, включая неудачные попытки, делятся на количество задач, прошедших проверку приемки. Рейтинг не будет совпадать с прейскурантом, и самый дешевый вариант вполне может оказаться лучшим.
-
Ограничение по количеству токенов, а не по времени суток, если только задержка действительно не входит в ваши целевые показатели уровня обслуживания. Ограничение по времени суток позволяет оценить скорость обслуживания вашего провайдера как образец качества.
-
Проверьте настройки трудозатрат по умолчанию для всех развернутых вами приложений. Qwen 3.8-Max работает с максимальным уровнем обоснования, когда поле «трудозатраты» не задано, и этот максимальный уровень показал наихудшие результаты в независимых тестах. Команда, которая никогда не меняет этот параметр, использует конфигурацию, которая обходится дороже всего в расчете на одну решенную задачу.
Источник: venturebeat.com
Похожие записи
- Суд штата Нью-Мексико обязал компанию Meta выплатить дополнительные 567 миллионов долларов по делу о защите детей.
- Сотрудничество с Американской психологической ассоциацией в области психического здоровья молодежи и искусственного интеллекта | OpenAI
- В DeepMind большая перестановка: Хассабис уходит с поста CEO В…
Оцените материал:
Похожие записи
Энтузиаст вскрыл теплотрубки кулера, подключив к ним СЖО для охлаждения GeForce RTX 3070
08.12.2025
xAI Илона Маска подала в суд на Apple и OpenAI за «недобросовестную конкуренцию»
25.09.2025
Анонс четырехранговой памяти CUDIMM DDR5-5600 объёмом 128 Гбайт от ADATA и MSI
14.11.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
