Архив рубрики ~Лента новостей~

Qwen 3.8-Max и Claude Opus 5 показывают, почему необработанные результаты бенчмарков не позволяют предсказать сумму счета.

Qwen 3.8-Max и Claude Opus 5 показывают, почему необработанные результаты бенчмарков не позволяют предсказать сумму счета.
Qwen 3.8-Max и Claude Opus 5 показывают, почему необработанные результаты бенчмарков не позволяют предсказать сумму счета.

Лори Восс

На этой неделе Alibaba выпустила Qwen 3.8-Max и позиционировала предварительную версию как вторую по производительности после Claude Fable 5 (в таблице, представленной в день запуска, ситуация была более неоднозначной: модель лидировала в одной из 12 строк, содержащих информацию о программистах). Однако независимый тест показал результаты, близкие к противоположным: при запуске, по-видимому, с использованием предварительной версии, наилучшие настройки Qwen 3.8-Max оказались в середине списка, а настройки по умолчанию — на последнем месте.

Оба результата реальны и обоснованы. Разница между ними связана с лимитами токенов и времени, и это важно, поскольку эти цифры обычно не являются главными показателями. В сносках Alibaba указано пятичасовое ограничение по времени выполнения кода и до 12 часов на PaperBench. Независимый бенчмарк VulcanBench выдал от 45 до 60 минут реального времени. Разница в результатах объясняется тем, что у Alibaba лимит времени выполнения в 5-16 раз больше.

Чтобы начать учитывать эти различия при выборе моделей, необходимо сделать две вещи. Во-первых, следует использовать показатель стоимости успешно выполненной задачи: общие затраты, включая все расходы на неудачные попытки, деленные на количество задач, прошедших проверку приемки. Во-вторых, необходимо явно включить бюджеты времени или токенов в критерии приемки, а не оставлять их в качестве скрытой детали.

Цена за токен перестала прогнозировать законопроект.

В первую неделю продаж Qwen 3.8-Max все публиковали сравнение цен, поскольку это были единственные доступные данные. Это не дешевая модель. DeepSeek-V4-Flash-0731, который вышел в бета-версию публичного API 31 июля, стоит 14 центов за миллион входных токенов и 28 центов за выход. Qwen 3.8-Max стоит 2 и 6 долларов. Kimi K3 стоит 3 и 15 долларов.

Эти цены говорят меньше, чем раньше, по причине, специфичной для моделей, основанных на рассуждениях, таких как Qwen: получение результата требует затрат на мышление. Модель, которая тратит большую часть своих токенов на рассуждения, может достичь лимита токенов, прежде чем выведет ответ, в результате чего вы получите пустой результат, неотличимый от полного провала, ценой полного запуска.

Компания Artificial Analysis располагает наиболее точными опубликованными данными о том, как это может повлиять на реальные затраты агентов: запуск её индекса интеллекта на DeepSeek-V4-Flash с максимальными усилиями потребовал 210 миллионов выходных токенов против медианного значения в 100 миллионов для данного класса. Абсолютные затраты всё равно оставались низкими, поскольку токены были очень дешевыми. Но многословие отнимает время, а не только деньги, и в зависимости от конкретного случая это может привести к краху.

Вам нужен показатель, который учитывает все затраченные средства, включая неудачные попытки, и сопоставляет их с задачами, которые были фактически выполнены в рамках указанного вами временного и ресурсного бюджета. Именно это помогает увидеть метрика «стоимость за успешное выполнение».

Частота отказов частично зависит от настроек конфигурации.

Выполнение задания с неверным ответом и выполнение задания с превышением бюджета — это разные события, требующие разных способов исправления. Практически ни один инструмент для сравнения не позволяет их различить, и почти ни одна таблица лидеров не сообщает о таком разделении. Я столкнулся с этим при создании собственного теста производительности агентов: инструмент зафиксировал сбой, но ничего не сказал о причинах, и мне пришлось самому добавлять это различие. Когда же удается их различить, оказывается, что исчерпание бюджета является доминирующим событием.

В исследовании Long-Horizon-Terminal-Bench, опубликованном в июле, были протестированы 17 перспективных моделей в 46 задачах с использованием общей тестовой среды, при этом каждая попытка длилась 90 минут. Тайм-ауты составили 79% от всех незавершенных запусков, 19% для агентов, остановившихся самостоятельно, и 3% для ошибок тестовой среды. Авторы осторожно уточняют, что это означает, а что нет: запуски с тайм-аутами были далеки от завершения, со средним вознаграждением от 0,10 до 0,35, поэтому нельзя предполагать, что большее время привело бы к успеху. Но вывод таков: бенчмарки неявно измеряют эффективность по времени, независимо от того, насколько явно это демонстрируется.

Наиболее наглядный опубликованный пример этого механизма можно найти в VulcanBench, том же самом открытом инструменте, который используется для построения диаграммы Qwen. В отчете от 26 июля Claude Opus 5 показал лучшие результаты в режиме наименьших усилий, решив 20 из 23 задач против 18 в режиме высоких усилий. Дополнительные рассуждения оказались не бесполезными: режим высоких усилий дал наименьшее количество неправильных ответов по сравнению с любым другим режимом — один против трех. Вместо этого закончилось время, а превышение времени оценивается в ноль. Два из трех случаев регрессии были связаны с ограничениями по задачам, которые решаются в режиме низких усилий, и при неограниченном времени на обоих режимах он лишь сравнялся с самым дешевым режимом, который в 3,1 раза дороже.

Это имеет прямые последствия для любого, кто строит маршрутную лестницу. Стандартная конструкция переходит к более сложным рассуждениям, когда дешевая попытка терпит неудачу, исходя из предположения, что следующая ступень лучше и просто стоит дороже. Для значительной части комбинаций моделей и задач это предположение неверно, и вы платите цену более высокой ступени, чтобы в итоге столкнуться с таймаутом или превышением лимита.

Кто уже проводит измерения этого?

За последние несколько месяцев несколько групп независимо друг от друга определили стоимость выполнения одной успешно завершенной задачи, что является наиболее убедительным признаком того, что это становится стандартом.

VulcanBench указывает стоимость решенной задачи в долларах в качестве заголовка, и так было с самых первых его отчетов. Long-Horizon-Terminal-Bench публикует стоимость задачи рядом с точностью, и наиболее показательная строка — GPT-5.4, примерно 26 долларов за задачу, с гораздо более низким процентом успешного прохождения, чем Grok 4.5, около 11 долларов. TestEvo-Bench запускает агенты с ограничением стоимости, и оценка генерации тестов Claude Code падает с 71% до 44% при более жестком ограничении.

Поставщики уже поддерживают идею измерения эффективности за каждое успешно выполненное задание. В апреле HubSpot снизил стоимость обработки обращения в Breeze Customer Agent до 50 центов за завершенное обращение с 1 доллара за обработанное обращение. Zendesk выставляет счета за автоматизированное решение проблемы. Fin взимает 99 центов за результат и выставляет счета только за полное завершение процесса.

Что изменить на этой неделе

  • В каждом запуске агента необходимо указывать причину сбоя в качестве обязательного поля, при этом исчерпание бюджета, сбой верификатора и ошибка проверяющей среды должны быть отдельными значениями, а не одним флагом сбоя. Пока вы не сможете отделить тайм-аут от неправильного ответа, ваш показатель успешности будет измерять сразу две вещи, и вы не сможете определить, какую из них нужно исправить.

  • Рассчитайте стоимость за успешно выполненную задачу в зависимости от уровня сложности, а не только за модель. Общие затраты, включая неудачные попытки, делятся на количество задач, прошедших проверку приемки. Рейтинг не будет совпадать с прейскурантом, и самый дешевый вариант вполне может оказаться лучшим.

  • Ограничение по количеству токенов, а не по времени суток, если только задержка действительно не входит в ваши целевые показатели уровня обслуживания. Ограничение по времени суток позволяет оценить скорость обслуживания вашего провайдера как образец качества.

  • Проверьте настройки трудозатрат по умолчанию для всех развернутых вами приложений. Qwen 3.8-Max работает с максимальным уровнем обоснования, когда поле «трудозатраты» не задано, и этот максимальный уровень показал наихудшие результаты в независимых тестах. Команда, которая никогда не меняет этот параметр, использует конфигурацию, которая обходится дороже всего в расчете на одну решенную задачу.

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ В DeepMind большая перестановка: Хассабис уходит с поста CEO В… Архив рубрики ~Коротко из Telegram~ NVIDIA открыла самую крупную модель для беспилотников NVIDIA открыла доступ… Архив рубрики ~Коротко из Telegram~ Google больше не кормит сайты трафиком как раньше Axios снова… Архив рубрики ~Коротко из Telegram~ ИИ уже стал нормой в Java-разработке, но Spring Boot никто… Архив рубрики ~Коротко из Telegram~ ИИ помогает работать быстрее — и быстрее выгорать ИИ всё… Архив рубрики ~Коротко из Telegram~ Вайбкодер собрал интерактивный учебник по анатомии Гений навайбкодил интерактивный учебник… Архив рубрики ~Коротко из Telegram~ МТС встроила ИИ-аналитика в «Геоэффект» МТС добавила ИИ-агента в сервис… Архив рубрики ~Коротко из Telegram~ AirDrop для любых устройств — нашли бесплатный сервис для передачи… Архив рубрики ~Коротко из Telegram~ Вайбкодим в ЛЮБОЙ программе Нашли топовый инструмент CLI Anything, позволяющий… Архив рубрики ~Коротко из Telegram~ Claude Cowork: твой цифровой коллега Обычный чат с Claude —… Новости робототехники Система управления роботами с ногами на основе искусственного интеллекта. Архив рубрики ~Коротко из Telegram~ ФАС России возбудила дело в отношении Apple после того, как… Архив рубрики ~Коротко из Telegram~ ФСТЭК опубликовала проект нового приказа, который заменит действующий приказ №21… Архив рубрики ~Коротко из Telegram~ В первой половине 2026 года лишь около трети мобильных интернет… Архив рубрики ~Коротко из Telegram~ В DeepMind большая перестановка: Хассабис уходит с поста CEO В… Архив рубрики ~Коротко из Telegram~ NVIDIA открыла самую крупную модель для беспилотников NVIDIA открыла доступ… Архив рубрики ~Коротко из Telegram~ Google больше не кормит сайты трафиком как раньше Axios снова… Архив рубрики ~Коротко из Telegram~ ИИ уже стал нормой в Java-разработке, но Spring Boot никто… Архив рубрики ~Коротко из Telegram~ ИИ помогает работать быстрее — и быстрее выгорать ИИ всё… Архив рубрики ~Коротко из Telegram~ Вайбкодер собрал интерактивный учебник по анатомии Гений навайбкодил интерактивный учебник… Архив рубрики ~Коротко из Telegram~ МТС встроила ИИ-аналитика в «Геоэффект» МТС добавила ИИ-агента в сервис… Архив рубрики ~Коротко из Telegram~ AirDrop для любых устройств — нашли бесплатный сервис для передачи… Архив рубрики ~Коротко из Telegram~ Вайбкодим в ЛЮБОЙ программе Нашли топовый инструмент CLI Anything, позволяющий… Архив рубрики ~Коротко из Telegram~ Claude Cowork: твой цифровой коллега Обычный чат с Claude —… Новости робототехники Система управления роботами с ногами на основе искусственного интеллекта. Архив рубрики ~Коротко из Telegram~ ФАС России возбудила дело в отношении Apple после того, как… Архив рубрики ~Коротко из Telegram~ ФСТЭК опубликовала проект нового приказа, который заменит действующий приказ №21… Архив рубрики ~Коротко из Telegram~ В первой половине 2026 года лишь около трети мобильных интернет…

Оставить комментарий