Qwen3.8-Max заявляет о своих преимуществах: он превосходит GPT-5.6 Sol Max и Fable 5 при использовании в качестве агентного компьютера.
Карл Франзен
Вчера вечером команда исследователей в области искусственного интеллекта Qwen, принадлежащая китайскому гиганту электронной коммерции и облачных вычислений Alibaba, представила Qwen3.8-Max — новую флагманскую многомодальную большую языковую модель (LLM) с 2,4 триллионами параметров, созданную на основе метода смешения экспертов (MoE). Модель ориентирована на один из самых конкурентных сегментов передового рынка ИИ: автономную разработку программного обеспечения и долгосрочные корпоративные задачи.
Если опубликованные компанией результаты тестов подтвердятся в ходе более широкого независимого тестирования, Qwen3.8-Max не просто конкурирует с ведущими современными проприетарными моделями — он превосходит несколько из них по ряду ключевых показателей в области агентных вычислений.
В частности, компания Qwen сообщает, что Qwen3.8-Max набрала 86,1 балла в бенчмарке OSWorld-Verified, измеряющем, насколько хорошо агенты могут использовать операционную систему компьютера и приложения на ней, опередив GPT-5.6 Sol Max (83,2) и Fable 5 (85,0).
Кроме того, он показал наивысший результат в PaperBench, бенчмарке от OpenAI, измеряющем, насколько хорошо агенты могут восстанавливать научные исследовательские работы на основе экспериментальных данных, и лидирует или остается высококонкурентным в таких областях, как разработка программного обеспечения, воспроизведение исследований, мультимодальное мышление и визуальная веб-разработка.
Этот релиз также сигнализирует о потенциально значительном стратегическом сдвиге для Alibaba: компания заявляет, что открытые весовые коэффициенты для Qwen3.8-Max будут опубликованы на следующей неделе вместе с Qwen3.8-27B.
Если это произойдет на основании разрешительной лицензии, это будет означать, что модель Qwen класса Max впервые станет доступна для самостоятельного развертывания — шаг, который может существенно изменить внедрение подобных решений в корпоративной среде.
Однако остается одно важное замечание: Alibaba пока не раскрыла условия лицензирования, что оставляет открытой возможность использования более ограничительной пользовательской лицензии, как мы недавно видели на примере открытой модели Kimi K3 китайского конкурента Moonshot, а не широко разрешительной, как Apache 2.0.
Другое определение понятия «граница».
За последний год конкурентная среда в сфере разработки фундаментных моделей стала все более специализированной.
В своей серии GPT компания OpenAI в основном сосредоточилась на общих рассуждениях, многомодальном взаимодействии и повышении производительности предприятий.
В серии статей Клода, издаваемой Anthropic, особое внимание уделяется программированию и надежному логическому мышлению в контексте большого объема информации. Google продолжает развивать платформу Gemini в направлении мультимодальной производительности и рабочих процессов, изначально разработанных для веб-технологий.
Недавно компания Moonshot AI представила модель Kimi K3, сочетающую в себе передовые характеристики и возможность сброса груза любого веса.
Qwen3.8-Max пытается объединить многие из этих сильных сторон в единую модель, ориентированную непосредственно на автоматизацию предприятий.
Вместо того чтобы делать акцент на разговорном интеллекте, Alibaba позиционирует эту модель как автономного сотрудника, способного выполнять проекты, занимающие дни, а не минуты.
По данным компании, Qwen3.8-Max способен автономно завершать программные проекты, длящиеся более 10 дней, воспроизводить научные работы, содержащие тысячи строк кода, выполнять итеративную оптимизацию проектирования микросхем и непрерывно корректировать планы с помощью многомодальных контуров обратной связи.
Эти демонстрации по-прежнему являются продукцией компании и еще не были широко воспроизведены независимыми экспертами. Тем не менее, они иллюстрируют растущую тенденцию в отрасли: передовые модели все чаще конкурируют по своей способности завершать целые рабочие процессы, а не отвечать на отдельные запросы.
В бенчмарках все чаще поощряется автономное выполнение.
Выпущенный вместе с Qwen3.8-Max набор бенчмарков отражает это изменение.
Вместо того чтобы сосредотачиваться исключительно на традиционных тестах на логическое мышление или задачах по программированию, многие из представленных оценок измеряют навыки выполнения задач в долгосрочной перспективе.
В тестах OSWorld-Verified, оценивающих работу агентов, взаимодействующих с рабочими средами, Qwen3.8-Max показывает результат 86,1, опережая GPT-5.6 Sol Max (83,2), Fable 5 (85,0) и Gemini 3.1 Pro (76,2).

Эта модель также является лидером:
-
PaperBench: 93.0
-
TerminalBench 2.1: 86.6
-
Vision2Web: 69.0
-
LVBench: 81.8
-
ERQA: 77,8
В других областях он сохраняет конкурентоспособность по сравнению с лидерами в области собственных разработок, хотя и отстает в ряде других категорий.
Например, в профессиональном тесте по разработке программного обеспечения SWE-Pro модель OpenAI показывает наивысший результат, а Opus 4.8 продолжает лидировать в некоторых тестах по разработке программного обеспечения и в тесте Agents' Last Exam.
Вместо того чтобы доминировать во всех тестах, Qwen, похоже, предлагает один из самых сбалансированных профилей производительности, доступных в настоящее время.
В конечном итоге, для корпоративных покупателей этот баланс может иметь большее значение, чем отдельные успехи в бенчмаркинге.
Многие организации все чаще оценивают модели, исходя из того, насколько надежно они справляются с разнородными рабочими процессами — написанием кода, чтением документов, навигацией по интерфейсам, созданием отчетов, анализом изображений и координацией множества подзадач, — а не оптимизируя их для решения одной узкой задачи.
Где Qwen3.8-Max проявляет себя наиболее эффективно.
Если предположить, что опубликованные Alibaba результаты подтвердятся при развертывании в производственной среде, то ряд корпоративных рабочих нагрузок особенно хорошо подходят для Qwen3.8-Max.
1. Долгосрочная разработка программного обеспечения
Основной демонстрационный проект Alibaba посвящен автономной разработке программного обеспечения, которая может занять более десяти дней.
Хотя предприятиям следует рассматривать эти демонстрации как заявления поставщика до тех пор, пока они не будут воспроизведены независимыми источниками, они соответствуют растущему интересу к агентам постоянного кодирования, которые работают непрерывно, а не интерактивно.
Организациям, экспериментирующим с автономными инженерными командами, автоматизацией CI/CD, поддержкой репозиториев, регрессионным тестированием или внедрением новых функций, Qwen может показаться особенно привлекательным, если его производительность в режиме агента окажется стабильной за пределами лабораторных условий.
2. Агенты по использованию компьютеров
Наиболее существенным отличительным признаком может быть использование компьютера.
OSWorld быстро стал одним из самых пристально отслеживаемых бенчмарков в отрасли, поскольку он измеряет способность модели взаимодействовать с операционными системами, а не просто генерировать текст.
Модели, способные надежно взаимодействовать с настольным программным обеспечением, могут автоматизировать бесчисленное множество повторяющихся бизнес-процессов, включая обработку документов, интеграцию корпоративного программного обеспечения, внутренние операции и устаревшие рабочие процессы, для которых могут отсутствовать API.
Таким образом, лидирующие позиции OSWorld могут принести реальные операционные преимущества, если результаты тестирования окажутся сопоставимыми с производственными средами.
3. Автоматизация исследований
Лидерство компании Qwen в области PaperBench указывает на большой потенциал для организаций, занимающихся научными вычислениями, обзором литературы, воспроизведением экспериментов и техническим анализом.
Научно-исследовательские институты, фармацевтические компании и промышленные научно-исследовательские группы все чаще используют модели с линейным логическим мышлением (LLM) не только для обобщения информации, но и для выполнения воспроизводимых вычислительных задач. В таких условиях все большую ценность приобретают модели, способные сохранять контекст на протяжении длительных сеансов.
4. Многомодальные промышленные рабочие процессы
В отличие от более ранних мультимодальных систем, которые в основном анализируют загруженные изображения, Квен описывает зрение как непрерывный механизм обратной связи, интегрированный в планирование и выполнение.
Такая архитектура может оказаться особенно полезной в производстве, логистике, инженерном контроле и анализе проектов, где визуальные данные постоянно влияют на оперативные решения, а не служат изолированными подсказками.
Экономические факторы могут оказаться не менее важными.
Пожалуй, наибольшее конкурентное давление исходит не от результатов сравнительных тестов, а от ценообразования через программный интерфейс (API) Qwen на платформе QwenCloud (расположенной в Китае):
Qwen3.8-Max запускается по цене 2/6 долларов за миллион токенов на входе/выходе, что является моделью средней ценовой категории, но при этом значительно дешевле лучших американских собственных предложений, с которыми он сравнивается, составляя менее 1/3 от совокупной цены входа/выхода Claude Opus 5 и менее 1/4 от цены GPT-5.6 Sol Max.
|
Модель |
Входные данные ($/1 млн) |
Объем производства ($/1 млн) |
Итого ($/1 млн) |
Источник |
|
MiMo-V2.5 Flash |
0,10 доллара |
0,30 доллара |
0,40 доллара |
Xiaomi |
|
deepseek-v4-flash |
0,14 доллара |
0,28 доллара |
0,42 доллара |
DeepSeek |
|
deepseek-v4-pro |
0,435 доллара |
0,87 доллара |
1,305 доллара |
DeepSeek |
|
GPT-5.6 Луна |
0,20 доллара |
1,20 доллара |
1,40 доллара |
OpenAI |
|
МиниМакс-М3 |
0,30 доллара |
1,20 доллара |
1,50 доллара |
МиниМакс |
|
LongCat-2.0 — акция, действующая ограниченное время. |
0,30 доллара |
1,20 доллара |
1,50 доллара |
ЛонгКэт |
|
Фонарик Gemini 3.1 |
0,25 доллара |
1,50 доллара |
1,75 доллара |
|
|
Qwen3.7-Plus |
0,40 доллара |
1,60 доллара |
2,00 доллара |
Alibaba Cloud |
|
MiMo-V2.5 |
0,40 доллара |
2,00 доллара |
2,40 доллара |
Xiaomi |
|
Фонарь Gemini 3.5 Flash-Lite |
0,30 доллара |
2,50 доллара |
2,80 доллара |
|
|
LongCat-2.0 — стандарт |
0,75 доллара |
2,95 доллара |
3,70 доллара |
ЛонгКэт |
|
MiMo-V2.5 Pro (≤256K) |
1,00 долл. |
3,00 доллара |
4,00 доллара |
Xiaomi |
|
GLM-5.2 |
1,40 доллара |
4,40 доллара |
5,80 долларов |
З.ай |
|
Грок 4.5 |
2,00 доллара |
6,00 долларов |
8,00 долларов |
xAI |
|
MiMo-V2.5 Pro (>256K) |
2,00 доллара |
6,00 долларов |
8,00 долларов |
Xiaomi |
|
Qwen3.8-Max |
2,00 доллара |
6,00 долларов |
8,00 долларов |
QwenCloud |
|
Вспышка Gemini 3.6 |
1,50 доллара |
7,50 долларов |
9,00 долларов |
|
|
Qwen3.7-Max |
2,50 доллара |
7,50 долларов |
10,00 долларов |
Alibaba Cloud |
|
Вспышка Gemini 3.5 |
1,50 доллара |
9,00 долларов |
10,50 долларов |
|
|
Gemini 3.1 Pro Preview (≤200K) |
2,00 доллара |
12,00 долларов |
14,00 долларов |
|
|
GPT-5.6 Terra |
2,00 доллара |
12,00 долларов |
14,00 долларов |
OpenAI |
|
ГПТ-5.4 |
2,50 доллара |
15,00 долларов |
17,50 долларов |
OpenAI |
|
Кими К3 |
3,00 доллара |
15,00 долларов |
18,00 долларов |
Moonshot AI |
|
Gemini 3.1 Pro Preview (>200K) |
4,00 доллара |
18,00 долларов |
22,00 долларов |
|
|
Клод Опус 5 |
5,00 долларов |
25,00 долларов |
30,00 долларов |
Антропический |
|
ГПТ-5.5 |
5,00 долларов |
30,00 долларов |
35,00 долларов |
OpenAI |
|
GPT-5.5 Мгновенный чат (последние новости) |
5,00 долларов |
30,00 долларов |
35,00 долларов |
OpenAI |
|
Sakana Fugu Ultra (≤272K) |
5,00 долларов |
30,00 долларов |
35,00 долларов |
Сакана ИИ |
|
GPT-5.6 Sol — Стандартный режим |
5,00 долларов |
30,00 долларов |
35,00 долларов |
OpenAI |
|
Клод Басня 5 / Клод Мифос 5 |
10,00 долларов |
50,00 долларов |
60,00 долларов |
Антропический |
|
GPT-5.6 Sol — Быстрый режим |
10,00 долларов |
60,00 долларов |
70,00 долларов США |
OpenAI |
Снижение затрат на вывод информации становится все более важным, поскольку агентные системы потребляют значительно больше токенов, чем обычные чат-боты — факт, который, вероятно, повлиял на решение OpenAI в конце прошлой недели снизить цены на API для своих моделей среднего и низкого ценового сегмента GPT-5.6 (Terra и Luna) на 20% и 80% соответственно.
Действительно, как могут подтвердить те, кто управляет этими системами, многочасовые автономные рабочие процессы, итеративное планирование и непрерывная самокоррекция могут генерировать миллионы токенов за выполнение одной задачи.
Для предприятий, развертывающих сотни или тысячи агентов одновременно, затраты на вывод данных часто становятся одной из крупнейших статей операционных расходов. Поэтому небольшое снижение цены за токен быстро накапливается.
Как это соотносится с американскими моделями освоения Дикого Запада?
Несмотря на громкие сравнительные тесты, Qwen 3.8-Max не следует рассматривать как полную замену ведущим американским моделям.
Вместо этого, его сильные стороны предполагают иные стратегии развертывания.
Семейство GPT от OpenAI продолжает демонстрировать выдающиеся возможности как универсальная платформа для корпоративного анализа данных с развитыми инструментами, интеграцией в экосистему и широкими возможностями коммерческого внедрения. Организации, уже использующие экосистемы Microsoft или корпоративные решения OpenAI, могут продолжать ценить эти операционные преимущества, даже если Qwen лидирует в отдельных тестах производительности агентов.
Claude Opus от Anthropic по-прежнему широко считается одним из самых эффективных помощников в программировании, особенно для тщательной разработки программного обеспечения и анализа долговременного контекста. Некоторые предприятия могут по-прежнему предпочитать Claude для разработки с участием человека, где надежность и предсказуемое поведение важнее абсолютной автономности.
Google Gemini продолжает выделяться на фоне конкурентов благодаря глубокой интеграции с Workspace, многомодальному функционалу и сервисам Google Cloud, что делает его привлекательным для организаций, уже использующих корпоративную инфраструктуру Google.
Наиболее привлекательным вариантом для предприятий, отдающих приоритет автономному выполнению задач, расширенным горизонтам планирования и выгодной экономической эффективности выводов без ущерба для производительности на переднем крае технологий, представляется Qwen.
Вопрос о весовых коэффициентах остается без ответа.
Наибольшая неопределенность, связанная с Qwen3.8-Max, мало связана с результатами бенчмарков.
Компания Alibaba заявляет, что открытые весовые коэффициенты появятся на следующей неделе. Однако ни в объявлении, ни в предоставленной документации не указано, какая лицензия будет регулировать эти коэффициенты.
Это различие может оказаться решающим.
Лицензия с разрешительным характером, такая как Apache 2.0, значительно расширит возможности внедрения в корпоративной среде, позволив организациям самостоятельно размещать, настраивать и интегрировать эту модель в собственные продукты с относительно небольшими ограничениями.
Индивидуальная лицензия — подобная подходам, используемым в ряде недавних релизов передовых технологий — может накладывать ограничения на коммерческое развертывание, распространение, сферу применения или модификацию модели. Такие ограничения сузят привлекательность модели для предприятий, стремящихся к долгосрочным инвестициям в инфраструктуру, независимо от её технических характеристик.
Недавний релиз Kimi K3 от Moonshot AI наглядно демонстрирует важность этого различия. Хотя Kimi K3 предоставила свои веса в открытый доступ всем желающим, условия лицензирования включали в себя конкретные положения, в том числе требование раскрытия информации и коммерческой лицензии для тех, кто предлагает её в качестве «модели как услуги».
До тех пор, пока Alibaba не опубликует лицензию Qwen3.8-Max, организациям, рассматривающим возможность самостоятельного размещения своих сервисов, следует рассматривать объявление об открытом доступе как многообещающее, но неполное.
Все более переполненная граница
Модель Qwen3.8-Max выходит на рынок в один из самых динамично развивающихся периодов в истории фундаментальных моделей.
В течение нескольких недель разработчики увидели крупные релизы от Moonshot AI, OpenAI, Anthropic и других, каждый из которых акцентирует внимание на различных сильных сторонах: рассуждения, программирование, мультимодальность, автономные агенты или экономика.
Вклад Alibaba примечателен тем, что он сочетает в себе конкурентоспособные показатели по сравнению с эталонными значениями, агрессивную ценовую политику, контекстное окно в миллион токенов и заявленное обязательство опубликовать весовые коэффициенты для своей флагманской модели.
В конечном итоге, станет ли она предпочтительной платформой для корпоративных автономных агентов, будет зависеть не столько от позиций в рейтингах, сколько от более широкой независимой проверки, надежности в производстве и условий лицензирования, сопровождающих предстоящий выпуск версии с увеличенным весом.
Именно эти факторы, а не только результаты сравнительных тестов, определят, станет ли Qwen3.8-Max реальной альтернативой ведущим американским проприетарным моделям или просто еще одним впечатляющим участником все более конкурентной гонки в сфере искусственного интеллекта.
Источник: venturebeat.com
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
