Архив рубрики ~Лента новостей~

Qwen3.8-27B запускает локально высокопроизводительные агенты программирования и системы логического вывода, облачный API не требуется.

Qwen3.8-27B запускает локально высокопроизводительные агенты программирования и системы логического вывода, облачный API не требуется.
Qwen3.8-27B запускает локально высокопроизводительные агенты программирования и системы логического вывода, облачный API не требуется.

Карл Франзен

Самым масштабным релизом модели ИИ за последние несколько дней, по крайней мере среди разработчиков и опытных пользователей ИИ в социальных сетях, стала не передовая облачная модель от OpenAI, Anthropic или Google.

Это была модель с 27 миллиардами параметров от Alibaba: Qwen3.8-27B появилась на платформе Hugging Face в пятницу под корпоративной лицензией с открытым исходным кодом Apache 2.0, предоставляя разработчикам возможность загрузки весов для плотной мультимодальной модели.

Однако Qwen3.8-27B — это не обычная небольшая локальная модель: она включает в себя встроенную функцию распознавания изображений и видео, контекстное окно на 262 144 токена, настраиваемый алгоритм рассуждений и поддержку кодирования и агентных рабочих процессов — «компактную, удобную для развертывания» версию возможностей, разработанных для поколения Qwen3.8.

Необычно малый размер аппаратной части — одна из главных привлекательных особенностей Qwen3.8-27B. Для работы модели с полной 16-битной точностью требуется примерно 56 ГБ памяти графического процессора, а для версии с FP8 — около 28 ГБ. Однако 4-битное квантование сокращает размер модели примерно до 17 ГБ, что делает её доступной для высокопроизводительных потребительских машин, таких как мощный игровой настольный компьютер или хорошо оснащенный ноутбук.

Оптимальный баланс между возможностями и размером.

Вызывающе бурную реакцию среди разработчиков обусловлено динамичным сочетанием возможностей и масштабов компании.

Первые результаты тестов, проведенных самой компанией Alibaba на момент запуска, сразу же стали толчком для анализа. Компания сообщила о показателях 61,7 в SWE-bench Pro, 90,3 в LiveCodeBench v6, 70,7 в своем тесте для офисной работы CoWorkBench и 84,3 в OSWorld-Verified.

В опубликованной Alibaba сравнительной таблице модель 27B даже превосходит указанный результат Claude Opus 4.6 Max в тестах SWE-bench Pro и LiveCodeBench, хотя Opus по-прежнему лидирует в тестах Terminal-Bench, GPQA Diamond и Humanity's Last Exam.

Некоторые оценки Alibaba проводятся внутри компании, и используемые в сравнении эталонные показатели не идентичны, поэтому полученные данные не являются достаточным основанием для объявления универсального победителя.

Результаты сторонних исследований показывают, что мощная локальная модель демонстрирует производительность, эквивалентную проприетарным моделям, созданным несколько месяцев назад.

В понедельник разговор изменился, когда начали поступать результаты, полученные от сторонних источников.

Независимая компания Artificial Analysis, занимающаяся тестированием производительности ИИ, присвоила модели Qwen3.8-27B оценку 52 по своему индексу интеллекта , который представляет собой совокупность девяти оценок, охватывающих программирование, научные исследования, логическое мышление и профессиональные задачи. Это совпадает с оценкой, которую Artificial Analysis в настоящее время присваивает модели начального уровня GPT-5.6 Luna от OpenAI при максимальной настройке логического мышления — проприетарной функции, доступной только в облаке.

Как отметил Клайн, разработчик программного обеспечения с открытым исходным кодом, на платформе X: «Это первый случай, когда локальная модель достигла уровня, соответствующего передовым моделям. Мы не ожидали такого темпа локального прогресса в ближайшее время».

Между тем, по индексу Agentic Index от Artificial Analysis, измеряющему производительность моделей в задачах, связанных с агентами, Qwen3.8-27B набрала 51 балл, превзойдя Claude Opus с показателем 4.8 по максимальной логической нагрузке — передовой модели, выпущенной компанией Anthropic менее трех месяцев назад.

Это не значит, что эти модели эквивалентны, но это помогает объяснить, почему разработчики и опытные пользователи ИИ обратили на них внимание. Как написал на X разработчик и создатель подкастов об ИИ/ютубер Серо (@0xSero на X, настоящее имя Шариф Шерф): «Модель, работающая на оборудовании стоимостью 3000 долларов США, превосходит все, что было 4 месяца назад. Включая Opus. Постоянный низший класс отменен».

Разработчик Джошуа «Xenova» Лохнер, известный тем, что внедряет модели машинного обучения в веб-браузеры, в понедельник продемонстрировал результат на X, проведя эксперимент с использованием Qwen3.8-27B и пользовательских ядер WebGPU. Его реакция — «Какое замечательное время!» — многое отражает нынешнее настроение: модель, демонстрирующая результаты, близкие к показателям передовых проприетарных систем, может быть загружена, изменена и выполнена локально, а не доступна только через API поставщика.

Привлекательность модели становится более очевидной при её сжатии. Разработчик и автор статей об искусственном интеллекте Саймон Уиллисон протестировал квантизацию Q4_K_M размером примерно 17 ГБ на MacBook Pro M5 Max и видеокарте Nvidia DGX Spark.

Он обнаружил, что модель может писать код, интерпретировать изображения и запускать цикл «кодирующий агент» в рамках агентской платформы Pi. В одном эксперименте модель перемещалась по кодовой базе, чтобы объяснить, как работает аутентификация; в другом она написала и протестировала утилиту на Python, необходимую Уиллисону для преобразования текста, передаваемого агентом, из формата JSONL в Markdown.

«Тот факт, что файл размером 17 ГБ может делать все это на моих домашних компьютерах, — это чудо», — написал Уиллисон. Его основная мысль находит отклик у опытных пользователей: возможности, которые еще недавно казались неотделимыми от дорогостоящих хостинговых моделей, теперь переносятся в файлы достаточно малого размера, чтобы хранить их на рабочей станции.

Реакция проявляется и в использовании. В понедельник издание Cybernews сообщило, что версия Qwen3.8-27B преодолела отметку в 3 миллиона загрузок Hugging Face за первые три дня , а квантованные версии быстро появились для инструментов локального вывода.

Сообщество LocalLLaMA на Reddit создало специальную мегатему для публикации результатов тестов, квантизации, советов по настройке и сравнений. Один из пользователей, продемонстрировавший локально сгенерированную игру, описал модель как «совершенно иную».

Чрезмерное обдумывание — это проблема.

Однако у этого ажиотажа есть важное замечание: похоже, что Qwen3.8-27B приобретает часть своего качества благодаря тому, что много думает.

По данным компании Artificial Analysis, в ходе тестирования модели Intelligence Index было сгенерировано 160 миллионов выходных токенов , тогда как средний показатель для аналогичных моделей с открытым весом составляет 43 миллиона.

Уиллисон столкнулся с экстремальным вариантом того же поведения, поскольку Qwen по умолчанию использует настройку «xhigh» для логического вывода. Запрос на генерацию SVG-изображения пеликана, едущего на велосипеде, занял 21 минуту и потребил более 22 000 токенов логического вывода, прежде чем был получен ответ. Он рекомендует начинать с низкого или нулевого уровня логического вывода для обычного локального использования.

Инвестор и разработчик Томаш Тунгуз обнаружил аналогичный компромисс в небольшом тесте из девяти задач против DeepSeek V4 Flash: с включенным логическим выводом Qwen немного опередил конкурентов по качеству в своем стеке агентов, но, по его словам, он оказался примерно в 30 раз медленнее и в 4,5 раза дороже . Он прямо предупредил, что девяти задач недостаточно для окончательного вывода.

Программное обеспечение для вывода результатов может сократить этот разрыв. Qwen3.8-27B включает в себя прогнозирование нескольких токенов, и Уиллисон сообщил об улучшении производительности своего DGX Spark примерно на 72% после включения MTP через llama.cpp по сравнению с его конфигурацией LM Studio по умолчанию.

Даже тогда его обычные запуски в LM Studio приносили всего около 15-30 токенов в секунду — что значительно ниже скорости отклика многих размещенных моделей.

Именно это напряжение объясняет, почему Qwen3.8-27B важнее, чем другая позиция в таблице лидеров.

Какие выводы следует сделать предприятиям из Qwen3.8-27B

Для предприятий важно не просто сравнить, «превосходит» ли модель 27B модель Claude или GPT по результатам бенчмарка. Важно определить, может ли модель, достаточно компактная для работы в собственной инфраструктуре организации, выполнять достаточно большой объем работы по программированию, анализу документов, обработке изображений и работе с агентами, чтобы заменить вызовы API для решения важных задач.

Это предложение меняет подходы к обеспечению конфиденциальности, развертыванию и расчетам стоимости. Весовые коэффициенты Apache 2.0 можно проверять, изменять и размещать под собственным контролем компании, а Alibaba уже задокументировала совместимость с такими фреймворками для обслуживания, как vLLM, SGLang и TokenSpeed. Alibaba заявляет, что управляемая версия Qwen Cloud с контекстом по умолчанию на 1 миллион токенов и встроенными инструментами появится позже.

Небольшие размеры и доступные аппаратные требования означают, что предприятия, независимые разработчики и даже любопытные потребители могут легко развернуть модель локально, не беспокоясь о том, что их данные покинут их компьютер, что обеспечивает более высокий уровень конфиденциальности, информационной безопасности, управления и контроля.

Есть и более веская причина, по которой опытные пользователи обращают на это внимание. Данные Hugging Face, опубликованные Business Insider на этой неделе, показывают, что фактическое использование моделей резко смещается в сторону более мелких моделей, даже несмотря на то, что огромные новинки доминируют в заголовках новостей; модели с более чем 70 миллиардами параметров составили лишь небольшую долю от общего числа загрузок в 2026 году.

Стратегия Alibaba по выпуску моделей Qwen в нескольких практических размерных классах помогла сделать это семейство неотъемлемой частью рабочих процессов локального развертывания для разработчиков.

Qwen3.8-27B развивает эту логику дальше. Его результаты в бенчмарках всё ещё нуждаются в дополнительной независимой проверке, его поведение по умолчанию может быть крайне неэффективным, и ни один рейтинг не устанавливает паритета с передовыми моделями.

Но спустя три дня после релиза разработчики реагируют уже не столько на таблицу результатов тестов Alibaba, сколько на опыт размещения сравнительно небольшого файла на контролируемом ими оборудовании и наблюдения за тем, как он выполняет задачи, которые еще недавно казались прерогативой крупнейших проприетарных систем.

Для определённых разработчиков, опытных пользователей ИИ — и да, даже для корпоративных внедрений — это наиболее важный критерий.

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Стартап Micro1, занимающийся разработкой решений для искусственного интеллекта, достиг годового оборота в 500 миллионов долларов на фоне бурного роста в области обучения ИИ. Архив рубрики ~Коротко из Telegram~ Игры про русскую жизнь заняли десятую часть мобильного рынка и… Архив рубрики ~Коротко из Telegram~ Забыли, как называется элемент интерфейса? Есть сервис, который найдёт название… Архив рубрики ~Обо всем~ [Перевод] Почему вообще что-то существует Архив рубрики ~Коротко из Telegram~ Google постепенно внедряет расширенный процесс установки приложений от непроверенных разработчиков…. Архив рубрики ~Коротко из Telegram~ CtxPort переносит историю диалогов между ChatGPT, Claude и Gemini Одна… Архив рубрики ~Коротко из Telegram~ ИИ-навыки стали обязательным пунктом почти во всех вакансиях для дата-сайентистов… Архив рубрики ~Коротко из Telegram~ Тепловизор и ИИ помогают увидеть кита раньше, чем в него… Архив рубрики ~Коротко из Telegram~ Бывший инженер Meta* дал показания против компании: «не спрашивай —… Архив рубрики ~Коротко из Telegram~ Австралия обязала бигтех платить за новости — 2,5% рекламной выручки… Архив рубрики ~Коротко из Telegram~ В агентах Next Move Theory нашли скрытое автообновление навыков и… Архив рубрики ~Коротко из Telegram~ ToolHazard-Bench: как проверяют ИИ-агентов на устойчивость к prompt injection Как… Архив рубрики ~Коротко из Telegram~ Один кастомный skill поднял результат Claude на ARC-AGI-3 с 30%… Архив рубрики ~Коротко из Telegram~ «Ингосстрах» собрал 1300 внутренних ИИ-агентов за два месяца Страховая компания… Новости робототехники Стартап Micro1, занимающийся разработкой решений для искусственного интеллекта, достиг годового оборота в 500 миллионов долларов на фоне бурного роста в области обучения ИИ. Архив рубрики ~Коротко из Telegram~ Игры про русскую жизнь заняли десятую часть мобильного рынка и… Архив рубрики ~Коротко из Telegram~ Забыли, как называется элемент интерфейса? Есть сервис, который найдёт название… Архив рубрики ~Обо всем~ [Перевод] Почему вообще что-то существует Архив рубрики ~Коротко из Telegram~ Google постепенно внедряет расширенный процесс установки приложений от непроверенных разработчиков…. Архив рубрики ~Коротко из Telegram~ CtxPort переносит историю диалогов между ChatGPT, Claude и Gemini Одна… Архив рубрики ~Коротко из Telegram~ ИИ-навыки стали обязательным пунктом почти во всех вакансиях для дата-сайентистов… Архив рубрики ~Коротко из Telegram~ Тепловизор и ИИ помогают увидеть кита раньше, чем в него… Архив рубрики ~Коротко из Telegram~ Бывший инженер Meta* дал показания против компании: «не спрашивай —… Архив рубрики ~Коротко из Telegram~ Австралия обязала бигтех платить за новости — 2,5% рекламной выручки… Архив рубрики ~Коротко из Telegram~ В агентах Next Move Theory нашли скрытое автообновление навыков и… Архив рубрики ~Коротко из Telegram~ ToolHazard-Bench: как проверяют ИИ-агентов на устойчивость к prompt injection Как… Архив рубрики ~Коротко из Telegram~ Один кастомный skill поднял результат Claude на ARC-AGI-3 с 30%… Архив рубрики ~Коротко из Telegram~ «Ингосстрах» собрал 1300 внутренних ИИ-агентов за два месяца Страховая компания…

Оставить комментарий