Meta Muse Glimmer внедряет локальных агентов искусственного интеллекта в потребительские графические процессоры.
Искусственный интеллект с открытым исходным кодом и демократизацией
Meta Muse Glimmer внедряет локальных агентов искусственного интеллекта в потребительские графические процессоры.
Компания Meta выпускает Muse Glimmer под лицензией Apache 2.0 для локальных агентов искусственного интеллекта, способных работать на потребительских графических процессорах.
Лаборатория Superintelligence Labs компании опубликовала весовые коэффициенты модели с 30 миллиардами параметров на платформе Hugging Face. Meta утверждает, что разработчики могут использовать её для локального программирования, вызова функций, локальных агентов и оценки LLM в качестве судьи.
В этом релизе решается операционная проблема, с которой сталкиваются команды разработчиков ИИ: облачные модели требуют доступа к сети и централизованной инфраструктуре. Вместо этого Meta предлагает Muse Glimmer для рабочих нагрузок, требующих модели, работающей непосредственно на устройстве, включая персональных агентов с доступом к расписаниям, сообщениям, файлам и другому конфиденциальному контексту.
MetaMuse Glimmer лидирует в нескольких сравнительных тестах производительности агентов.
В ходе сравнительных тестов Meta, модель Muse Glimmer опередила Gemma4-31B и Qwen3.6-27B по пяти из восьми показателей для универсальных агентов. Модель набрала 75,5 баллов в тесте MCP Atlas. Gemma4-31B показала результат 54,2 балла, а Qwen3.6-27B — 62,5 балла.
В DeepSearch QA наблюдается аналогичная закономерность. Meta сообщает о результате 74,6 для Muse Glimmer, 61,7 для Gemma4-31B и 71,1 для Qwen3.6-27B. В предоставленном объявлении оба теста определены как проверка способности агента работать в рамках заданных шаблонов и выполнять многоэтапные запросы.
Модель набрала 23,5 балла по τ²-Banking. Gemma4-31B показала 15,1 балла. Qwen3.6-27B достигла 16,7 балла.
Muse Glimmer также показала результат 47,6 на WildClawBench, опередив Gemma4-31B (37,6) и Qwen3.6-27B (43,2). Ее результат на GAIA2 достиг 43,3 по сравнению с 36,4 и 40,0 соответственно.
В других тестах агент Qwen3.6-27B показывает лучшие результаты. В таблице Meta эта модель набрала 1141 балл по GDPval-AA, против 953 у Muse Glimmer и 811 у Gemma4-31B. Qwen3.6-27B также лидирует в SkillsBench с результатом 46,6 баллов по навыкам, в то время как Muse Glimmer показала 44,3 балла.
Наибольший разрыв в этой группе показала компания OSWorld-Verified. По данным Meta, показатель Qwen3.6-27B составил 75,6. Muse Glimmer набрала 65,9, а Gemma4-31B — 58,5.
Эти тесты измеряют выполнение задач с ограниченными возможностями. Они не демонстрируют, как локальный агент будет вести себя после того, как организация подключит его к своим файлам, календарям, системам обмена сообщениями или внутренним инструментам.
Результаты кодирования разделились между Muse Glimmer и Qwen.
Результаты тестирования Muse Glimmer показывают более узкое сравнение. Модель превзошла SWE-Bench Pro с результатом 51,2. Meta сообщает о 36,9 для Gemma4-31B и 50,2 для Qwen3.6-27B.
Команда SciCode показала близкий результат. Muse Glimmer набрала 43,6 балла, немного опередив Gemma4-31B, у которой этот показатель составил 43,4. Qwen3.6-27B показала результат 39,8.
Qwen3.6-27B лидировал в двух других тестах на проверку навыков программирования. Он набрал 77,2 балла в SWE-Bench Verified, в то время как Muse Glimmer показал 76,0. TerminalBench 2.1 дал Qwen3.6-27B результат 60,7; Muse Glimmer достиг 51,7, а Gemma4-31B — 43,4.
Локальный агент программирования делает больше, чем просто генерирует код. Ему необходима структура, которая определяет, к каким репозиториям, терминалам, тестовым средам и командам модель может получить доступ. Компания Meta утверждает, что Muse Glimmer поддерживает OpenClaw и другие шаблоны оркестровки агентов, а пользовательские структуры описаны в документации для разработчиков.
Организация, оценивающая модель для работы с программным обеспечением, должна определить команды и репозитории, доступные агенту, прежде чем измерять успешность выполнения задачи. В предоставленных материалах описывается обучение повторным попыткам для неудачных вызовов инструментов. Такое поведение требует контроля над повторными попытками, особенно в тех случаях, когда инструмент может изменять исходный код или вызывать внешнюю систему.
В большинстве тестов Квен демонстрирует лучшие результаты по мультимодальному анализу.
Muse Glimmer принимает чередующийся текст и изображения с помощью специального кодировщика восприятия. По словам Meta, такая конструкция позволяет агентам интерпретировать скриншоты, диаграммы и документы как часть диалога.
В сравнительном анализе результатов поиска Charxiv Reasoning Muse Glimmer лидирует. Его результат составил 78,8 против 77,7 у Gemma4-31B и 78,4 у Qwen3.6-27B.
Модель Qwen3.6-27B лидировала в тесте ScreenSpot Pro с результатом 76,1. Muse Glimmer показала 75,4, а Gemma4-31B — 75,9. Эта же модель лидировала в тесте OmniDocBench v1.5 с результатом 77,8, по сравнению с 75,8 у Muse Glimmer и 72,5 у Gemma4-31B.
MMMU Pro показал меньшие различия. Meta указывает Muse Glimmer на уровне 74. Qwen3.6-27B достиг 75, а Gemma4-31B — 73.
Эти результаты важны для команд, рассматривающих возможность использования агентов, взаимодействующих с визуальными интерфейсами. Модель, считывающая скриншоты, может интерпретировать увиденное, однако локальное тестирование все равно должно охватывать разрешения, макеты отображения, форматы документов и ошибки, возвращаемые подключенными инструментами.
Данные по безопасности показывают, что уровень успешности атак ниже, чем у Qwen.
Компания Meta также сообщает о результатах двух оценок, связанных с безопасностью: CI Memories и Siren AgentDojo. В таблице используются разные показатели для каждого теста.
На сайте CI Memories Meta указывает частоту нарушений для Muse Glimmer в 26,4 и показатель покрытия 64,8. Gemma4-31B показала частоту нарушений 12,1 при показателе покрытия 53,0. Qwen3.6-27B показала частоту нарушений 53,4 и показатель покрытия 66,9.
В результатах Siren AgentDojo используются показатели успешности атак и полезности. Meta оценивает Muse Glimmer в 28,4% успешности атак и 94,2% полезности. Gemma4-31B получила 25,6% успешности атак и 90,8% полезности. Qwen3.6-27B показала 40,3% и 92,7%.
Результаты общих рассуждений добавляют контекст к утверждениям агентов.
В сравнительном тесте Meta, Muse Glimmer лидировала в четырех из шести тестов на общие способности и логическое мышление. Она набрала 77,0 баллов на IFBench. Gemma4-31B показала 76,0 баллов, а Qwen3.6-27B — 70,8 баллов.
По результатам теста AIME 2026, оценка Muse Glimmer составила 94,7. Meta сообщает о результатах 89,2 для Gemma4-31B и 94,1 для Qwen3.6-27B. По показателю AA-LCR Muse Glimmer достигла 80,0, опередив 68,3 и 73,3.
Эта модель также лидировала в группе Beam 128K с результатом 65,1. Qwen3.6-27B набрала 63,0 балла. Gemma4-31B показала результат 58,2.
Gemma4-31B лидировала в GPQA Diamond с результатом 85,7. Muse Glimmer набрала 83,5, за ней следует Qwen3.6-27B с 84,2. Gemma4-31B также показала лучший результат в последнем экзамене человечества, Text No Tools, — 23,6; Muse Glimmer набрала 22,0.
Одна модель не может лидировать во всех тестах. Результаты Meta показывают, что Muse Glimmer успешно конкурирует с двумя моделями аналогичного размера в смешанном наборе оценок, касающихся агента, программирования, визуального оформления, безопасности и логического мышления.
Ограничения по объему памяти определяют дизайн локального развертывания.
По данным Meta, для модели с 30 миллиардами параметров и полной точностью потребовалось бы более 55 ГБ памяти. Вместо этого Muse Glimmer использует приблизительно 4-битное квантование весов, что позволяет сократить размер языковой модели до менее чем 20 ГБ.
Такое выделение памяти оставляет место для кэша ключ-значение. Модели также требуется место для кодировщика восприятия и алгоритма спекулятивного декодирования. Meta планирует выделить 24 или 32 ГБ памяти для этих компонентов.
Компания утверждает, что основанный на DFlash инструмент для создания шаблонов предлагает блоки токенов для параллельной проверки основной моделью. Meta заявляет, что это ускоряет генерацию по сравнению со стандартным пошаговым выводом токенов и сохраняет идентичное качество выходных данных. В предоставленном сообщении отсутствуют данные о количестве токенов в секунду, размерах запросов, энергопотреблении или результатах параллельной обработки.
Компания Meta протестировала свою версию K-Quant-17GB с квантованным редактором DFlash Drafter на компьютерах MacBook M4-Max, MacBook M5-Max и видеокарте RTX-5090. Полученные результаты описываются как подходящие для плавного общения и взаимодействия с агентами в режиме реального времени.
Доступ к общедоступным весам можно получить через Hugging Face. Meta сообщает, что интеграция с llama.cpp, MLX и ExecuTorch появится в ближайшие дни.
См. также: Alibaba тестирует новую бизнес-модель для Qwen — ИИ с открытым исходным кодом.

Хотите узнать больше об искусственном интеллекте и больших данных от лидеров отрасли? Посетите выставку AI & Big Data Expo, которая пройдет в Амстердаме, Калифорнии и Лондоне. Это масштабное мероприятие является частью TechEx и проводится одновременно с другими ведущими технологическими выставками, включая Cyber Security & Cloud Expo. Для получения дополнительной информации нажмите здесь.
AI News — это проект TechForge Media. Здесь вы можете ознакомиться с другими предстоящими мероприятиями и вебинарами, посвященными корпоративным технологиям.
Источник: www.artificialintelligence-news.com
Похожие записи
Оцените материал:
Похожие записи
Судья Ивонн Гонсалес Роджерс принимает решение по делу «Маск против Альтмана»
19.05.2026
Microsoft внедрила автономного ИИ-агента в настольный Excel
03.02.2026Мини-ПК нового формата: что умеет Lenovo Yoga Mini i Gen 11
09.04.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
