Meta возвращается к открытому исходному коду с Muse Glimmer, моделью искусственного интеллекта с 30 миллиардами параметров, распространяемой по лицензии Apache 2.0 и оптимизированной для агентов — доступна уже сейчас.
Карл Франзен
Сегодня компания Meta выпустила Muse Glimmer, модель с открытыми параметрами и 30 миллиардами весов, предназначенную для запуска автономных агентов ИИ непосредственно на потребительском оборудовании, перенося рабочие нагрузки агентов, которые обычно зависят от облачной инфраструктуры, на высокопроизводительные компьютеры Mac и PC.
Не менее примечательным, чем функциональность модели, является способ её лицензирования. Glimmer выпускается под разрешительной, соответствующей отраслевым стандартам лицензией Apache 2.0 с открытым исходным кодом — это первый полностью открытый релиз компании с тех пор, как в апреле она сменила семейство открытых решений Llama на собственную разработку Muse Spark.
Фактически, Muse Glimmer запускается сегодня с более либеральной лицензией, чем та, что когда-либо была у Llama. Специальная лицензия сообщества Llama годами подвергалась критике из-за таких ограничений, как ограничение в 700 миллионов пользователей в месяц; Apache 2.0 не имеет подобных ограничений, разрешая неограниченное коммерческое использование, модификацию и распространение.
Весовые коэффициенты уже доступны в Hugging Face. Ван сказал, что поддержка внедряется на этой неделе через Ollama, LM Studio, vLLM, SGLang, Together AI, Fireworks AI и OpenRouter, а оптимизированные интеграции llama.cpp, MLX и ExecuTorch появятся в ближайшие дни; в сообщении в блоге Meta также упоминается Unsloth как партнер по локальной среде выполнения и указывается на TorchTitan от PyTorch для тонкой настройки. Компания заявляет, что работает с AMD, Arm, Dell, Intel и Nvidia над оптимизацией производительности на разных устройствах, и опубликовала документацию для разработчиков, описывающую пользовательские шаблоны агентов.
«Сегодня мы также открываем доступ к весам для Muse Glimmer, отличной модели с 30 миллиардами параметров, которая может работать локально», — написал соучредитель и генеральный директор Meta Марк Цукерберг в сообщении на X (под своим давним ником @finkd). «Вскоре мы также выпустим веса для Muse Spark 1.2, нашей новейшей базовой модели. Meta — активный сторонник открытого исходного кода, и я горжусь этими релизами».
Обещанный релиз Muse Spark 1.2 должен был стать ещё более значительным изменением: это передовая модель, лежащая в основе Muse Code, терминального агента для программирования, выпущенного Meta всего пять дней назад, и до сегодняшнего дня всё семейство Muse было проприетарным. Цукерберг на презентации намекнул, что «скоро поделится большей информацией» об открытом исходном коде. Теперь мы знаем, что он имел в виду.
Для разработчиков и предприятий практическое значение локального вывода информации выходит за рамки места выполнения вычислений. Агент, работающий с файлами, скриншотами, средами разработки и другим конфиденциальным контекстом, может выполнять эти рабочие процессы без постоянной отправки этой информации в удаленную службу вывода. Локальное развертывание также исключает из цикла вывода информации доступ к сети и плату за API за каждый токен — хотя организации по-прежнему несут расходы на оборудование, электроэнергию, развертывание и управление.
Модель 30B, построенная на основе агентного цикла.
Вместо того чтобы позиционировать Glimmer в первую очередь как универсального чат-бота, Meta обучила его последовательности операций, выполняемых автономным агентом: разработка плана, вызов инструментов, интерпретация результатов, продолжение работы и восстановление в случае возникновения проблем.
«Как и гораздо более крупные модели, Muse Glimmer может функционировать как полноценный агент, осуществляя планирование, задействуя инструменты, проверяя собственные результаты и восстанавливаясь после сбоев», — написал Александр Ван, главный специалист Meta по искусственному интеллекту, в ветке обсуждения на X, посвященной анонсу релиза, добавив, что модель «может работать на 24 ГБ видеопамяти без потери надежности агента».
Согласно описанию модели на Hugging Face, Glimmer — это плотный причинно-следственный трансформер с приблизительно 29,6 миллиардами параметров в 52 слоях, включая выделенный кодировщик восприятия ViT-G/14 с ~1,8 миллиардами параметров. Он принимает чередующийся текст и изображения, генерирует текст, поддерживает более 100 языков и имеет заявленную длину контекста 131 072 токена или более, с пределом обработки знаний 4 января 2026 года.
Эта комбинация предназначена для того, чтобы агент мог интерпретировать скриншоты, диаграммы и документы, одновременно анализируя текст и используя внешние инструменты. Glimmer предлагает низкие, средние, высокие и сверхвысокие настройки уровня логического мышления — устанавливаемые через системную подсказку — поэтому приложения могут увеличивать или уменьшать трудозатраты на выполнение задач, и, по словам Meta, это работает со всеми агентскими платформами, включая OpenClaw и Hermes Agent.
Модель представляет собой упрощенную версию флагманской модели Meta: согласно техническому сообщению в блоге компании, Glimmer была предварительно обучена на выходных данных Muse Spark с использованием логистической дистилляции, затем прошла промежуточное обучение на данных с более длинным контекстом и большим количеством агентов, содержащих более подробные траектории рассуждений, после чего была дополнительно обучена с помощью контролируемой тонкой настройки, дистилляции на основе политики и обучения с подкреплением в общих областях, рассуждениях, программировании и агентном управлении.
Компания Meta продемонстрировала результат на примере локального рабочего процесса Home Assistant: в демонстрационном видеоролике Glimmer автономно обнаруживает экземпляр Home Assistant в сети с помощью вызовов инструментов, запрашивает API устройств, создает с нуля адаптивную панель управления на HTML/CSS/JavaScript и развертывает локальный сервер для проверки своей работы. Это ближе к реальной работе корпоративных агентов, чем автономный бенчмарк для ответов на вопросы — модель должна поддерживать план действий при взаимодействии с внешними системами, а затем проверять, привели ли ее действия к ожидаемому результату.
Сжатие агента до 24 ГБ
В основе релиза лежит вопрос аппаратной части.
По данным Meta, для работы с максимальной точностью модели 30B требуется более 55 ГБ памяти — больше, чем у любой потребительской видеокарты.
Поэтому компания разработала версии с квантованием примерно в 4 бита, которые уменьшают весовые коэффициенты языковой модели до менее чем 20 ГБ, оставляя запас для компонентов, также необходимых оперативному агенту в памяти: кэш ключ-значение, кодировщик восприятия и сопутствующая модель спекулятивного декодирования, — все это помещается в 24 или 32 ГБ памяти.
На практике это означает, что квантованные сборки работают на потребительских компьютерах — хотя и на топовых моделях. Конфигурация K-Quant-17GB, ориентированная на 24 ГБ, подходит для одной высокопроизводительной потребительской видеокарты, такой как Nvidia RTX 3090 или RTX 4090 (обе с 24 ГБ видеопамяти), в то время как версия K-Quant-Dynamic, ориентированная на 32 ГБ, соответствует 32 ГБ у более новой RTX 5090. На Mac унифицированная память Apple Silicon играет роль видеопамяти, поэтому MacBook Pro или Mac Studio с 32 ГБ или более памяти может вместить весь стек — Meta провела собственные тесты скорости на MacBook Pro с процессорами M4 Max и M5 Max. Однако типичный ноутбук с 8 или 16 ГБ оперативной памяти по-прежнему недоступен, а полнофункциональная версия BF16 — которую Meta оценивает в 64 ГБ — остаётся в пределах возможностей графических процессоров центров обработки данных и топовых конфигураций Mac Studio.
Компания Meta сообщает о среднем снижении точности всего на 0,2% по результатам 15 тестов для своей версии K-Quant-Dynamic, предназначенной для оборудования с 32 ГБ оперативной памяти, и на 1% для конфигурации K-Quant-17GB, предназначенной для оборудования с 24 ГБ оперативной памяти. Эти цифры получены в результате собственных измерений Meta, а не независимых оценок.
Meta также использует спекулятивное декодирование DFlash для решения другой серьезной проблемы локальных агентов: задержки. Вместо последовательной генерации каждого токена, меньшая по размеру модель «черчения» DFlash предлагает блоки из 16 токенов, которые основная модель проверяет параллельно, обеспечивая более быстрый и идентичный результат.
По данным Meta, это увеличивает среднюю скорость генерации на Nvidia RTX 5090 с 74,9 токенов в секунду до 233,4 — увеличение в 3,1 раза. На Apple M5 Max этот показатель вырос с 26,6 до 50,2 токенов в секунду (в 1,8 раза), а на M4 Max — с 23,7 до 37,8 (в 1,5 раза). В тестах использовался размер пакета один и жадное декодирование, измерения на системах Apple проводились с помощью ExecuTorch, а на RTX 5090 — с помощью llama.cpp.
Для приложений, использующих агентов, эти множители имеют большее значение, чем для чата: один запрос пользователя может инициировать множество оборотов модели, вызовов инструментов и этапов проверки, а задержка, накапливающаяся на каждом этапе, может быстро сделать работу агента, в остальном обладающего необходимыми функциями, непрактичной.
Компания Glimmer выходит на все более конкурентный рынок, ориентированный на локальные модели.
Meta не выходит на пустующее поле. У разработчиков уже есть способные модели с открытым исходным кодом в этом классе размеров, наиболее известные из которых — семейство Gemma 4 от Google и Qwen3.6-27B от Alibaba — обе позиционируются как решения для рассуждений, многомодального понимания и работы с агентами. Собственная таблица бенчмарков Meta напрямую сравнивает их с обеими.

Glimmer лидирует в этом сравнении трех программ по нескольким тестам, включая MCP Atlas с результатом 75,5, DeepSearch QA с 74,6, τ³-Banking с 23,5, WildClawBench с 47,6 и GAIA2 с 43,3. В SWE-Bench Pro он набирает 51,2 балла, против 36,9 у Gemma4-31B и 50,2 у Qwen3.6-27B в оценке Meta.
Но Glimmer не лидирует во всех тестах. Qwen лидирует в собственном сравнении Meta по OSWorld-Verified (75,6 против 65,9 у Glimmer), TerminalBench 2.1 (60,7 против 51,7), SkillsBench, GDPval-AA (1141 против 953) и большинству мультимодальных бенчмарков. В SWE-Bench Verified результат Glimmer (76,0) немного уступает результату Qwen (77,2). Gemma лидирует в GPQA Diamond и Humanity's Last Exam.
Честно говоря, цифры показывают, что Glimmer представляет больший интерес как специализированная модель локального агента, чем как доказательство универсального превосходства в производительности. Для корпоративных разработчиков практический вопрос заключается в том, насколько сочетание надежности агента, качества квантования, совместимости с инструментами и скорости декодирования, подтвержденное в бенчмарках, применимо в реальных рабочих процессах.
|
Модель |
Разработчик / происхождение |
AA балл |
Параметры / контекст |
Самая низкая цена на отслеживаемый API |
Доступ |
Лицензия |
Наиболее эффективные варианты использования |
|
Кими К3 |
Прорывной искусственный интеллект; Китай |
60 |
2,8 Тл всего / 104 Бл активны; 1 МБ |
Входной сигнал: 3,00 $ / Выходной сигнал: 15,00 $ через Kimi, Fireworks или Modal (ценообразование) |
Веса Kimi API |
Лицензия на использование изображения Кими К3 по индивидуальному заказу. Крупным операторам, предоставляющим услуги «модель как услуга» и имеющим годовой доход более 20 миллионов долларов, требуется отдельное соглашение. На крупных товарах может потребоваться разместить надпись «Kimi K3». |
кодирование с дальним горизонтом развития Мультимодальные исследования и сложные агенты, управляемые инструментами. |
|
GLM-5.2 |
З.ай/Жипу АИ; Китай |
53 |
753B / 40B активен; 1M |
0,75 долл. США / 2,40 долл. США через DeepInfra FP4 (цена) |
Веса Z.ai API |
MIT |
Долгосрочное кодирование и агенты Анализ миллиона токенов с настраиваемыми рассуждениями. |
|
DeepSeek V4 Flash 0731 |
DeepSeek; Китай |
52 |
284B / 13B активны; 1M |
0,09 долл. США / 0,18 долл. США через DeepInfra (ценообразование) |
Веса API DeepSeek |
MIT |
• Чрезвычайно экономичное мышление • Кодирование агентов, работа с терминалом и использование инструментов |
|
МиниМакс-М3 |
Минимакс; Китай |
45 |
428B / 23B активны; 1M |
0,23 долл. США / 0,96 долл. США через CoreWeave (цена) |
Веса ; API MiniMax |
Лицензия MiniMax Community License. Требуется указание авторства в коммерческих целях; компаниям с годовым доходом более 20 миллионов долларов требуется разрешение. Включает условия, запрещающие использование. |
• Работа с исходным текстом, изображениями и видео • Кодирование с длинным контекстом и агенты для совместной работы |
|
MiMo-V2.5-Pro |
Xiaomi; Китай |
43 |
1.02T / 42B активный; 1M |
0,35 долл. США / 0,70 долл. США через GMI (ценообразование) |
Веса API Xiaomi |
MIT |
Сложная разработка программного обеспечения Операторы обрабатывают тысячи запросов на использование инструментов. |
|
Инклинг |
Лаборатория «Мыслящих машин»; США |
42 |
975B / 41B активный; 1M в весе |
0,95 долл. США / 4,05 долл. США через DeepInfra FP8 (цена) |
Веса Тинкер |
Apache 2.0 |
Настраиваемая текстовая, графическая и аудиооснова Тщательно настроенные системы кодирования, RAG и использования инструментов. |
|
Nemotron 3 Ultra 550B A55B |
NVIDIA; США |
38 |
550B / 55B активный; выдерживает нагрузку до 1 млн. |
0,37 долл. США / 1,08 долл. США через Blackbox AI (ценообразование) |
Веса |
OpenMDW-1.1; разрешительные коммерческие права и права на производные модели. |
Сложные агенты и рассуждения в длительном контексте Высокоточная радиогравитация, программирование, математика и наука. |
|
Мистраль Средний 3.5 |
Искусственный интеллект «Мистраль»; Франция |
30 |
Плотность 128 млрд; 256 тыс. |
1,50 $ / 7,50 $ через Mistral (цена) |
Веса API Мистраль |
Модифицированная версия MIT. Компании с консолидированной ежемесячной выручкой свыше 20 миллионов долларов должны получить коммерческую лицензию или использовать услуги Mistral. |
Агенты кодирования и вызов функций Многомодальное обучение после |
|
Джемма 4 31Б |
Google DeepMind; США |
30 |
Плотность 30,7 млрд; 256 тыс. |
Бесплатно в рамках ограниченного тарифа Google AI Studio; платная версия стоит $0,10 / $0,34 через CoreWeave (цены). |
Веса Google AI Studio |
Apache 2.0 |
Компактное многомодальное рассуждение и кодирование Управляемые локальные или частные серверные развертывания |
|
gpt-oss-120b |
OpenAI; США |
24 |
117B / 5.1B активных; 131K |
0,03 долл. США / 0,17 долл. США через CoreWeave (ценообразование) |
Веса Многочисленные сторонние API |
Apache 2.0 |
Рассуждения структурированный вывод и инструменты Тонкая настройка и развертывание с использованием одной 80-гигабайтной видеокарты. |
|
Командир А+ |
Когер; Канада |
23 |
218B / 25B активный; 128K вход |
Бесплатно на отслеживаемой в данный момент платформе Cohere (цены) |
Веса Когере |
Apache 2.0 |
Enterprise RAG и обоснованные цитаты • Многоязычные агенты и обработка документов |
|
Muse Glimmer 30B |
Мета; США |
Пока не забито |
Плотность памяти 29,6 млрд, включая кодировщик машинного зрения; более 131 тыс. |
В день запуска общедоступная цена на размещенные услуги с оплатой по факту использования не была указана. |
Веса Страница метамодели |
Apache 2.0 для полноточных весов, квантования, Drafter и Perception Encoder. |
Постоянно работающие локальные агенты в системах с объемом памяти 24–32 ГБ Использование инструментов, восстановление данных, программирование и понимание экрана/документа. |
Meta Glimmer пополняет пока ещё небольшой список действительно открытых, передовых моделей от американских компаний.
В течение последних двух лет китайские компании задавали темп в области искусственного интеллекта с открытым исходным кодом: DeepSeek, команда Qwen от Alibaba, Kimi от Moonshot AI, GLM от Zhipu и MiniMax выпускали передовые открытые модели под лицензиями MIT и Apache 2.0 с такой скоростью, которую западные лаборатории не смогли превзойти.
Данные об использовании это подтверждают: к маю 2026 года на китайские модели с открытым весом приходилось примерно 61% всех токенов, используемых на OpenRouter, при этом четыре из пяти наиболее используемых моделей были разработаны в Китае, а Llama от Meta, ранее занимавшая лидирующие позиции среди моделей с открытым весом, полностью выбыла из рейтинга.
Примеров из США, которые можно пересчитать по пальцам одной руки, достаточно: gpt-oss-120b и gpt-oss-20b от OpenAI, выпущенные под лицензией Apache 2.0 в августе 2025 года как первые открытые веса компании со времен GPT-2; семейство Gemma от Google, которое также является открытыми весами, но распространяется под собственной, более ограничительной пользовательской лицензией Google, а не под лицензией, одобренной OSI; и Inkling от Thinking Machines.
Glimmer наиболее прямолинейно сравнивается с gpt-oss: оба являются Apache 2.0, оба предлагают настраиваемые усилия по логическому мышлению и оба ориентированы на развертывание на собственных серверах.
Однако модели gpt-oss представляют собой текстовые, разреженные разработки, созданные в основном для логического мышления и использования инструментов — gpt-oss-20b помещается примерно в 16 ГБ памяти, а gpt-oss-120b ориентирован на один 80-гигабайтный графический процессор для центров обработки данных.
Glimmer занимает иную позицию: это плотная модель с собственными входными данными для обработки изображений, обученная от начала до конца на основе цикла работы агента, поставляемая со своими собственными квантованными вариантами и алгоритмом спекулятивного декодирования, оптимизированным для потребительских компьютеров с 24 ГБ оперативной памяти.
И если Цукерберг выполнит свое обещание открыть доступ к весам Muse Spark 1.2, Meta выпустит в открытый доступ настоящую флагманскую американскую модель, демонстрирующую передовые технологии, чего еще не делала ни одна американская лаборатория на этом уровне.
Безопасность остается неотъемлемой частью архитектуры развертывания.
Предоставление локальной модели доступа к инструментам создает иную проблему безопасности, чем развертывание локального чат-бота, — и собственные данные Meta показывают, что Glimmer не является повсеместно более надежным, чем аналогичные решения.
В тесте CI Memories, оценивающем уровень конфиденциальности, где чем ниже процент нарушений, тем лучше, Glimmer показывает результат 26,4 против 12,1 у Gemma и 53,4 у Qwen. В тесте Siren AgentDojo, тесте на внедрение подсказок, Glimmer демонстрирует 28,4% успешных атак против 25,6% у Gemma и 40,3% у Qwen, при этом показывая самый высокий показатель полезности из трех — 94,2.
Компания Meta заявляет, что провела оценку Glimmer в рамках своей системы оценки масштабируемости ИИ (Advanced AI Scaling Framework) и пришла к выводу, что модель не соответствует определению «передового ИИ» в этой системе, поскольку в целом она менее функциональна, чем Muse Spark. Группа по обеспечению готовности оценила Glimmer как модель с умеренным или низким уровнем риска по категориям химического/биологического, киберугроз и потери контроля — последние две категории были определены на основании того факта, что Glimmer в целом слабее, чем Muse Spark 1.0, получивший те же оценки.
Тем не менее, компания рекомендует развертывать Glimmer как часть более широкой системы с механизмами защиты, включая подтверждение необратимых действий человеком. Это предостережение особенно важно для локальных агентов: хранение данных на устройстве снижает зависимость от облачной инфраструктуры, но локальное выполнение само по себе не решает проблему внедрения запросов, избыточных разрешений или непреднамеренных действий агента.
Весовые коэффициенты Apache 2.0 и быстрорастущая экосистема среды выполнения.
Meta выпускает полноточные веса BF16, оба варианта с 4-битным квантованием, программу для создания моделей DFlash и кодировщик восприятия — все под управлением Apache 2.0. Цена API Meta для загружаемой модели не указана, поэтому общая стоимость зависит от локального оборудования или выбора сторонних разработчиков хостинга. Для команд, занимающихся закупками, стоит отметить один нюанс: как и в большинстве случаев с моделями с «открытым исходным кодом», открытыми являются только веса — Meta не опубликовала обучающие данные или код обучения.
В более широком смысле это означает, что Meta рассматривает рабочую станцию разработчика как достойную целевую платформу для развертывания автономных агентов, а не просто как место для экспериментов с более компактными языковыми моделями. Размер Glimmer в 30 байт и целевой объем в 24 ГБ делают это предложение доступным для высокопроизводительного потребительского оборудования, а лицензия Apache 2.0 предоставляет разработчикам — и их юридическим отделам — необычайную свободу в модификации и развертывании.
Следующая проверка заключается в том, выдержат ли преимущества Glimmer, подтвержденные результатами бенчмарков, более сложные условия реальных репозиториев программного обеспечения, корпоративных инструментов и длительных сеансов работы агентов. Если да, то наиболее важным аспектом Glimmer может оказаться не еще один набор результатов бенчмарков, а то, что класс агентов, ранее предполагавший работу за облачным API, сможет все чаще работать на компьютере, стоящем под столом разработчика.
Источник: venturebeat.com
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
