Архив рубрики ~Лента новостей~

Meta утверждает, что Muse Spark 1.3 демонстрирует производительность на передовом уровне, но наилучшие результаты достигаются при использовании модели, которую разработчики пока не могут широко применять.

Meta утверждает, что Muse Spark 1.3 демонстрирует производительность на передовом уровне, но наилучшие результаты достигаются при использовании модели, которую разработчики пока не могут широко применять.
Meta утверждает, что Muse Spark 1.3 демонстрирует производительность на передовом уровне, но наилучшие результаты достигаются при использовании модели, которую разработчики пока не могут широко применять.

Карл Франзен

Новейшая модель искусственного интеллекта Muse Spark 1.3 от Meta, представленная вчера, работает быстрее и демонстрирует более высокую производительность в сторонних тестах, чем её предшественница — с одной оговоркой.

«Сегодня выходит Muse Spark 1.3 с невероятно высокой производительностью, которую практически невозможно измерить», — написал соучредитель и генеральный директор Meta Марк Цукерберг на X, назвав это «самым большим скачком» Meta в области программирования и агентских систем.

Обе части этого утверждения имеют под собой основания. Muse Spark 1.3 значительно превосходит выпущенную в прошлом месяце версию 1.2, особенно в отношении длительных задач агентов. Версия, доступная разработчикам сейчас, также является одним из лучших предложений по соотношению цены и производительности, занимая лидирующие позиции в независимых рейтингах моделей.

Наилучшие результаты в бенчмарке Muse Spark 1.3, по данным Meta, получены с использованием конфигурации с максимальным уровнем логического мышления. Meta заявляет, что эта версия все еще проходит дополнительное тестирование безопасности и появится «вскоре»; сторонняя компания по бенчмаркингу Artificial Analysis утверждает, что оценивала max в рамках ограниченного предварительного тестирования для партнеров и в настоящее время не указывает ни одного поставщика API для этой конфигурации.

Версия, которая на этой неделе широко распространяется через свою среду разработки Muse Code и API Meta Model, использует ранее доступные настройки логического вывода Meta, включая xhigh.

Поэтому более актуальным для предприятий становится вопрос не о том, сможет ли Muse Spark 1.3 достичь новых высот, а о том, насколько близко к этому уровню приблизится модель, которую компании могут реально внедрить уже сегодня, и какой будет её реальная стоимость.

Модель доставки очень хорошая, но не является эталонной.

Компания Meta раскрывает результаты для обеих конфигураций в своем отчете об оценке, поэтому дело не в том, что компания скрывает готовую к развертыванию модель. Однако в рекламных материалах компании prominently представлена максимальная версия, и некоторые из самых высоких результатов получены именно с этой конфигурацией.

Тесты производительности MetaMuse Spark 1.3

Например, Meta сообщает о результатах GDPval-AA v2: 1754 Elo для max против 1709 для xhigh, 66,9 против 57,2 для OSWorld 2.0 и 64,9 против 61,2 для JobBench.

В некоторых тестах разница незначительна или даже обратная: DeepSearchQA показывает одинаковый результат — 89,4, в то время как xhigh набирает 89,2 в Terminal-Bench 2.1 против 88,8 у max.

Artificial Analysis оценивает Muse Spark 1.3 max на 62 балла по индексу интеллекта, а версию xhigh, поступившую в продажу, — на 61 балл. Последняя делит первое место с GPT-5.6 Sol max, Grok 4.6 high и Claude Opus 5 high. Но Anthropic по-прежнему занимает первое место в рейтинге: Claude Fable 5.1 достигает 66 баллов на max и 65 на xhigh, а Claude Opus 5 — 63 балла на max и xhigh.

Иными словами, Muse Spark 1.3 xhigh по праву находится в передовой группе, но это не та модель, которая в настоящее время устанавливает передовые позиции.

Это все еще существенное изменение по сравнению с Muse Spark 1.2. В обзоре VentureBeat, посвященном запуску в прошлом месяце, Meta представила достойного конкурента в области программирования, который, тем не менее, в целом отставал от лучшей модели Anthropic. Muse Spark 1.2 набрала 82,9% в Terminal-Bench 2.1 против 86,7% у Opus 5, а также уступила Opus в других основных сравнительных тестах, представленных Meta.

В версии 1.3 Meta уже не просто участвует в этом конкурсе. В ряде оценок по программированию и агентным технологиям она делит победы с OpenAI и Anthropic.

Компания Meta утверждает, что базовая модель также стала проще в использовании. Muse Spark 1.3 обучен поддерживать несколько рабочих процессов в длинном потоке, собирать контекст с помощью инструментов, выявлять пробелы в собственных планах, запрашивать у пользователей уточнения при необходимости и подтверждать действия перед их выполнением. По результатам внутренних сравнений инженеров Meta, при кодировании использовалось примерно на 20% меньше вызовов инструментов и на 25% меньше токенов, чем в версии 1.2.

Для предприятий, оплачивающих тысячи или миллионы циклов взаимодействия агентов, эти улучшения в поведении могут иметь большее значение, чем еще один балл в таблице лидеров.

«Почти слишком дешево, чтобы учитывать» не означает, что Meta снизила цены.

В версии Muse Spark 1.3 цена API не снизилась. Meta сохранила стандартные цены на уровне Muse Spark 1.2: 1,25 доллара за миллион входных токенов, 4,25 доллара за миллион выходных токенов и 0,15 доллара за миллион кэшированных входных токенов.

Модель

Входные данные ($/1 млн)

Объем производства ($/1 млн)

Итого ($/1 млн)

Источник

Участник проекта Muse Spark 1.2 / 1.3

0,10 доллара

0,20 доллара

0,30 доллара

Мета

MiMo-V2.5 Flash

0,10 доллара

0,30 доллара

0,40 доллара

Xiaomi

DeepSeek-V4-Flash — вне пиковой нагрузки

0,22 доллара

0,66 доллара

0,88 доллара

DeepSeek

GPT-5.6 Луна

0,20 доллара

1,20 доллара

1,40 доллара

OpenAI

МиниМакс-М3

0,30 доллара

1,20 доллара

1,50 доллара

МиниМакс

LongCat-2.0 — акция, действующая ограниченное время.

0,30 доллара

1,20 доллара

1,50 доллара

ЛонгКэт

DeepSeek-V4-Flash — часы пик

0,44 доллара

1,32 доллара

1,76 доллара

DeepSeek

MiMo-V2.5

0,40 доллара

2,00 доллара

2,40 доллара

Xiaomi

DeepSeek-V4-Pro — вне пиковой нагрузки

0,66 доллара

1,98 доллара

2,64 доллара

DeepSeek

LongCat-2.0 — стандарт

0,75 доллара

2,95 доллара

3,70 доллара

ЛонгКэт

MiMo-V2.5 Pro (≤256K)

1,00 долл.

3,00 доллара

4,00 доллара

Xiaomi

Период действия календаря Близнецов 3.7 Flash — до 31 декабря 2026 года

0,75 доллара

3,75 доллара

4,50 доллара

Google

Период действия календаря Gemini 3.8 Flash — до 31 декабря 2026 года

0,75 доллара

3,75 доллара

4,50 доллара

Google

DeepSeek-V4-Pro — часы пик

1,32 доллара

3,96 доллара

5,28 долларов

DeepSeek

Muse Spark 1.1 / 1.2 / 1.3

1,25 доллара

4,25 доллара

5,50 долларов

Мета

GLM-5.3

1,40 доллара

4,40 доллара

5,80 долларов

З.АИ

Grok 4.6 — <200K токенов подсказок

2,00 доллара

6,00 долларов

8,00 долларов

xAI

MiMo-V2.5 Pro (>256K)

2,00 доллара

6,00 долларов

8,00 долларов

Xiaomi

Qwen3.8-Max

2,00 доллара

6,00 долларов

8,00 долларов

QwenCloud

Вспышка Gemini 3.7 — начиная с 1 января 2027 года

1,50 доллара

7,50 долларов

9,00 долларов

Google

Вспышка Gemini 3.8 — начиная с 1 января 2027 года

1,50 доллара

7,50 долларов

9,00 долларов

Google

GPT-5.6 Terra

2,00 доллара

12,00 долларов

14,00 долларов

OpenAI

Grok 4.6 — ≥200 тыс. токенов подсказок

4,00 доллара

12,00 долларов

16,00 долларов

xAI

ГПТ-5.4

2,50 доллара

15,00 долларов

17,50 долларов

OpenAI

Кими К3

3,00 доллара

15,00 долларов

18,00 долларов

Moonshot AI

Клод Опус 5

5,00 долларов

25,00 долларов

30,00 долларов

Антропический

Sakana Fugu Ultra (≤272K)

5,00 долларов

30,00 долларов

35,00 долларов

Сакана ИИ

GPT-5.6 Sol — Стандартный режим

5,00 долларов

30,00 долларов

35,00 долларов

OpenAI

Клод Басня 5 / Клод Мифос 5

10,00 долларов

50,00 долларов

60,00 долларов

Антропический

Басня Клода 5.1 / Мифос Клода 5.1

10,00 долларов

50,00 долларов

60,00 долларов

Антропический

GPT-5.6 Sol — Быстрый режим

10,00 долларов

60,00 долларов

70,00 долларов США

OpenAI

Таким образом, высказывание Цукерберга о том, что токены «почти слишком дешевы для учета», относится не столько к снижению их стоимости, сколько к тому, чего, по мнению Meta, разработчики могут достичь с помощью этих токенов.

Анализ с помощью искусственного интеллекта предоставляет доказательства в поддержку этого аргумента, но также и создает осложнение. Он измеряет производительность Muse Spark 1.3 xhigh на уровне 235,2 выходных токенов в секунду и оценивает стоимость одной задачи по индексу интеллекта в 0,55 доллара.

При показателе 61 по индексу интеллекта это обеспечивает ей самую низкую стоимость выполнения задачи среди всех моделей, оцениваемых в настоящее время на этом уровне интеллекта.

Индекс интеллекта против стоимости проведения искусственного анализа. Индекс интеллекта (3 сентября - 26) - Искусственный анализ.

Стоимость одного задания по искусственному анализу в Muse Spark 1.2 составляла всего 0,40 доллара, а результат — 57 баллов.

Несмотря на неизменную цену за токен, стоимость выполнения средней задачи в независимом эталонном тесте, таким образом, увеличилась с каждым поколением. Компания Artificial Analysis объясняет это увеличение главным образом более интенсивным потреблением входных токенов при оценке работы агентов.

Это напрямую не противоречит заявлению Meta о снижении использования токенов на 25%: Meta описывает сравнения в своих собственных рабочих процессах кодирования, в то время как Artificial Analysis измеряет более широкий набор задач, связанных с рассуждениями и действиями агентов.

Но это наглядно демонстрирует, почему понятие «дешево» становится расплывчатым, когда модели начинают действовать как агенты. Стоимость токенов, усилия, затрачиваемые на рассуждения, количество ходов, вызовы инструментов и повторные попытки — все это влияет на фактическую стоимость завершения работы.

Meta также сохраняет свой необычно дешевый уровень для участников — 0,10 доллара за миллион входных токенов и 0,20 доллара за миллион выходных токенов — в обмен на разрешение использовать подсказки и автодополнение для обучения.

Как отметило издание VentureBeat в отношении Muse Spark 1.2, это может быть привлекательно для прототипирования, но создает существенно иные требования к управлению данными для предприятий, работающих с собственным кодом или конфиденциальной внутренней информацией.

В своей статье «Близнецы кто?» Ван приводит к необычайно близкому сравнению.

Александр Ван, главный специалист по искусственному интеллекту компании Meta, был значительно менее компетентен в вопросе празднования этого события.

После того, как компания Artificial Analysis опубликовала результаты своего проекта Muse Spark, Ван перепостил их на X, добавив: «Мне очень не хочется это говорить, но… кто такие Близнецы? 😱💨»

Особенно резкое замечание прозвучало из-за того, что в тот же день Google выпустила Gemini 3.8 Flash, позиционируя её практически для той же категории задач: разработка программного обеспечения с длительным горизонтом планирования, автономные агенты и многоэтапное профессиональное логическое мышление. Google называет 3.8 своей лучшей на сегодняшний день моделью Flash для логического мышления и кодирования и заявляет, что это третий релиз Flash от компании за шесть недель.

Независимые статистические данные дают Вангу некоторое представление о ситуации, хотя и не являются решающим аргументом.

Анализ искусственного интеллекта присваивает Muse Spark 1.3 xhigh индекс интеллекта 61 при стоимости 0,55 доллара за задачу, по сравнению с 59 и 0,58 доллара для Gemini 3.8 Flash при высоком уровне сложности. Таким образом, Meta превосходит Google как по интеллекту, так и по стоимости задачи при данных параметрах.

Google уверенно лидирует по пропускной способности. По данным Artificial Analysis, Gemini 3.8 Flash выдает около 305 токенов в секунду против 235 у Muse Spark — примерно на 30% быстрее. Gemini также предлагает более низкую цену за использование API на данный момент: Google взимает вводную плату в размере 0,75 доллара за миллион входных токенов и 3,75 доллара за миллион выходных токенов, по сравнению с 1,25 и 4,25 долларами у Meta.

Срок действия этой акционной цены Google истекает 31 декабря, после чего она повысится до 1,50 доллара за миллион входных токенов и 7,50 доллара за миллион выходных токенов.

В результате получается полезный снимок того, насколько жесткой стала экономика, основанная на модели граничных технологий. В настоящее время Meta выигрывает в этом независимом сравнении с преимуществом в два пункта Индекса интеллекта и три цента за задачу бенчмарка; Google предлагает значительно более высокую производительность и более дешевые токены в рамках своей рекламной кампании при запуске.

«Близнецы кто?» — это забавная фраза руководителя, отпускающего колкости. Для корпоративного архитектора ответ ближе к следующему: Gemini — более быстрый вариант; Muse в настоящее время является немного более эффективным инструментом с точки зрения трудозатрат по этому независимому показателю.

Эволюция подхода Меты к работе с открытыми весами

Для некоторых разработчиков более важный вопрос может иметь мало общего с сегодняшней гонкой бенчмарков.

Когда в августе Meta запустила Muse Code и Muse Spark 1.2, VentureBeat отметила, насколько кардинально компания отошла от стратегии открытого веса, которая сделала Llama повсеместно распространенной.

Muse Code и Spark 1.2 были проприетарными продуктами, предоставляющими доступ через API — это был неожиданный шаг для компании, которая годами утверждала, что открытый ИИ — это путь в будущее.

Пять дней спустя Мета снова изменила курс.

10 августа компания выпустила Muse Glimmer с 30 миллиардами параметров под лицензией Apache 2.0. Цукерберг также заявил: «В ближайшие недели мы также откроем доступ к весам для Muse Spark 1.2». Агентство Reuters отдельно сообщило о планах Meta выпустить веса для Spark 1.2.

Теперь же компания Meta выпустила Muse Spark 1.3 как ещё одну собственную разработку.

Это пока не является нарушением обещания — под «ближайшими неделями» вполне можно понимать период, превышающий три недели. Но сегодняшнее объявление делает план действий менее ясным, а не более ясным.

В новом сообщении Meta больше не говорится о Muse Spark 1.2. Там указано, что в планах компании — «выпуск Muse Spark с открытыми весами», без указания версии, даты выпуска, размера модели или лицензии. Цукерберг также заявил на X, что «выпуск Muse Spark с открытыми весами» скоро состоится.

Для команд, которые выбрали Llama в качестве стандарта, потому что возможность загрузки весовых коэффициентов означала самостоятельное размещение, настройку и контроль над экономикой вывода, эта неопределенность может иметь большее значение, чем то, получил ли Spark еще один балл в сводном бенчмарке.

Muse Spark 1.3 демонстрирует, что Meta теперь может с невероятной скоростью итерировать собственные передовые модели. Конфигурация xhigh, поставляемая в продажу, быстрая, конкурентоспособная по цене и гораздо ближе к вершине независимых рейтингов, чем её предшественники. Предварительный просмотр максимальной конфигурации показывает, что Meta может немного расширить возможности семейства, если ей будет предоставлено больше вычислительных ресурсов для логических вычислений.

Следующая проверка будет иной: сможет ли Meta преобразовать этот темп в дорожную карту, на основе которой предприятия смогут реально планировать свою деятельность, включая обеспечение широкой доступности своих лучших возможностей и внедрение открытой модели Spark, о которой уже говорилось.

Опрос по корпоративной агентской оркестрации

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Телевизоры LG могут следить за тем, что происходит у вас… Архив рубрики ~Коротко из Telegram~ Крошечная open‑source‑модель MiniCPM5-2B обошла конкурентов до 4B параметров ⚡ Канал… Архив рубрики ~Коротко из Telegram~ Бесплатная обработка голоса в аудио Если записываешь голос на встроенный… Архив рубрики ~Коротко из Telegram~ Дата-центр Stargate в Абилине назвали «местом рождения AGI» Глава Crusoe… Архив рубрики ~Коротко из Telegram~ Небольшой дайджест — коротко о найденных новостях 1️⃣ Российский облачный… Архив рубрики ~Коротко из Telegram~ Офлайн-ИИ на вашем телефоне В новых айфонах и топовых Android-флагманах… Архив рубрики ~Коротко из Telegram~ Почему видео от нейросети выглядит «мёртво» — и как это… Архив рубрики ~Коротко из Telegram~ #слухи Apple корректирует планы по выпуску новых моделей MacBook с… Архив рубрики ~Коротко из Telegram~ Инструмент полезен настолько, насколько вы знаете что он умеет. Разбираем… Новости робототехники MassRobotics рассматривает опрос участников по ограничениям FCC Архив рубрики ~Коротко из Telegram~ Microsoft Office на стероидах — вышла бесплатная тулза GenOffice, которая… Новости робототехники Этот робот НАДЕРЁТ ЗАД любому — китайская Unitree показала первого… Архив рубрики ~Коротко из Telegram~ Проверяем ПК на СКРЫТЫЕ МАЙНЕРЫ — в сети выкатили… Архив рубрики ~Коротко из Telegram~ Runway показала GWM Worlds 2 — генеративное видео превращается в… Архив рубрики ~Коротко из Telegram~ Телевизоры LG могут следить за тем, что происходит у вас… Архив рубрики ~Коротко из Telegram~ Крошечная open‑source‑модель MiniCPM5-2B обошла конкурентов до 4B параметров ⚡ Канал… Архив рубрики ~Коротко из Telegram~ Бесплатная обработка голоса в аудио Если записываешь голос на встроенный… Архив рубрики ~Коротко из Telegram~ Дата-центр Stargate в Абилине назвали «местом рождения AGI» Глава Crusoe… Архив рубрики ~Коротко из Telegram~ Небольшой дайджест — коротко о найденных новостях 1️⃣ Российский облачный… Архив рубрики ~Коротко из Telegram~ Офлайн-ИИ на вашем телефоне В новых айфонах и топовых Android-флагманах… Архив рубрики ~Коротко из Telegram~ Почему видео от нейросети выглядит «мёртво» — и как это… Архив рубрики ~Коротко из Telegram~ #слухи Apple корректирует планы по выпуску новых моделей MacBook с… Архив рубрики ~Коротко из Telegram~ Инструмент полезен настолько, насколько вы знаете что он умеет. Разбираем… Новости робототехники MassRobotics рассматривает опрос участников по ограничениям FCC Архив рубрики ~Коротко из Telegram~ Microsoft Office на стероидах — вышла бесплатная тулза GenOffice, которая… Новости робототехники Этот робот НАДЕРЁТ ЗАД любому — китайская Unitree показала первого… Архив рубрики ~Коротко из Telegram~ Проверяем ПК на СКРЫТЫЕ МАЙНЕРЫ — в сети выкатили… Архив рубрики ~Коротко из Telegram~ Runway показала GWM Worlds 2 — генеративное видео превращается в…

Оставить комментарий