Meta устанавливает цену на Muse Voice Transcribe в размере 0,18 доллара в час, с возможностью записи разговоров в реальном времени для более чем 20 говорящих: выгодное предложение для крупных предприятий?
Карл Франзен
Компания Meta выходит на все более конкурентный рынок преобразования речи в текст в реальном времени с помощью Muse Voice Transcribe, новой модели восприятия звука, которая объединяет потоковую транскрипцию, определение конечных точек и диаризацию говорящих для более чем 20 дикторов — по цене общедоступного API всего 0,18 доллара за час обработанного аудио.
Разработанная компанией Meta Superintelligence Labs, модель Muse предназначена для обработки речи в процессе её воспроизведения, а не в ожидании завершения записи. В сообщении Meta о запуске Muse Voice Transcribe говорится, что модель поддерживает длинные аудиозаписи, превышающие час, обеспечивает плавное переключение кодов между языками, учет языковых и ключевых слов, а также диаризацию без отдельного конвейера постобработки. Модель была обучена на более чем 70 языках, 25 из которых прошли всестороннюю проверку перед первоначальным релизом.
Цифра в 20+ говорящих — это внушительно, но это не мировой рекорд. Изучение текущей документации поставщиков показывает, что у систем с более высокими заявленными показателями есть идентификационные возможности. Сервис транскрипции в реальном времени от Speechmatics заявляет, что по умолчанию может идентифицировать 50 говорящих, а при увеличении лимита — до 100, в то время как в документации Amazon Transcribe по диаризации указано максимум 30 уникальных говорящих, в том числе и для потоковой транскрипции. (Speechmatics)
Тем не менее, Muse занимает место в верхнем сегменте рынка, и, пожалуй, более важным является более широкий потенциал Meta, чем просто максимальный уровень: высокопроизводительная диаризация в реальном времени в сочетании с транскрипцией с низкой задержкой, конечными точками, многоязычным переключением кодов и агрессивной ценовой политикой API в рамках одной модели.
Для корпоративных разработчиков, создающих системы для проведения совещаний, анализа звонков, голосовых помощников или искусственного интеллекта, такое сочетание может иметь большее значение, чем то, кто является рекордсменом по количеству выступающих.
Диаризация становится неотъемлемой частью основного стека голосовых технологий.
Традиционное распознавание речи отвечает на относительно простой вопрос: что было сказано? Диаризация добавляет еще один: кто это сказал?
Это различие становится критически важным, поскольку стенограммы передаются в последующие системы искусственного интеллекта. Ассистент на совещании может правильно расшифровать каждое предложение, но при этом создать недостоверную корпоративную запись, если припишет одобрение, обязательство или возражение не тому участнику. Та же проблема затрагивает аналитику обслуживания клиентов, рабочие процессы соблюдения нормативных требований и агентов ИИ, работающих в помещениях, где могут говорить несколько человек.
Muse напрямую интегрирует атрибуцию говорящего в свою авторегрессивную многомодальную архитектуру. Meta утверждает, что аудио поступает фрагментами по 80 миллисекунд, или 12,5 фрагментов в секунду, каждый из которых преобразуется в программный токен. На каждом шаге модель решает, обрабатывать ли больше аудио или выдавать текст. Meta называет этот механизм адаптивной задержкой: вместо применения одного бюджета задержки к каждому слову, Muse может ждать дольше, когда речь неоднозначна, и принимать решение раньше, когда у нее достаточно контекста. Meta утверждает, что обучение с подкреплением сочетает в себе вознаграждение за частоту ошибок в словах и задержку для обучения такому поведению. Техническое описание Muse от Meta подробно описывает архитектуру. (Meta AI Research)
Идентификация говорящего и определение конечной точки становятся частью одной и той же последовательности токенов. Токен <|start_of_turn|> отмечает потенциальную новую реплику говорящего, токены, такие как <|speaker_A|>, идентифицируют говорящего, а отдельные токены начала и конца реплики определяют границы речи. Meta утверждает, что обучает ASR, диаризацию и определение конечной точки вместе, а не выполняет кластеризацию говорящих как несвязанный последующий процесс.
В документации Meta по преобразованию речи в текст также описывается диаризация как полноценный режим работы наряду с функцией «нажми и говори» и определением конечной точки. Метки говорящих, такие как A и B, привязаны к сессии, а не к подтвержденным идентификаторам, и API предоставляет временные метки на уровне реплик, а не на уровне слов.
Более 20 выступающих — это много, но Speechmatics позволяет достичь гораздо большего.
Сравнивать количество выступающих следует с осторожностью, поскольку поставщики реализуют диаризацию по-разному и не все публикуют максимальное количество.
В настоящее время Speechmatics делает наиболее убедительное заявление о поддержке работы в режиме реального времени, которое мы встречали в этом обзоре. В документации по STT в режиме реального времени указано, что диаризация говорящих доступна в режиме реального времени, а в разделе часто задаваемых вопросов говорится, что система по умолчанию поддерживает 50 говорящих и может быть увеличена до 100.
Аналогичным образом, AWS превосходит заявленную Meta цифру: Amazon Transcribe может различать максимум 30 уникальных говорящих, а AWS предоставляет подробные инструкции по разделению говорящих в потоковой транскрипции.
Soniox поддерживает диаризацию как в режиме реального времени, так и в асинхронном режиме, но регистрирует максимум 15 говорящих за сессию. Система потоковой диаризации AssemblyAI позволяет разработчикам устанавливать значение max_speakers от одного до десяти. Обе компании предупреждают, что определение говорящих в реальном времени сложнее, поскольку потоковые системы должны принимать решения, имея меньше контекста будущего звука, чем офлайн-модели.
Текущий API преобразования речи в текст от xAI также поддерживает диаризацию говорящих в потоковом режиме, но в документации, рассмотренной для этой статьи, не указано максимальное количество диаризованных говорящих, поэтому прямое сравнение с Muse невозможно. (Документация X.ai)
Это означает, что было бы неверно называть возможности Muse по поддержке более 20 динамиков новым мировым рекордом. Самое высокое явно задокументированное число динамиков в реальном времени, выявленное в этом исследовании, — это настраиваемый потолок в 100 динамиков в Speechmatics.
Компания Meta также не демонстрирует одновременное участие более 20 человек в своих рекламных материалах. В основной демонстрации в режиме реального времени используются восемь докладчиков, а в полной записи участвуют 11 человек, чьи имена указаны в списке. Число «более 20» — это заявленная возможность модели, а не количество участников в публичных демонстрациях.
При почасовой оплате в размере 0,18 доллара компания Muse ведет агрессивную ценовую конкуренцию.
Ценовая политика Meta делает конкурентную картину более интересной.
Согласно странице разработчика Muse Voice Transcribe, стоимость Muse составляет 3 доллара за 1000 минут или 0,18 доллара в час. Стоимость транскрипции потокового и непотокового аудио одинакова, а Meta утверждает, что обработка без сохранения данных стоит столько же, сколько и стандартная обработка. Оплата производится за фактически обработанный аудиоматериал и округляется до целых секунд.
При стандартизации общедоступных тарифов на один час потокового аудио получается следующее приблизительное сравнение:
|
Сервис потокового преобразования речи в текст |
Примерная стоимость часа работы для населения. |
Диаризация в реальном времени |
|
Soniox stt-rt-v5 |
0,12 доллара |
В комплекте: до 15 динамиков |
|
Meta Muse Voice Transcribe |
0,18 доллара |
В комплекте: более 20 колонок |
|
xAI Преобразование речи в текст |
0,20 доллара |
Поддерживается; максимальное значение не указано. |
|
Стандарт речевой математики в реальном времени |
0,24 доллара |
Включено; по умолчанию 50, можно настроить на 100. |
|
Qwen3 ASR Flash Realtime |
~0,324 доллара международный |
В проанализированных источниках не зафиксировано сопоставимых максимальных значений. |
|
Deepgram Nova-3 Multilingual |
Примерно 0,35 долл. США базовая цена / примерно 0,47 долл. США с диаризацией |
Дополнительная плата за диализ — 0,12 доллара в час. |
|
ElevenLabs Scribe v2 Realtime |
0,39 доллара США в день |
Не поддерживается в режиме реального времени |
|
AssemblyAI Universal-3.5 Pro Realtime |
Базовая ставка 0,45 долл. / 0,57 долл. с учетом диализирования |
Дополнительная плата 0,12 доллара в час; до 10 докладчиков. |
|
Gemini 3.5 Transcribe Live |
~$0,54 смешанный |
|
|
Amazon Transcribe Streaming |
Пример потоковой передачи данных от AWS в Северной Вирджинии: примерно 0,60 доллара. |
В комплекте: до 30 динамиков. |
|
OpenAI GPT Live Transcribe |
1,02 доллара |
Функция диалога не указана в списке возможностей модели. |
Сравнение, естественно, неточное. Цена Qwen варьируется в зависимости от региона развертывания; ее международная ставка в режиме реального времени в размере 0,00009 доллара США в секунду составляет примерно 0,324 доллара США в час. Показатель Gemini от Google — это оценочная стоимость смешанных токенов, а не фиксированный почасовой тариф. Цены AWS варьируются в зависимости от региона и уровня использования. ElevenLabs указывает 0,39 доллара США в час на своей странице с ценами на API, но рекламирует 0,28 доллара США в час или ниже для годовых бизнес-планов.
Ценовая политика Deepgram особенно наглядно демонстрирует важность сравнения по уровню функциональности: текущая стоимость потоковой передачи Nova-3 Multilingual составляет около 0,35 доллара в час, но диаризация речи обходится еще в 0,002 доллара в минуту, что в сумме составляет примерно 0,47 доллара в час. AssemblyAI также указывает цену в 0,45 доллара в час за Universal-3.5 Pro Realtime и еще 0,12 доллара в час за потоковую диаризацию.
Cartesia сложнее стандартизировать, потому что Ink-2 предоставляется в виде ежемесячных кредитных планов, а не простой почасовой оплаты по факту использования. План Pro за 5 долларов включает примерно девять часов и 16 минут транскрипции в Ink-2, что составляет около 0,54 доллара за час транскрипции, если все кредиты расходуются исключительно на STT. Это не следует рассматривать как эквивалент отдельного почасового тарифа API в размере 0,54 доллара.
Даже с учетом этих оговорок, позиция Muse ясна. Это не самый дешевый сервис потоковой транскрипции — Soniox в настоящее время предлагает более низкую аналогичную цену — но 0,18 доллара в час с включенным диаризацией ставит Meta в нижний сегмент рынка, особенно по сравнению с поставщиками, которые взимают отдельную плату за указание говорящего.
При обработке 1000 часов аудиоматериалов, указанная в публичном тарифе Meta стоимость транскрипции составляет примерно 180 долларов.
Компания Meta также лидирует в своих показателях точности запуска.
Цена имеет меньшее значение, если она сопровождается значительным снижением точности. Однако, согласно результатам сравнительных тестов Meta, ситуация прямо противоположная.
Согласно индексу AA-WER Streaming Index, предоставленному при запуске, Muse показывает 3,1% ошибок в окончательной транскрипции, опережая Cartesia Ink-2 (3,4%), ElevenLabs Scribe v2 Realtime (3,6%), Qwen3 ASR Flash Realtime (3,7%), GPT Live Transcribe и Grok Speech to Text Streaming (3,9%), а также Gemini 3.5 Transcribe Live и AssemblyAI U3.5 Realtime Pro (4,0%).
Компания Meta отмечает, что по состоянию на 1 сентября Muse заняла первое место в рейтинге потокового преобразования речи в текст, составленном независимой компанией Artificial Analysis. В своем сообщении о запуске Meta опубликовала следующие диаграммы результатов тестирования.

Результаты диаризации могут иметь еще большее значение для позиционирования продукта. По данным Meta, средний уровень ошибок диаризации в системах AMI-IHM, AMI-SDM и VoxConverse составляет 17,5%, что ниже, чем у конкурирующих систем, показанных на диаграмме.

Не следует путать пропускную способность для говорящих и частоту ошибок диаризации. Платформа, способная представлять 100 человек, не обязательно лучше справляется с правильным определением речи, чем платформа, поддерживающая 20 человек, и бенчмарк Meta не тестирует каждого конкурента, работающего с заявленным максимальным количеством говорящих.
Существуют также компромиссы при развертывании. API Meta в настоящее время предоставляет временные метки на уровне реплик, но не на уровне слов, и не отображает оценки достоверности на уровне слов, обнаружение звуковых событий или распознавание эмоций. В документации также указано, что по умолчанию на одного клиента приходится восемь одновременных потоков, а время сеансов в реальном времени составляет до 60 минут, после чего приложению потребуется переподключиться.
Тем не менее, запуск Muse создает необычайно выгодное соотношение цены и качества. Возможность обработки более 20 реплик не устанавливает мировой рекорд, но этот рекорд, возможно, менее важен. Для корпоративных разработчиков более важный вопрос заключается в том, сможет ли сервис сохранить атрибуцию говорящего, точный текст и удобные границы реплик во время сложного реального разговора.
При цене 0,18 доллара в час и возможности диаризации речи более чем 20 говорящих в рамках той же модели реального времени, которая в настоящее время лидирует в рейтингах точности потоковой передачи данных, предоставляемых Meta, Muse Voice Transcribe предоставляет корпоративным командам серьезный новый вариант для анализа совещаний, транскрипции в реальном времени и инфраструктуры голосовых агентов — одновременно оказывая дополнительное давление на конкурентов, заставляя их конкурировать по точности распознавания говорящего и общей стоимости эксплуатации, а не только по распознаванию необработанной речи.

Источник: venturebeat.com
Похожие записи
Оцените материал:
Похожие записи
Мозговой оркестр… Играющий в разных несинхронизированных темпах
08.09.2026
Пузырь генеративного ИИ: почему крах неизбежен и чем это грозит экономике
08.09.2026
ИИ не может стать разумным, пока не сможет использовать ошибку как источник новых знаний
08.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
