Архив рубрики ~Лента новостей~

Разработанная Microsoft AI система MAI-Transcribe-2 превосходит OpenAI, Google и ElevenLabs по цене и скорости.

Разработанная Microsoft AI система MAI-Transcribe-2 превосходит OpenAI, Google и ElevenLabs по цене и скорости.
Разработанная Microsoft AI система MAI-Transcribe-2 превосходит OpenAI, Google и ElevenLabs по цене и скорости.

Майкл Нуньес

В четверг компания Microsoft AI выпустила MAI-Transcribe-2, модель распознавания речи, которая, по утверждению компании, быстрее, точнее и дешевле, чем любые аналогичные решения от OpenAI, Google или ElevenLabs. Цена модели составила 10 центов за час аудиозаписи.

Эта цифра заслуживает внимания. Когда Microsoft AI выпустила первую модель в этой линейке всего пять месяцев назад, она взимала 0,36 доллара в час. Цена для ранних заказов в четверг снижает эту сумму примерно на 72%. Для предприятия, обрабатывающего 100 000 часов аудиоконтента колл-центра в год — скромный объем для крупного банка или телекоммуникационной компании — счет снижается с 36 000 до 10 000 долларов. На таком уровне транскрипция перестает быть предметом споров.

Этот релиз выходит в тот момент, когда Microsoft реализует стратегию, которая еще два года назад казалась бы неправдоподобной: создание собственных передовых моделей по одной технологии за раз, а затем постепенное внедрение их в продукты, ранее работавшие на технологии OpenAI. Транскрипция — это технология, в которой этот план продвигается быстрее всего, и MAI-Transcribe-2 является самым ярким тому подтверждением. Он также дает представление о том, как самая дорогая в мире компания-разработчик программного обеспечения намерена конкурировать в области ИИ, не завися от партнера, на привлечение которого она потратила 13 миллиардов долларов.

Что делает MAI-Transcribe-2 и почему этот набор функций важен для корпоративных покупателей.

Модель расшифровывает аудио на 60 языках, по сравнению с 43 языками в июньской версии MAI-Transcribe-1.5 и 25 языками в апрельском первоначальном релизе. Она работает на Microsoft Foundry, торговой площадке моделей компании для разработчиков, и в MAI Playground, среде тестирования. Microsoft заявляет, что создала модель для работы с некачественным аудио, которое генерируют реальные предприятия — фоновый шум, низкое качество записей, наложение речи — а не в чистых студийных условиях.

Более важным, чем количество языков, является то, что Microsoft включила в базовый продукт. Функция распознавания говорящих позволяет определить, кто что сказал в многосторонней записи, что является разницей между сплошным текстом и пригодной для использования стенограммой совещания. Временные метки на уровне слов присваивают каждому слову точный временной маркер, что позволяет осуществлять поиск, редактирование и синхронизацию с видео. Функция смещения ключевых слов позволяет разработчикам передавать модели список названий лекарств, кодов продуктов или имен сотрудников, чтобы она не искажала профессиональный жаргон. Автоматическое определение языка означает, что пользователям больше не нужно указывать язык заранее.

Две функции особенно выделяются своей спецификой. Настраиваемый стиль вывода предлагает режим «дословного воспроизведения», который сохраняет все «э-э», ложные начала и запинки для отделов соответствия требованиям и юридических отделов, а также режим «чистого вывода», который удаляет слова-паразиты, обеспечивая читаемые подписи и примечания. А переключение кодов обрабатывает разговоры, в которых языки перескакивают между предложениями; Microsoft прямо указывает на хинглиш и спанглиш, отсылая к индийскому и испаноязычному рынкам США, где за один звонок в службу поддержки клиентов языки могут переключаться десятки раз. Специализированные поставщики исторически взимали дополнительную плату за каждую из этих возможностей. Microsoft же включает все это за 10 центов.

Как интерпретировать заявления Microsoft о результатах бенчмарков FLEURS и Artificial Analysis

Microsoft выдвигает три заявления о производительности, каждое из которых основано на разных критериях оценки, и техническим покупателям следует понимать, что отражает каждое из них, а что нет.

Во-первых, MAI-Transcribe-2 занимает первое место в рейтинге FLEURS по 60 языкам со средним показателем ошибок распознавания слов 5,2%. FLEURS — это эталонный тест, опубликованный исследователями Google в 2022 году, созданный на основе чтения носителями языка примерно 2000 предложений на каждом из 102 языков — около 12 часов речи на каждый язык. Это стандартный критерий для многоязычного распознавания речи, поскольку он позволяет сравнивать суахили, произнесенное моделью, с ее шведским вариантом на идентичном контенте. Показатель ошибок распознавания слов, его метрика, просто подсчитывает замены, вставки и удаления по сравнению с эталонным словом, произнесенным человеком; 5,2% означает, что примерно одно слово из 20 неверно. Но FLEURS — это прочитанная речь, а не разговор, и средний показатель Microsoft фактически вырос с 3,7%, о которых компания сообщила для MAI-Transcribe-1.5 в июне. Это почти наверняка отражает более широкий охват, а не регресс — усреднение по 60 языкам вместо 43 означает включение языков с ограниченными ресурсами, где каждая модель испытывает трудности, — но покупателям следует запросить разбивку по каждому языку.

Второе утверждение заключается в том, что модель занимает второе место в рейтинге Artificial Analysis по показателю частоты ошибок распознавания слов и определяет границу Парето точности и задержки этой компании. Artificial Analysis — независимый бенчмаркер, который тестирует модели через их общедоступные API, измеряя то, что фактически получает клиент. Его индекс объединяет смоделированные разговоры агентов, выступления в Европейском парламенте и звонки о доходах компаний, уделяя большое внимание деловой речи на английском языке. В июне компания поставила MAI-Transcribe-1.5 на третье место с показателем WER 2,4%, уступив Fun-Realtime-ASR-preview от Alibaba и Scribe v2 от ElevenLabs, назвав её самой быстрой моделью в топ-10. Подъем на второе место говорит о том, что Microsoft обогнала ElevenLabs. «Граница Парето» — это фраза, которую следует отметить специалистам: она означает, что ни один конкурент не превосходит модель по точности, не будучи медленнее, и ни один не превосходит её по скорости, не будучи менее точным.

Третье утверждение касается скорости — в 10 раз быстрее, чем GPT-Transcribe от OpenAI, в 7 раз быстрее, чем Scribe v2 от ElevenLabs, и в 5 раз быстрее, чем Gemini 3.5 Transcribe от Google, согласно оценкам Artificial Analysis. В пакетной транскрипции скорость имеет меньшее значение, поскольку все ждут, и большее значение имеет пропускная способность, то есть стоимость. Модель, работающая в 300 раз быстрее реального времени, требует лишь доли часа работы графического процессора по сравнению с моделью, работающей в 30 раз быстрее. Именно эта эффективность позволяет Microsoft брать за свои услуги десять центов и, предположительно, при этом зарабатывать деньги.

Три модели речи за пять месяцев: особенности быстрого темпа выпуска новых продуктов Microsoft AI

Темп — это история внутри истории. 2 апреля был запущен MAI-Transcribe-1 с поддержкой 25 языков по цене 0,36 доллара в час. 2 июня вышла версия MAI-Transcribe-1.5 с поддержкой 43 языков, смещением ключевых слов и третьим местом в рейтинге Artificial Analysis. Сегодня вышла версия MAI-Transcribe-2 с поддержкой 60 языков, диаризацией, временными метками, переключением кодов, вторым местом в рейтинге и ценой 0,10 доллара.

Три релиза за пять месяцев, каждый из которых расширяет языковой охват примерно на 40%, добавляя функции, доступные конкурентам только в рамках премиум-тарифов. Такая динамика характерна для команды, которая разработала стабильную архитектуру и теперь сосредоточилась на данных и масштабировании — этапе, когда модели речи, как правило, быстро и предсказуемо улучшаются. Это также динамика компании, которая намерена сделать транскрипцию общедоступной услугой раньше всех остальных.

Организационная стратегия, лежащая в основе такой скорости, была описана Мустафой Сулейманом, генеральным директором Microsoft AI, в интервью The Verge в апреле. Он объяснил успех первой модели работой «небольшой, сплоченной команды из 10 человек», которая была «освобождена от любой бюрократии», а более крупная группа занималась управлением поставщиками и сбором данных.

Он также рассказал изданию The Verge, что модель работала «вдвое дешевле, чем другие передовые модели с использованием графического процессора», назвав это «огромной экономией средств» для Microsoft. Как отметило издание The Verge, Meta, Amazon, Google и Anthropic также экспериментировали с аналогичными упрощенными структурами. Линия транскрипции Microsoft — это наиболее наглядное на сегодняшний день испытание того, приносит ли этот подход коммерческие результаты, а не просто научные статьи.

Почему Microsoft продолжает создавать собственные модели ИИ, несмотря на инвестиции в OpenAI в размере 13 миллиардов долларов?

Microsoft инвестировала более 13 миллиардов долларов в OpenAI и размещает модели OpenAI в Azure, Office и Copilot. На протяжении большей части последних четырех лет очевидным вопросом о любой модели, созданной Microsoft, был: зачем это нужно? Ответ стал более ясным за последний год, и он начинается с независимости.

Когда в марте 2024 года Microsoft наняла Сулеймана из Inflection AI, а также большую часть сотрудников Inflection, генеральный директор Salesforce Марк Бениофф воспринял это как заявление о намерениях. «Microsoft создает собственный ИИ, и я не думаю, что Microsoft будет использовать OpenAI в будущем. У них будут свои собственные передовые модели», — сказал Бениофф CNBC в январе 2025 года. «Вот почему они наняли Мустафу Сулеймана». У Бениоффа были свои мотивы — Salesforce конкурирует с Microsoft и инвестирует в Anthropic, — но события в значительной степени подтвердили его слова.

В октябре 2025 года Microsoft и OpenAI реструктурировали свое партнерство в рамках сделки, которая, согласно собственному заявлению Microsoft, впервые позволила Microsoft «самостоятельно разрабатывать искусственный общий интеллект (AGI) самостоятельно или в партнерстве с третьими сторонами». Сулейман заявил изданию The Verge, что пересмотр условий «открыл [Microsoft] возможность заниматься суперинтеллектом», и несколько недель спустя Microsoft объявила о создании своей команды MAI Superintelligence. В апреле 2026 года компании снова внесли поправки в соглашение, прекратив эксклюзивный доступ Microsoft к моделям OpenAI и отменив выплаты Microsoft в рамках распределения доходов, согласно сообщениям того времени. Каждая поправка ослабляла связь. За каждой последующей поправкой следовали новые модели MAI.

Как внутренние модели Microsoft позволяют сократить расходы в Teams, Word и Excel

Вторая часть ответа — это маржа. Каждый запрос, который Microsoft направляет модели OpenAI, имеет свою стоимость. Каждый запрос, который она направляет своей собственной модели на своих собственных графических процессорах, имеет меньшую стоимость. В июле Bloomberg сообщил, что Microsoft начала использовать модели MAI для ответа на часть запросов пользователей в Word и Excel — продуктах, которые ранее рекламировались как работающие на базе OpenAI и Anthropic. TechCrunch представил этот сдвиг как часть более широкого сокращения расходов на ИИ в отрасли, при этом сообщается, что Amazon, Uber, Meta и Accenture сократили свои инвестиции.

Транскрипция — естественная первая цель для этой замены, поскольку проблема ограничена, а метрика объективна. Microsoft владеет Teams, который генерирует огромный объем аудиоконтента для совещаний. Она владеет Nuance, чей бизнес по созданию клинической документации основан на распознавании речи. Она владеет сервисами распознавания речи Azure, которые уже используют тысячи предприятий. Каждая из этих рабочих нагрузок является кандидатом на перенос на MAI-Transcribe-2, и каждый час, который будет перенесен, — это час, за который Microsoft больше никому не платит.

Сулейман был необычайно откровенен в том, что именно в этом и заключается суть. Сверхинтеллект, как он заявил изданию The Verge в апреле, «на самом деле сводится к вопросу: „Способны ли эти модели приносить пользу миллионам предприятий, которые зависят от нас в предоставлении языковых моделей мирового класса?“» Что бы ни думали о применении слова «сверхинтеллект» к API транскрипции, коммерческая логика очевидна: создать эту возможность один раз, развернуть ее в десятке продуктов и перестать выписывать чеки партнеру, который все больше становится конкурентом.

MAI-Transcribe-2 против OpenAI, Google и ElevenLabs: конкурентная картина.

В пресс-релизе Microsoft названы четыре конкурента: GPT-Transcribe от OpenAI, Gemini 3.5 Transcribe от Google, более старая версия Whisper V3-Large от OpenAI и Scribe v2 от ElevenLabs. В нём не упоминаются Deepgram, AssemblyAI, Speechmatics или Rev — специалисты, которые уже десять лет продают услуги транскрипции предприятиям. Microsoft позиционирует себя против передовых лабораторий, а не против действующих игроков рынка.

Такая формулировка отчасти маркетинговая, отчасти правдивая. Передовые лаборатории рассматривают обработку речи как дополнительную функцию более широких платформ, соответственно, устанавливая соответствующую цену, и специализированная модель, превосходящая их по скорости в 5-10 раз и при этом сопоставимая с ними по точности, является настоящим конкурентным преимуществом. Но наиболее остро ценовое давление почувствуют специалисты. При цене 0,10 доллара в час Microsoft устанавливает цену на уровне или ниже, чем многие из них продают крупные корпоративные контракты, и включает в базовую ставку функции диаризации, временные метки и поддержку 60 языков. Оставшееся конкурентное преимущество специалистов — это глубина предметной области — медицинская лексика, юридическое форматирование, интеграция со специфическими отраслями — и функция смещения ключевых слов от Microsoft направлена именно на это.

Единственный конкурент, которого Microsoft явно не превзошла по точности, — это Alibaba, чьи модели демонстрировали лидирующие результаты в независимых рейтингах на протяжении большей части 2026 года. В июле TechCrunch сообщила, что некоторые американские компании начали оценивать китайские модели как более дешевую альтернативу, несмотря на опасения по поводу безопасности. Предложение Microsoft этим покупателям неявно, но недвусмысленно: сопоставимая точность, более быстрая обработка данных, более низкая цена и поставщик, которому ваша команда по соблюдению нормативных требований уже доверяет.

Вопросы, которые должны задать себе специалисты, принимающие технические решения, прежде чем менять поставщика услуг транскрипции.

Несмотря на всю конкретику в отношении бенчмарков, в релизе остаются открытыми несколько практических вопросов. Первый — это продолжительность: Microsoft называет 0,10 доллара в час стартовым предложением, не указывая дату окончания или стандартную ставку, а любой, кто строит модель затрат, должен получить и то, и другое в письменном виде. Второй — это потоковая передача. В релизе акцент делается на пакетной обработке и длинных аудиофайлах, но ничего не говорится о транскрипции в реальном времени, которая необходима голосовым агентам и субтитрам в реальном времени. Artificial Analysis ведет отдельный рейтинг потоковой передачи, и молчание Microsoft по этому поводу заслуживает внимания.

Третий показатель — точность по каждому языку. Средний показатель в 5,2% по 60 языкам может означать 3% для основных языков и 12% для языков с ограниченными ресурсами, поэтому покупателям со специфическими потребностями следует тестировать эти языки напрямую. Четвертый показатель — качество диаризации. Показатель частоты ошибок в словах не измеряет правильность указания говорящего; транскрипт может иметь почти идеальный показатель частоты ошибок в словах, но при этом каждое второе предложение может быть отнесено к неправильному говорящему. В пресс-релизе не указан показатель частоты ошибок диаризации или сопоставимый показатель.

Пятый аспект — обработка данных. Корпоративная транскрипция затрагивает медицинские записи, юридическую тайну и раскрытие финансовой информации, и в пресс-релизе ничего не говорится о размещении данных, их хранении или о том, будут ли аудиозаписи, предоставленные Foundry, использоваться для обучения в будущем. В апрельских анонсах Microsoft обучающие данные описывались как смесь записей, отобранных людьми, шумных аудиозаписей, сделанных подрядчиками, и «огромных объемов данных из открытого интернета», как сообщает The Verge — описание, которое должно вызвать острые вопросы у регулируемых отраслей. Ни один из этих пробелов не является необычным для анонса запуска, но именно эти вопросы отличают победу в рейтинге от внедрения в производство.

Что стратегия Microsoft в области речевых моделей говорит о более широких амбициях компании в сфере искусственного интеллекта?

Если отвлечься от деталей распознавания речи, то вырисовывается закономерность, выходящая далеко за рамки транскрипции. Подразделение искусственного интеллекта Microsoft теперь выпускает модели для обработки изображений, голоса, транскрипции, кода, логических рассуждений и кибербезопасности. На конференции Build в июне компания анонсировала семь новых моделей MAI в рамках одной презентации. Каждая из них следует одному и тому же сценарию: нацелена на четко определенную модальность, агрессивно оптимизирована по стоимости вывода, цена ниже, чем в передовых лабораториях, распространяется через Foundry и незаметно внедряется в собственные продукты Microsoft.

Это не попытка создать одну модель, которая превзошла бы GPT или Gemini во всем. Это попытка создать портфель специализированных моделей, которые в совокупности позволят Microsoft обслуживать большую часть корпоративных рабочих нагрузок, не платя никому другому, — и продавать избыточные мощности всем остальным по ценам, недоступным для специалистов. Транскрипция стала первым методом, где этот подход полностью созрел, но примечания к выпуску MAI-Transcribe-2 больше похожи не на анонс продукта, а на шаблон.

Сулейман два года говорил о «гуманистическом сверхинтеллекте» и ИИ-помощниках, которые «подотчетны им и находятся на их стороне». Словарь звучит высокопарно. Реализация же — это электронная таблица. Пять месяцев назад Microsoft брала 36 центов за преобразование часа речи в текст. В четверг она взяла 10 центов, добавила шесть функций, которые конкуренты продают отдельно, и заняла первое место в отраслевом стандарте многоязычного бенчмарка. Компания, которая потратила 13 миллиардов долларов на изучение стоимости передового ИИ, решила, что ей лучше владеть фабрикой, чем арендовать ее продукцию, — и теперь она продает ее по цене ниже арендной платы.

MAI-Transcribe-2 уже доступен через Microsoft Foundry и MAI Playground.

Опрос по корпоративной агентской оркестрации

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ 🤝 «Договориться можно обо всем»: Кеннеди писал не про уступки…. Архив рубрики ~Коротко из Telegram~ Новости недели Регуляторные решения в ЕС, крупная кибербезопасностная инициатива OpenAI… Архив рубрики ~Коротко из Telegram~ GPT-6 вышла Делюсь первыми независимыми тестами от Artificial Analysis, которые… Архив рубрики ~Коротко из Telegram~ 💰Как финтех-гигант внедрил Runway в свой маркетинг Американский необанк Chime… Архив рубрики ~Коротко из Telegram~ Новость из Telegram 08.09.2026 08:33 Архив рубрики ~Коротко из Telegram~ По данным Reuters, Meta Platforms (признанная в России экстремистской организацией,… Архив рубрики ~Коротко из Telegram~ 🎥 ИИ в кинопроизводстве: как меняется индустрия В 2023 забастовки… Архив рубрики ~Коротко из Telegram~ ChatGPT начали блокировать в России. Теперь сайт не открывается ещё… Архив рубрики ~Коротко из Telegram~ Исследователи из Stanford и Arc Institute с помощью ИИ спроектировали… Архив рубрики ~Коротко из Telegram~ В экспериментальном магазине Andon Market ИИ по имени Луна впервые… Архив рубрики ~Коротко из Telegram~ Spotify – одумайся! Австралийская ассоциация звукозаписывающих компаний ARIA изменила правила… Архив рубрики ~Полезное~ Битрикс24 запустил Коворк/Код — десктопное приложение с AI-коллегой, которому можно… Новости робототехники Inbolt обсудит проблему развертывания физических ИИ на РобоБизнес Архив рубрики ~Обо всем~ «Гипотеза репродуктивной устойчивости» указывает на яичник как на источник открытий в исследованиях долголетия. Архив рубрики ~Коротко из Telegram~ 🤝 «Договориться можно обо всем»: Кеннеди писал не про уступки…. Архив рубрики ~Коротко из Telegram~ Новости недели Регуляторные решения в ЕС, крупная кибербезопасностная инициатива OpenAI… Архив рубрики ~Коротко из Telegram~ GPT-6 вышла Делюсь первыми независимыми тестами от Artificial Analysis, которые… Архив рубрики ~Коротко из Telegram~ 💰Как финтех-гигант внедрил Runway в свой маркетинг Американский необанк Chime… Архив рубрики ~Коротко из Telegram~ Новость из Telegram 08.09.2026 08:33 Архив рубрики ~Коротко из Telegram~ По данным Reuters, Meta Platforms (признанная в России экстремистской организацией,… Архив рубрики ~Коротко из Telegram~ 🎥 ИИ в кинопроизводстве: как меняется индустрия В 2023 забастовки… Архив рубрики ~Коротко из Telegram~ ChatGPT начали блокировать в России. Теперь сайт не открывается ещё… Архив рубрики ~Коротко из Telegram~ Исследователи из Stanford и Arc Institute с помощью ИИ спроектировали… Архив рубрики ~Коротко из Telegram~ В экспериментальном магазине Andon Market ИИ по имени Луна впервые… Архив рубрики ~Коротко из Telegram~ Spotify – одумайся! Австралийская ассоциация звукозаписывающих компаний ARIA изменила правила… Архив рубрики ~Полезное~ Битрикс24 запустил Коворк/Код — десктопное приложение с AI-коллегой, которому можно… Новости робототехники Inbolt обсудит проблему развертывания физических ИИ на РобоБизнес Архив рубрики ~Обо всем~ «Гипотеза репродуктивной устойчивости» указывает на яичник как на источник открытий в исследованиях долголетия.

Оставить комментарий