Microsoft запускает новые собственные модели искусственного интеллекта, которые, по ее словам, позволяют сократить расходы до 89% по сравнению с OpenAI.
Майкл Нуньес
В среду Microsoft AI выпустила в публичный предварительный просмотр две новые собственные модели — MAI-Image-2.5-Pro, свой самый высокоточный на сегодняшний день генератор изображений, и MAI-Voice-2-Flash, речевую модель, разработанную для больших объемов корпоративных задач, — одновременно опубликовав данные, полученные в ходе эксплуатации, что является самым убедительным аргументом компании в пользу того, что она может использовать собственные продукты, не полагаясь на передовые модели OpenAI.
Заявление, сделанное командой Microsoft AI Superintelligence, прозвучало примерно через год после того, как компания обязалась создавать специализированные модели внутри компании, и оно сопровождается необычайно подробным описанием того, где эти модели теперь работают: Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot и Azure. Послание корпоративным покупателям — и, косвенно, OpenAI — заключается в том, что собственные модели Microsoft больше не являются исследовательскими проектами. Это производственная инфраструктура, обслуживающая миллионы пользователей.
«Каждое из этих улучшений — шаг к одной и той же цели: продукты Microsoft, работающие на основе моделей Microsoft», — написала компания в своем блоге, посвященном анонсу.
Как MAI-Image-2.5-Pro и MAI-Voice-2-Flash занимают противоположные концы кривой стоимости ИИ
Две новые версии занимают противоположные концы кривой «качество-скорость-стоимость», как её называет Microsoft, и такое позиционирование является преднамеренным. MAI-Image-2.5-Pro ориентирована на премиальный уровень: высококачественные изображения, детальная обработка и точное отображение текста на изображении — последнее из которых долгое время было печально известным слабым местом моделей генерации изображений. Microsoft установила цену модели в 5 долларов за миллион токенов ввода текста, 8 долларов за миллион токенов ввода изображений и 106 долларов за миллион токенов вывода изображений. Базовая модель MAI-Image-2.5 недавно заняла второе место по редактированию изображений в Arena, таблице лидеров сообщества, которая стала де-факто таблицей достижений в области генеративного медиа.
Похоже, креативная индустрия обратила на это внимание. Роб Рейли, глобальный креативный директор рекламного гиганта WPP, назвал модель Pro «значительным шагом вперед для инструментов GenMedia» в заявлении, включенном в анонс Microsoft, добавив, что «Microsoft прочно зарекомендовала себя как один из лидеров в области генеративного искусственного интеллекта».
MAI-Voice-2-Flash идет в противоположном направлении. Впервые представленный на конференции Microsoft Build, Flash работает в два раза быстрее, чем MAI-Voice-2, и стоит на 32% меньше, по цене 15 долларов за миллион символов. Он разработан для непривлекательного, но огромного рынка высокопроизводительной голосовой связи — колл-центров, голосовых агентов и приложений для обработки речи в реальном времени, где задержка и стоимость звонка имеют большее значение, чем незначительное улучшение выразительности. Вместе эти две модели отражают стратегию создания семейств моделей, а не одного флагмана, потому что, как заявила компания, у креативной студии, стремящейся к максимальной точности, совершенно иные потребности, чем у службы поддержки клиентов, обрабатывающей миллионы звонков в день.
Согласно производственным показателям Microsoft, собственные модели позволяют снизить стоимость графических процессоров до 89%.
Запуск новых моделей, пожалуй, менее примечательн, чем показатели внедрения, которые Microsoft к ним приложила — цифры, которые выглядят как систематическое обоснование необходимости замены сторонних инновационных моделей во всем своем продуктовом портфеле.
Bing Image Creator теперь полностью работает на MAI-Image-2.5, от начала до конца, что знаменует собой первый случай, когда этот потребительский инструмент для работы с изображениями полностью разработан внутри компании. В PowerPoint, по словам Microsoft, MAI-Image-2.5 снижает затраты на графический процессор до 84% по сравнению с GPT-Image-2, моделью обработки изображений от OpenAI. В OneDrive, где MAI-Image-2.5 теперь является моделью по умолчанию для ключевых сценариев редактирования изображений, компания сообщает об увеличении скорости сохранения на 26%, примерно на 25% меньшей задержке P95 и в 2,5 раза большей эффективности при средних нагрузках в производственной среде.
Что касается голосовых технологий, MAI-Voice-2-Flash теперь используется в Dynamics 365 Contact Center — платформе, которую используют такие клиенты, как T-Mobile и EasyJet, — где, по утверждению Microsoft, затраты на графические процессоры снижаются до 89%. Эта модель также интегрирована в Azure Voice Live для разработчиков, создающих агентов преобразования речи в речь.
Пожалуй, наиболее значимое внедрение произошло в сфере здравоохранения. Microsoft Dragon Copilot, используемый 170 000 медицинских учреждений и обработавший 28 миллионов обращений пациентов в прошлом квартале, теперь работает на MAI-Transcribe-1.5 для многоязычного рабочего процесса на 58 языках. Microsoft заявляет, что внутренние оценки показывают относительное снижение на 50% как количества ошибок транскрипции, так и ошибок идентификации языка на большинстве языков — значимое достижение в области, где ошибки транскрипции могут напрямую влиять на клинические записи.
Внутри стратегии «восхождения на холм», которая позволяет небольшим моделям превзойти GPT-5.6 в Excel.
В сопутствующей публикации, размещенной в тот же день, Microsoft подробно описала методологию, лежащую в основе этих результатов — то, что она называет своей «машиной для покорения вершин», интегрированным механизмом, состоящим из данных, моделей и «инфраструктуры» продукта, которая их окружает.
Наиболее наглядный пример — MAI-Code-1-Flash, облегченная модель кодирования, запущенная в июне в GitHub Copilot. Microsoft утверждает, что эта модель обеспечивает примерно на 10% более высокий процент принятия кода, чем GPT-5.4 Mini и Claude Haiku 4.5 в VS Code, при этом используя на 10% меньше средних токенов. Аналогичная ситуация наблюдается и с удержанием разработчиков: вероятность возвращения пользователей в течение нескольких дней была на 6% выше, чем при использовании GPT-5.4 Mini, и на 11% выше, чем при использовании Claude Haiku 4.5.
Затем Microsoft сделала нечто более интересное. Компания взяла контрольную точку MAI-Code-1-Flash и дополнительно обучила её в среде обучения с подкреплением Excel, обучив модель программирования инструментам и рабочим процессам работы с электронными таблицами. В результате, по отзывам пользователей, получилась модель, сопоставимая с GPT-5.6 по наиболее распространённым задачам Excel, при этом достаточно компактная, чтобы работать на более старых графических процессорах Nvidia H100 и даже A100, а не требовать использования ускорителей последнего поколения.
Этот аспект аппаратного обеспечения заслуживает особого внимания. Каждая крупная компания, занимающаяся ИИ, борется за выделение передовых чипов, и модель, обеспечивающая качество, близкое к передовому, на кремниевых чипах двухлетней давности, коренным образом меняет экономику развертывания. Это также освобождает новейшее оборудование — включая уже работающий кластер GB200 от Microsoft — для обучения, а не для обслуживания.
Манифест Сатьи Наделлы о «пограничном распространении» пересматривает отношения с OpenAI.
Генеральный директор Microsoft Сатья Наделла изложил эти заявления в длинном посте на X под названием «Распространение и контроль на передовых рубежах», который можно рассматривать как своего рода стратегический манифест. «Теперь мы можем использовать насыщенные передовые возможности и предоставлять их в масштабе и с меньшими затратами с помощью моделей, оптимизированных для продуктов с высокой интенсивностью использования, продолжая при этом использовать передовые модели для удовлетворения передовых потребностей», — написал Наделла, добавив, что Microsoft «начинает перенаправлять трафик с наших собственных платформ на MAI всякий раз, когда наши модели соответствуют или превосходят передовые альтернативы».
Перевод с уровня руководителя: возможности, которые год назад считались передовыми, теперь стали само собой разумеющимися, и Microsoft считает, что может недорого воспроизвести их для конкретных, повторяющихся задач, которые доминируют в реальном использовании продукта. Зачем платить за модель, соответствующую передовым технологиям, если пользователю просто нужно переформатировать столбец электронной таблицы?
Наделла осторожно отметил, что «передовые модели от OpenAI и Anthropic являются частью системы оркестровки наряду с MAI», — но он также сформулировал важный принцип независимости моделей, утверждая, что оценки компании «должны продолжать расти даже после удаления какой-либо конкретной модели».
«Он утверждал, что именно сохранение инструментов, памяти, контекста и навыков вне модели дает Microsoft контроль. Подтекст трудно не заметить. В апреле агентство Reuters сообщило, что эксклюзивная лицензия Microsoft на технологию OpenAI была пересмотрена и заменена неэксклюзивным соглашением, а в сентябре прошлого года издание The Information сообщило, что Microsoft начала внедрять антропные модели в некоторые продукты. Объявление в среду завершает треугольник: Microsoft выступает в роли оркестратора, а передовые модели ее партнеров являются взаимозаменяемыми компонентами, в то время как собственные модели Microsoft поглощают все большую долю рутинного трафика».
Разработчики приветствуют более дешевые модели, ориентированные на выполнение конкретных задач, в то время как скептики ставят под сомнение послужной список Microsoft.
В онлайн-реакции отразились как привлекательность, так и скептицизм по поводу этой стратегии. «Мне нравится, когда люди используют небольшие модели для узкоспециализированных задач», — написал один из пользователей X, @mavihsk, в ответ на пост Наделлы. «Зачем мне использовать всезнающую модель, чтобы изменить поле в Excel?» Другой пользователь, @nabu_lines, точно сформулировал суть: «и стоимость, и производительность улучшаются, когда вы перестаете чрезмерно использовать самую большую модель».
Другие были менее благосклонны к послужному списку Microsoft в плане реализации планов. «Microsoft хуже всех прислушивается к отзывам пользователей», — написал дизайнер @designedbyabin, утверждая, что компания «проиграет гонку ИИ, потому что неоднократно не понимала потребности пользователей». А один пользователь, @tokenoverflow, предложил более сухую критику заявления о независимости модели: «Я хочу, чтобы она продолжала подниматься по холмам после удаления Microsoft».
Скептики высказывают справедливое замечание. Представленные Microsoft показатели — процент принятия, процент сохранения, экономия ресурсов графического процессора — основаны на собственных внутренних оценках компании, а не на независимых бенчмарках, и компания сама решает, какие сравнения публиковать.
Но логика этой стратегии не зависит от какой-либо одной цифры. Утверждение Наделлы о том, что программное обеспечение впервые имеет «реальные предельные издержки», объясняет, почему Microsoft так одержима токенами, графическими процессорами и затратами на обслуживание: когда функции ИИ выполняются при каждом нажатии клавиши в продуктовом портфеле с миллиардом пользователей, снижение стоимости графических процессоров на 84% — это не оптимизация. Это разница между жизнеспособным бизнесом и убыточной ямой.
Почему Microsoft превращает свой внутренний арсенал средств искусственного интеллекта в продукт Azure?
Заключительный элемент стратегии заключается в том, что Microsoft продает не только модели, но и саму стратегию. Наделла прямо заявил, что подход «восхождения на вершину» является «шаблоном для всех остальных компаний, занимающихся ИИ, SaaS или корпоративным сектором», и Microsoft предлагает этот набор инструментов через Foundry и то, что она называет Frontier Tuning — позволяя предприятиям обучать специализированные модели на основе собственных запатентованных сред оценки и обучения с подкреплением. Это превращает внутреннюю программу Microsoft по сокращению затрат в продукт Azure и дает корпоративным клиентам повод запускать свои рабочие нагрузки ИИ в облаке Microsoft, даже если сами модели поступают из других источников.
Акцент компании на моделях, обученных «на чистых, отслеживаемых данных корпоративного уровня, без использования данных сторонних производителей», служит той же коммерческой цели. В отрасли, сталкивающейся с растущим вниманием к происхождению обучающих данных, Microsoft делает ставку на то, что корпоративные покупатели — и суды — будут интересоваться происхождением возможностей моделей. Microsoft заявляет, что теперь распространяет этот подход на Copilot Chat, Outlook и PowerPoint, и обе новые модели доступны в режиме публичного предварительного просмотра через Microsoft Foundry и MAI Playground. «Это не конечная цель», — написала компания. «Мы только начинаем».
Семь лет назад Microsoft вложила более 13 миллиардов долларов в то, что OpenAI создаст будущее искусственного интеллекта. Объявление, сделанное в среду, говорит о том, что компания усвоила более дешевый урок: будущее ИИ может принадлежать тому, кто создаст новые технологии, но прибыль достанется тому, кто сделает его обыденным явлением.
Источник: venturebeat.com
Похожие записи
- Компания Anthropic запускает Claude Opus 5, более дешевую модель искусственного интеллекта для программирования, агентов и корпоративных рабочих процессов.
- Пятый окружной суд заблокировал закон штата Техас, требующий от веб-сайтов фильтровать «вредоносные» высказывания.
- Нынешний и будущий руководители Apple также дали короткое интервью о…
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
