Архив рубрики ~Лента новостей~

Автор утверждает, что новая модель Palmyra X6 снижает затраты на агентов ИИ на 52% на фоне резкого роста расходов на токены.

Автор утверждает, что новая модель Palmyra X6 снижает затраты на агентов ИИ на 52% на фоне резкого роста расходов на токены.
Автор утверждает, что новая модель Palmyra X6 снижает затраты на агентов ИИ на 52% на фоне резкого роста расходов на токены.

Майкл Нуньес

Компания Writer, разработчик корпоративной платформы для ИИ-агентов, используемой компаниями из списка Fortune 500, включая Accenture, Uber и Vanguard, сегодня выпустила свою новую флагманскую модель Palmyra X6, а также переработанную систему оркестрации агентов и новые инструменты управления, призванные дать ИТ-руководителям контроль над неконтролируемым расходованием токенов.

Основные показатели впечатляют: компания Writer заявляет, что ее продукт-агент теперь работает в среднем на 52% дешевле, при этом скорость работы повышается на 48%, а качество — на 10% при использовании в паре с Palmyra X6. Но более важным может оказаться то, как компания достигла таких результатов, и что ее решения говорят о направлении развития рынка корпоративного ИИ.

Palmyra X6 не обучалась с нуля. Это постобученная версия GLM-5.2, модели смешанных экспертов с открытыми весами от пекинской компании Z.ai, ранее известной как Zhipu AI — факт, который Writer открыто раскрывает в своем техническом отчете, и который ставит компанию из Сан-Франциско в центр одной из самых острых дискуссий в отрасли: следует ли американским предприятиям использовать китайские открытые исходные коды в качестве основы для своих разработок.

«Эта модель никоим образом не связана ни с одним из своих первоначальных разработчиков. Она полностью работает на нашей американской инфраструктуре», — заявил Матан-Пол Шетрит, директор по управлению продуктами Writer, в эксклюзивном интервью VentureBeat перед анонсом.

Дэн Бикель, руководитель исследований в области искусственного интеллекта в компании Writer, выразился более прямолинейно: «Это во многом модель Palmyra, и мы просто взяли числа с плавающей запятой в качестве отправной точки и обучаем модель, отталкиваясь от них».

Почему агенты искусственного интеллекта растрачивают корпоративные бюджеты так, как это никогда не делали чат-боты.

Объявление автора появилось в момент, когда экономика агентного ИИ стала центральным элементом решений о закупках для предприятий. В отличие от чат-бота, который обычно генерирует один ответ на запрос пользователя, агент ИИ превращает один запрос в повторяющиеся циклы планирования, получения информации, вызовов инструментов, проверки и повторных попыток — при этом каждый цикл потребляет лимитированные токены. Пользователь видит один ответ; счет отражает весь цикл.

Масштаб проблемы становится очевидным. Goldman Sachs прогнозирует, что потребление токенов увеличится в 24 раза в период с 2026 по 2030 год, достигнув 120 квадриллионов токенов в месяц, причем это будет обусловлено не увеличением числа задающих вопросы людей, а постоянно работающими корпоративными агентами. В том же анализе предупреждалось, что падение цен за токен не гарантирует снижения затрат: если выполнение задачи агентом требует в 20 раз больше токенов, а цена за единицу снижается на 75%, общие затраты все равно вырастут в пять раз.

«Компания хочет, чтобы потребление токенов резко возросло — это означает, что внедрение происходит, — но им необходимо, чтобы издержки стабилизировались», — заявил в своем заявлении Васим Аль-Ших, технический директор и соучредитель Writer.

Шетрит назвал проблему стоимости основным препятствием для внедрения ИИ в предприятиях — в большей степени, чем сами возможности моделей. «Сегодня самым большим препятствием для расширения использования ИИ в предприятиях является не столько возможности моделей, сколько их стоимость», — сказал он. «В действительности, в большинстве случаев альтернативой ИИ является не еще один ИИ, а человеческий труд».

На вопрос о том, приведет ли сокращение потребления токенов клиентами к снижению выручки Writer от каждого токена, Шетрит отверг это предположение. «Снижение затрат не вредит моей прибыли. На самом деле, оно ее расширяет, потому что расширяет общий объем потенциальных возможностей внутри организации», — сказал он, утверждая, что снижение затрат на выполнение задач открывает доступ к рабочим процессам, которые предприятия иначе никогда бы не автоматизировали. Этот аргумент перекликается с тенденцией, знакомой по эпохе облачных технологий, когда цены за единицу продукции падали в течение десятилетия, в то время как общие счета росли по мере расширения потребления — динамика, на повторение которой Writer делает ставку в отношении агентов и рассчитывает получить от этого прибыль.

Внутри Palmyra X6: как 626 обучающих примеров позволили доработать модель с 744 миллиардами параметров.

Palmyra X6 — это модель смешения экспертов с 744 миллиардами параметров, имеющая примерно 40 миллиардов активных параметров на токен, унаследовавшая архитектуру GLM-5.2 без изменений, согласно техническому отчету Writer. Вклад компании заключается в намеренно консервативном методе постобработки: методе, называемом привязанной контролируемой тонкой настройкой (ASFT), примененном к удивительно небольшому корпусу, состоящему всего из 626 тщательно отобранных синтетических траекторий агентов, обученных в течение одной эпохи с низкой скоростью обучения.

Суть не в ограниченности, а в небольшом объеме данных. ASFT сочетает схему взвешивания токенов с «якорем» дивергенции Кульбака-Лейблера, который наказывает тонко настроенную модель за слишком сильное отклонение от застывшей копии базовой модели — обучая новым моделям использования инструментов без ущерба для общих возможностей, которыми уже обладает базовая модель. Автор также заменил стандартный оптимизатор Adam на Muon, более новый метод, который рассматривает матрицы весов как геометрические объекты, на основных матрицах весов модели.

«Существует целый ряд работ, следующих так называемой философии «меньше — значит больше», — сказал Бикель, ссылаясь на исследования, показывающие, что «небольшие, но чрезвычайно качественные наборы данных имеют огромное значение». Он добавил: «Именно этой философии — одной из философий — мы следовали при создании этой модели, и это показало себя. Это позволило нам оптимизировать процесс для наших клиентов с меньшими затратами на оптимизацию, и в конечном итоге это привело к созданию более экономичной модели как для нас, так и для них».

Сами обучающие данные полностью синтетические — каждый план, вызов инструмента и окончательный ответ генерируются машинным способом с помощью моделей-учителей, а затем проходят проверку на соответствие структурным критериям качества, проверку на основе модели и оценку экспертной комиссией из двух моделей LLM перед началом обучения. Это продолжает давнюю практику Writer: модель Palmyra X 004 была обучена почти полностью на синтетических данных и обошлась примерно в 700 000 долларов еще в 2024 году, как сообщал тогда TechCrunch, а для Palmyra X5 потребовалось около 1 миллиона долларов в часах работы графических процессоров, по данным SiliconANGLE.

По результатам внутренних оценок Writer — по девяти параметрам, охватывающим привязку и поиск информации, использование инструментов, генерацию контента, делегирование суб-агентам и фирменный стиль — X6 получил в среднем 0,87 из 1,00, опередив Claude Opus 4.8 (0,86) от Anthropic, Claude Sonnet 4.6 (0,85), GPT-5.5 от OpenAI (0,80) и Gemini 3.1 от Google (0,77). Реальным отличием является разница в цене: Writer оценивает X6 в 2 доллара за миллион входных токенов и 8 долларов за миллион выходных токенов, против 15/75 у Opus 4.8. Компания заявляет, что X6 выполняет задачи в среднем за 26 секунд и может работать в автоматическом режиме над достижением одной цели до восьми часов.

Автор откровенно признает, что внутренние контрольные показатели вызывают скептицизм. На прямой вопрос о том, опубликует ли компания свою методологию после проверки собственной работы, Бикель ответил, что технический отчет охватывает «как протокол, который мы использовали для проведения публичного сравнительного анализа, так и наши внутренние оценки». Он охарактеризовал публичные контрольные показатели как проверку на адекватность, а не как целевые показатели: «Мы проводим такие вещи, как публичные контрольные показатели, чтобы убедиться, что мы движемся в правильном направлении и что у нас нет каких-либо серьезных пробелов, но мы и не слепо им следуем, потому что это не отвечает интересам наших клиентов».

Китайский вопрос: что означает развитие GLM-5.2 для корпоративной безопасности и доверия?

Выбор базовой модели, сделанный автором, был бы немыслим для американского корпоративного поставщика два года назад. Сегодня это отражает рыночную реальность: GLM-5.2, выпущенная в июне под разрешительной лицензией MIT, является, пожалуй, самой функциональной из доступных в мире моделей. Независимая аналитическая компания Artificial Analysis оценила её на 51 балл по своему индексу интеллекта — опередив DeepSeek V4 Pro, Kimi K2.6 и даже некоторые модели Google Gemini в задачах, связанных с агентами, — при этом цены на неё во много раз ниже, чем на флагманские API-решения в США, как сообщило европейское технологическое издание Trending Topics. В пресс-релизе автора она названа «самой сильной из доступных моделей с открытым исходным кодом».

Резкий рост числа доступных весовых коэффициентов несёт в себе серьёзные проблемы. В августовском отчёте некоммерческой организации SaferAI, занимающейся вопросами безопасности ИИ, было установлено, что GLM-5.2 не отказался ни от одной из задач в области кибербезопасности или биологии, которые ему были предоставлены через общедоступный API Z.ai, и что Z.ai не опубликовала никаких рамок безопасности или оценок рисков перед развертыванием — этот пробел увеличивается, как только любой может загрузить и изменить весовые коэффициенты.

Ответ автора заключается в том, что происхождение и посттренировочный процесс имеют большее значение, чем место происхождения. Бикель подчеркнул, что компания «взяла гири с американского тренажера Hugging Face» и проводила тренировки исключительно на американской инфраструктуре; в техническом отчете говорится, что все наборы данных были синтезированы и хранились в США, а все тренировочное оборудование находилось в США.

Компания также провела, как она сама описывает, необычайно строгую, предварительно зарегистрированную оценку рисков модели, охватывающую политическую предвзятость, цензуру, достоверность фактов и поведение при отказе — 19 674 ответа были оценены независимыми экспертами — сравнивая X6 со своей базовой моделью GLM-5.2 и четырьмя моделями контроля на границе модельных рядов.

В оценке политической предвзятости ModelSlant, проведенной газетой Washington Post, автор отмечает, что X6 в 80% случаев представлял обе стороны острых вопросов, что является самым высоким показателем среди всех протестированных моделей, и отвечал на политически чувствительные запросы, которые DeepSeek V4 категорически отклонял. В тесте FORTRESS на безопасность от атак X6 с сообщением о системе развертывания набрал на 8,6 балла больше по показателю безопасности от атак, чем базовая модель GLM-5.2, при этом потери в доброжелательности были незначительными.

«Мы провели обширное сравнительное исследование предвзятости и цензуры, — сказал Шетрит, — и работа, проделанная Дэном и его командой, фактически доказала, что эта модель значительно лучше не только альтернатив с открытым исходным кодом, но и любых альтернатив с закрытым исходным кодом, существовавших на рынке на момент проведения сравнительного анализа».

В отчете, однако, есть одна примечательная оговорка: хотя поведение пользователей английского языка не показало статистически значимой политической асимметрии, «было показано, что поведение различается в зависимости от языка» — откровенное признание того, что 626 траекторий тонкой настройки не удаляют все следы обучения базовой модели.

Эффект «маневренности»: почему оркестровка может иметь большее значение, чем сама модель.

Пожалуй, наиболее стратегически интересное утверждение в анонсе Writer вообще не имеет отношения к Palmyra X6. Компания заявляет, что её переработанная система Writer Agent — уровень оркестровки, который планирует задачи, группирует работу, делегирует задачи субагентам и управляет контекстом — снижает затраты на 41% и выполняет задачи на 44% быстрее во всех протестированных моделях, включая сторонние модели от Anthropic и OpenAI, при этом сохраняя качество. Writer опубликовала результаты исследования в сопроводительной статье, посвященной тому, что она называет «эффектом системы».

Это поднимает очевидный вопрос, который VentureBeat задал компании: если только жгут проводов обеспечивает большую часть экономии на любой модели, зачем вообще создавать модель?

Ответ Шетрита касался контроля. «Я не могу контролировать, если лаборатория отказывается от своей модели. Я не могу контролировать, какие данные они используют в своей модели, — сказал он. — В то время как при создании модели я обладаю значительным моральным контролем и могу отвечать на сложные вопросы, которые мне задают корпоративные клиенты».

Бикель добавил, что модель и страховочная система разрабатывались совместно: «Эта модель была создана и, по сути, развивалась параллельно с страховочной системой… Мы знаем, что у нас есть флагманский продукт, Writer Agent. Мы хотим, чтобы он действительно очень хорошо работал с этой моделью, и, конечно же, так и есть. И мы учитываем это при разработке модели, а это невозможно, если вы не создадите свою собственную модель».

Примечательно, что Writer одновременно использует и хеджирование рисков. В этом релизе компания расширяет поддержку нескольких моделей для Writer Agent, позволяя администраторам включать модели от Anthropic, OpenAI и облачных провайдеров, включая Microsoft Azure, AWS Bedrock и Nvidia NIM — даже модели для генерации изображений, категорию, которую Writer не создает. Послание для ИТ-директоров предельно простое: используйте нашу модель, потому что она самая дешевая и оптимальная для ваших рабочих процессов, но платформа в любом случае экономит ваши деньги.

Новые инструменты управления призваны предотвратить неожиданные законопроекты об искусственном интеллекте еще до их принятия.

Третья часть обновления направлена на решение менее заметной проблемы в масштабах предприятия: никто из высшего руководства не знает, сколько тратят агенты. Новые инструменты управления предоставляют администраторам централизованный обзор использования ресурсов агентами по всей компании, аналитику по каждому рабочему процессу для общих автоматизированных сценариев «Playbooks» и «Skills», а также контроль потребления с помощью оповещений и лимитов расходов.

На вопрос о том, означает ли введение контроля над расходами получение клиентами неожиданных счетов, Шетрит переформулировал это как стимул к внедрению, а не как способ минимизации ущерба. «Как нам создать инструменты, которые позволят вам, как CIO или CISO в компании, чувствовать себя уверенно как в вопросах безопасности, так и в вопросах расходов, чтобы вы могли расширить использование ИИ в вашей организации?» — сказал он. По его словам, именно прозрачность позволяет руководителям говорить «да»: компании с четкими данными о затратах «на самом деле стремятся расширить внедрение ИИ на те области применения, к которым они раньше никогда бы не прикоснулись».

Этот набор функций отражает более масштабные изменения в том, как предприятия планируют бюджет на ИИ. Как показал анализ Forbes о ценовых войнах токенов, опытные покупатели учатся моделировать стоимость успешно выполненной задачи — подсчитывая повторные попытки, обращения к инструментам и эскалации — вместо того, чтобы умножать ожидаемое количество обращений на заявленную стоимость. Writer эффективно внедряет этот подход в производство, превращая то, что раньше было задачей для финансовых отделов, в встроенную функцию платформы.

Это также завершает цикл управления, который компания выстраивала более года. Согласно более ранним заявлениям компании, Writer выпустила унифицированный интерфейс для агентов с административным управлением в ноябре прошлого года, а затем в марте добавила навыки агентов и аналитику рабочих процессов. Выпуск в четверг замыкает цикл, устанавливая цену — и лимит расходов — для каждого рабочего процесса.

Компания Writer, основанная в 2020 году Мэй Хабиб и Васимом Аль-Шихом, привлекла 200 миллионов долларов инвестиций при оценке в 1,9 миллиарда долларов в конце 2024 года и построила свой бизнес на регулируемых, рискованных проектах, а не на потребительском сегменте. Шетрит не стал извиняться за узость этой направленности. «Привилегия работы и сосредоточения на корпоративных сценариях использования заключается в том, что мне не нужно, чтобы моя модель могла написать французский сонет», — сказал он. «Когда вы не пытаетесь сделать все, вы можете сосредоточиться на проблемах и потребностях ваших клиентов».

Он также прямо высказался о своей идентичности: «Мы не исследовательская лаборатория, перепрофилированная под потребительский продукт и теперь пробующая себя в корпоративном сегменте. В первую очередь мы — корпоративная компания, обслуживающая корпоративных клиентов, и мы оцениваем наши решения именно с этой точки зрения. Это значит, что если мы считаем, что создание чего-либо с нуля — правильное решение, мы так и поступим. Но если мы считаем, что на рынке есть другие альтернативы, которые лучше удовлетворяют потребности наших клиентов, мы поступим так же».

Этот прагматизм, возможно, является самым важным сигналом этого релиза. Хорошо финансируемая американская компания, занимающаяся искусственным интеллектом и имеющая пятилетний опыт создания моделей, пришла к выводу, что граница ценности больше не лежит в предварительном обучении, а на последнем этапе: после обучения — в открытии весов, проектировании соответствующей системы и предоставлении финансовому директору панели инструментов. Если Райтер прав, то конкурентное преимущество передовых лабораторий сужается до тех задач, где качество действительно оправдывает семикратную надбавку к цене, а во всех остальных случаях выигрышной моделью становится та, за предварительную подготовку которой кто-то другой заплатил.

В индустрии, где уже три года ведутся споры о том, чья модель умнее, компания Writer делает другую ставку: в гонке корпоративного ИИ победу одержит не компания с лучшими вычислениями с плавающей запятой, а та, которая знает, как их использовать.

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Полезное~ Бесплатные ИИ-инструменты вместо платных подписок: гайд для вайбкодера Новости робототехники Институт ARM привлечен к проектам в области технологий оборонного производства Новости робототехники Заказы на роботов во втором квартале выросли до 622 миллионов долларов, поскольку спрос на автоматизацию расширения растет во всех отраслях. Новости робототехники Новый гуманоидный робот Хонда «Аватар» предполагает, что дух ASIMO очень жив. Новости робототехники Робот-космический механик от Northrop — это новый способ продлить срок службы спутников. Новости робототехники Celona запускает агентную беспроводную платформу Orion, созданную для физического искусственного интеллекта и робототехники. Архив рубрики ~Коротко из Telegram~ Российская соцсеть Looky, позиционирующая себя как альтернатива Instagram*, готовит собственный… Архив рубрики ~Коротко из Telegram~ «Ростелеком» планирует закупить 2,57 млн российских SIM-карт на сумму до… Архив рубрики ~Коротко из Telegram~ НейроFOMO вызывает у юзеров симптомы тревожности и депрессии: психологи заметили,… Архив рубрики ~Коротко из Telegram~ ‼️ Минюст США объявил, что OpenAI и её бывшая «дочка»… Архив рубрики ~Коротко из Telegram~ Suno вводит лимиты на скачивание музыки С 3 сентября сервис… Архив рубрики ~Коротко из Telegram~ 🎬 Новый расклад в ИИ-видео: кто кого Свежий обзор видеогенераторов… Архив рубрики ~Коротко из Telegram~ 🔋 🎧 В коде iOS 27 beta найдена функция, которая… Архив рубрики ~Коротко из Telegram~ DeepSeek V4 Pro показывает примерно уровень Opus/Fable, но генерация ответа… Архив рубрики ~Полезное~ Бесплатные ИИ-инструменты вместо платных подписок: гайд для вайбкодера Новости робототехники Институт ARM привлечен к проектам в области технологий оборонного производства Новости робототехники Заказы на роботов во втором квартале выросли до 622 миллионов долларов, поскольку спрос на автоматизацию расширения растет во всех отраслях. Новости робототехники Новый гуманоидный робот Хонда «Аватар» предполагает, что дух ASIMO очень жив. Новости робототехники Робот-космический механик от Northrop — это новый способ продлить срок службы спутников. Новости робототехники Celona запускает агентную беспроводную платформу Orion, созданную для физического искусственного интеллекта и робототехники. Архив рубрики ~Коротко из Telegram~ Российская соцсеть Looky, позиционирующая себя как альтернатива Instagram*, готовит собственный… Архив рубрики ~Коротко из Telegram~ «Ростелеком» планирует закупить 2,57 млн российских SIM-карт на сумму до… Архив рубрики ~Коротко из Telegram~ НейроFOMO вызывает у юзеров симптомы тревожности и депрессии: психологи заметили,… Архив рубрики ~Коротко из Telegram~ ‼️ Минюст США объявил, что OpenAI и её бывшая «дочка»… Архив рубрики ~Коротко из Telegram~ Suno вводит лимиты на скачивание музыки С 3 сентября сервис… Архив рубрики ~Коротко из Telegram~ 🎬 Новый расклад в ИИ-видео: кто кого Свежий обзор видеогенераторов… Архив рубрики ~Коротко из Telegram~ 🔋 🎧 В коде iOS 27 beta найдена функция, которая… Архив рубрики ~Коротко из Telegram~ DeepSeek V4 Pro показывает примерно уровень Opus/Fable, но генерация ответа…

Оставить комментарий