Архив рубрики ~Лента новостей~

GLM-5.3 уже здесь, обладает расширенными возможностями в области кибербезопасности — и, как сообщается, уже обнаружил «серьезную уязвимость» в Cursor.

GLM-5.3 уже здесь, обладает расширенными возможностями в области кибербезопасности — и, как сообщается, уже обнаружил «серьезную уязвимость» в Cursor.
GLM-5.3 уже здесь, обладает расширенными возможностями в области кибербезопасности — и, как сообщается, уже обнаружил «серьезную уязвимость» в Cursor.

Карл Франзен

Китайский стартап в области искусственного интеллекта Z.ai, известный во всем мире своей постоянно расширяющейся линейкой мощных языковых моделей серии GLM с преимущественно открытым исходным кодом, сегодня выпустил GLM-5.3, демонстрирующий существенные улучшения в разработке долгосрочных сценариев и более значительный — и потенциально важный — скачок в возможностях обеспечения кибербезопасности.

По словам разработчика-консультанта z.ai Лу, уже сейчас кибервозможности GLM-5.3 обнаружили «потенциально серьезную уязвимость в Cursor», стартапе по разработке программного обеспечения для ИИ, недавно приобретенном SpaceX, как сообщил представитель z.ai по связям с общественностью Лу в своем сообщении на X. VentureBeat также отметил Cursor для подтверждения информации на X и ожидает ответа.

GLM-5.3 первоначально доступен только через систему кодирования GLM Coding Plan и среду кодирования ZCode, а доступ к API и открытым весам появится позже, «после завершения оценки безопасности и повышения надежности», как заявляет компания.

Компания Z.ai заявляет, что планирует выпустить утяжелители примерно через две недели после запуска.

Для корпоративных разработчиков примечательной частью релиза является не просто очередной раунд улучшений в бенчмарках. Z.ai заявляет, что GLM-5.3 использует ту же базовую модель, что и GLM-5.2, а улучшения достигаются исключительно за счет масштабирования после обучения в большем количестве сред, более разнообразных задачах и дополнительных вычислительных мощностях для обучения с подкреплением.

Таким образом, GLM-5.3 становится своего рода проверкой того, насколько далеко можно продвинуть базовую модель граничного масштаба без еще одного дорогостоящего цикла предварительного обучения.

«В GLM-5.3 мы провели только масштабирование после обучения», — написала компания Z.ai в своем техническом сообщении.

Результаты свидетельствуют о значительном потенциале для дальнейшего развития. Однако они также создали необычную проблему для разработчика, использующего открытые модели: по данным Z.ai, возможности в области кибербезопасности улучшались быстрее, чем ожидалось, по мере масштабирования обучения, особенно по мере перехода от выявления уязвимостей к построению полных цепочек эксплуатации.

В пятницу агентство Reuters сообщило, что Z.ai также вводит механизмы контроля над некоторыми из более продвинутых возможностей модели, включая подход «доверенного доступа» к конфиденциальным функциям.

Значительный скачок в кодировании без использования другой базовой модели.

GLM-5.3 основывается на базовой модели с 743 миллиардами параметров, лежащей в основе GLM-5.2, а не заменяет её. Z.ai вместо этого расширила уже разработанную ею систему постобучения, ориентированную на обучение с подкреплением в долгосрочной перспективе.

Эти среды все больше напоминают полноценные инженерные задачи, а не отдельные упражнения по программированию.

Z.ai описывает сценарии, в которых агент получает доступ к кодовым базам, документации, вычислительным кластерам, системам хранения данных и результатам экспериментов, а затем должен диагностировать проблемы, модифицировать системы, проводить эксперименты и демонстрировать измеримое улучшение, сохраняя при этом корректность работы. Некоторые задачи рассчитаны на выполнение нескольких рабочих дней опытным инженером.

Примененный подход позволил добиться значительного улучшения результатов по сравнению с предыдущим поколением, согласно оценкам, представленным компанией Z.ai.

В тестах Terminal-Bench 3.0 показатель GLM-5.3 вырос с 4,6 до 28,3, в DeepSWE v1.1 — с 46,2 до 66,9, а в AutomationBench — с 26,2 до 48,2. В Agents' Last Exam CLI он улучшился с 23,8 до 28,5.

Данная модель не превосходит всех конкурентов на переднем крае вычислительной техники. В таблице результатов собственных тестов Z.ai GPT-5.6 Sol показывает результат 34,6, а Claude Fable 5 — 33,7 на Terminal-Bench 3.0, по сравнению с 28,3 у GLM-5.3. На DeepSWE v1.1 GLM-5.3 набирает 66,9, по сравнению с 72,7 у GPT-5.6 Sol и 69,7 у Fable 5.

Однако Z.ai делает упор не только на позицию в рейтинге, но и на эффективность.

На собственном тестовом стенде Z.ai Code Bench GLM-5.3 достигает результата в 34,5% при максимальной интенсивности вычислений, потребляя примерно 75 000 выходных токенов на задачу. GLM-5.2 достигает 23,4% при потреблении приблизительно 96 000. При высокой интенсивности вычислений GLM-5.3 достигает 31,4% при потреблении примерно 50 000 выходных токенов, по сравнению с заявленными Z.ai 29,5% для Claude Opus 4.8, использующего 120 000 токенов.

Поскольку Code Bench — это собственная частная оценка Z.ai, эти сравнения следует рассматривать как результаты, предоставленные компанией, а не как независимые измерения. Тем не менее, снижение потребления токенов при одновременном улучшении выполнения задач имеет важное операционное значение для предприятий, внедряющих агентов программирования, где длительные циклы могут быстро привести к увеличению затрат на вывод и задержек.

Кибервозможности развились быстрее, чем ожидал Z.ai.

Наиболее необычным событием является развитие кибербезопасности.

Компания Z.ai внедрила среды обнаружения уязвимостей в модель GLM-5.3 после обучения, рассчитывая на улучшение способности модели обнаруживать программные ошибки. Однако, по словам компании, возможности модели начали улучшаться на более поздних этапах цепочки эксплуатации.

«По мере расширения масштабов после обучения кибервозможности развивались быстрее, чем мы ожидали», — написал Z.ai.

Тесты производительности z.ai для GLM-5.3

На платформе CyberGym, которая проверяет обнаружение и проверку уязвимостей в исходном коде, GLM-5.3 набирает 84,5%, по сравнению с 77,2% у GLM-5.2. Это также превосходит показатели GPT-5.6 Sol (83,6%) и Mythos 5 (83,8%), о которых сообщила компания Z.ai.

Преимущество не распространяется на весь набор эксплойтов. GLM-5.3 набирает 54,4% на ExploitBench, что более чем вдвое превышает показатель GLM-5.2 (24,4%), но всё ещё значительно отстаёт от 76,5%, которые сообщает Z.ai для GPT-5.6 Sol, и 78% для Mythos 5.

Аналогично, на ExploitGym GLM-5.3 выполняет 105 задач в рамках нормализованного двухчасового бюджета и 130 задач в рамках шестичасового, по сравнению с 29 и 39 у GLM-5.2. Fable 5 достигает 181 и 247, а GPT-5.6 Sol — 216 и 293.

Направление движения может иметь большее значение, чем позиция в турнирной таблице.

Компания Z.ai заявляет, что работа с группами безопасности в Китае привела к выявлению 2436 уязвимостей в рамках 269 проектов после экспертной оценки, проверки и удаления дубликатов. В реестре раскрытия информации указано 1097 критических или высокосерьезных уязвимостей, из которых 53 были опубликованы, а 2383 все еще находились под эмбарго на момент публикации.

Это создает противоречие, с которым все чаще сталкиваются разработчики передовых моделей: те же возможности агентов, ориентированные на долгосрочную перспективу и делающие модели более полезными для разработки программного обеспечения, могут также сделать их более компетентными исследователями в области безопасности — и потенциально более компетентными операторами наступательных операций.

В соответствии с GLM-5.3 разработчики также должны изменить способ вызова модели.

Разработчикам, осуществляющим миграцию существующих приложений GLM, следует обратить внимание на возможное нарушение корректного поведения API.

GLM-5.3 поддерживает три уровня сложности рассуждений — низкий, высокий и максимальный — при этом максимальный уровень является уровнем по умолчанию и рекомендуемой Z.ai настройкой для программирования. Но в отличие от предыдущих версий, функцию рассуждений отключить нельзя.

Приложения, которые в настоящее время отправляют thinking.type: «disabled», должны изменить значение на enabled и указать усилие рассуждения, прежде чем менять идентификатор модели на GLM-5.3. В противном случае, по словам Z.ai, запрос завершится неудачей.

Таким образом, GLM-5.3 представляет собой фактическую миграцию, а не просто замену названия модели для некоторых производственных приложений.

От GLM-4.5 до GLM-5.3: стремительное продвижение Z.ai в области агентного инжиниринга

GLM-5.3 — это последний шаг в стремительном переходе компании Z.ai (ранее известной как Zhipu AI) к созданию программистов и долгосрочных автономных инженерных задач.

Выпущенная в июле 2025 года модель GLM-4.5 во многом определила это направление. Модель, объединяющая 355 миллиардов параметров и представляющая собой смесь экспертов, была разработана для сочетания возможностей логического мышления, программирования и работы агентов, в то время как меньшая по размеру модель GLM-4.5-Air предлагала в общей сложности 106 миллиардов параметров. Компания Z.ai выпустила модели с открытыми весами и сделала акцент на интеграции с агентными платформами.

В сентябре вышла версия GLM-4.6, расширившая контекст с 128 000 до 200 000 токенов и ориентированная на кодирование, использование инструментов и рабочие процессы агентов в таких средах, как Claude Code, Cline, Roo Code и Kilo Code. Z.ai также начала уделять больше внимания эффективности токенов в реальных тестах кодирования, а не только производительности в бенчмарках.

Значительный архитектурный скачок произошел с появлением GLM-5 в феврале 2026 года. Компания Z.ai увеличила количество параметров модели с 355 миллиардов в GLM-4.5 до 744 миллиардов, при этом количество активных параметров достигло 40 миллиардов, а объем данных для предварительного обучения увеличился до 28,5 триллионов токенов. Также была представлена асинхронная инфраструктура обучения с подкреплением «slime», и семейство GLM было явно переориентировано на «агентное проектирование» и задачи с долгосрочным горизонтом.

К июню GLM-5.2 превратила эту стратегию в более прямое корпоративное решение. Модель с 753 миллиардами параметров появилась со стабильным контекстным окном в 1 миллион токенов, открытыми весами под лицензией MIT и поддержкой более чем 20 сред программирования. Она также представила IndexShare, который повторно использует индексатор в слоях с разреженным вниманием для снижения вычислительной нагрузки на очень длинные контексты.

Цена GLM-5.2 составляла 1,40 доллара за миллион токенов API-входа и 4,40 доллара за миллион токенов выходного трафика, при этом цена кэшированного ввода была значительно ниже, что позиционирует Z.ai как технического и ценового конкурента для передовых лабораторий, разрабатывающих собственные решения.

Амбиции Z.ai выходят за рамки разработки моделей. В прошлом месяце агентство Reuters сообщило, что Zhipu AI привлекла около 31,4 миллиарда гонконгских долларов, или примерно 4 миллиарда долларов США, посредством продажи акций в Гонконге. Вырученные средства будут направлены на такие области, как исследования и разработки, вычислительная инфраструктура, привлечение талантов и расширение бизнеса.

Взятые вместе, эти релизы демонстрируют последовательный прогресс: GLM-4.5 объединил рассуждения, кодирование и агентов; GLM-5 существенно масштабировал базовую модель; GLM-5.2 перешел к разработке с учетом долгосрочного контекста и долгосрочного горизонта; а GLM-5.3 теперь пытается извлечь значительно больше возможностей из той же базовой модели посредством постобучения.

Цены, Z-код и наличие

GLM-5.3 теперь доступен через программу кодирования GLM от Z.ai и ZCode.

ZCode — это собственная среда разработки программного обеспечения компании, поддерживающая длительные задачи типа «Цель», которые планируют, реализуют, тестируют и проверяют работу. Она также предлагает удаленное управление запущенными задачами и доступна для macOS, Windows и Linux.

В настоящее время индивидуальные тарифные планы GLM Coding начинаются с указанной акционной цены в 12,60 долларов США в месяц за план Lite с 10 000 кредитами в неделю. План Pro стоит 56 долларов США в месяц с шестикратным использованием Lite, а план Max — 117,60 долларов США в месяц с четырнадцатикратным использованием Lite. Стандартные и премиум-тарифы для команд стоят 88 и 188 долларов США за пользователя в месяц соответственно.

Компания Z.ai также перешла на систему квотирования на основе баллов в рамках плана кодирования, которая отдельно учитывает входные, кэшированные входные и выходные токены. Звонки вне пикового периода работы компании в будние дни расходуют 50% от обычного количества баллов.

Компания пока не предоставила общие данные о ценах на API GLM-5.3 в присланных материалах для запуска, что затрудняет прямое сравнение общей стоимости производства API с GLM-5.2 или конкурирующими перспективными моделями до тех пор, пока не будет обеспечен поэтапный доступ к API.

Поэтапный выпуск, возможно, в конечном итоге станет самой важной частью GLM-5.3.

В течение последнего года компания Z.ai продвигала стратегию открытых моделей, основанную на разрешительных весах, низкозатратном выводе и совместимости с существующими экосистемами программных агентов. GLM-5.3 демонстрирует, что происходит, когда эта стратегия, возможно, слишком хорошо срабатывает в одной чувствительной области: более качественное проектирование автономных систем также означает более качественные исследования в области автономной безопасности.

В результате получилась модель, которая продвигает амбиции Z.ai в области программирования, одновременно заставляя компанию столкнуться с тем же компромиссом между возможностями и доступом, с которым сталкиваются крупнейшие закрытые передовые лаборатории.

Поэтому для корпоративных разработчиков GLM-5.3 заслуживает внимания по двум причинам. Результаты его кодирования дают еще одно подтверждение того, что все более совершенные агенты могут появляться благодаря улучшенной постобучению и средам без постоянной перестройки базовой модели. Результаты в области кибербезопасности показывают, почему решение о распределении этих агентов может стать столь же важным, как и решение о методах их обучения.

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Как Protolabs превращает файлы САПР в детали менее чем за 24 часа Новости робототехники Neros Technologies вложит 250 миллионов долларов на развертывание своих оборонных дронов к концу 2026 года. Архив рубрики ~Коротко из Telegram~ Google собрал всё своё обучение по ИИ, коду и данным… Архив рубрики ~Коротко из Telegram~ Математик опроверг гипотезу Якоби с помощью ИИ-модели Гипотеза 1939 года… Архив рубрики ~Коротко из Telegram~ xAI запустила Grok Bot — ИИ-агента с собственным компьютером Агент… Архив рубрики ~Коротко из Telegram~ Google выпустила Gemini 3.7 Flash — через три недели после… Архив рубрики ~Обо всем~ Марсианский метеорит из Алжира оказался шерготтитом редкого типа. NWA 13441 нашли в 2019 году Новости робототехники Роботы на Уолл-стрит: нетрадиционные пути выхода на публичные рынки для робототехнических компаний Новости робототехники Универсальный железнодорожный робот заменит людей на опасных участках Архив рубрики ~Коротко из Telegram~ ☀️ Видео KodeCloud разбирает квантизацию — почему модель на 70… Архив рубрики ~Коротко из Telegram~ Батарейки из водорослей Учёные из Кембриджского университета вместе с биодизайнером… Архив рубрики ~Коротко из Telegram~ «Пятёрочка» научилась напоминать, что у вас скоро скиснет В приложении… Архив рубрики ~Коротко из Telegram~ Nebius: $582 млн выручки и $5,7 млрд капекса Голландская компания… Архив рубрики ~Коротко из Telegram~ CXMT обошла Tencent и стала самой дорогой компанией Китая Китайский… Новости робототехники Как Protolabs превращает файлы САПР в детали менее чем за 24 часа Новости робототехники Neros Technologies вложит 250 миллионов долларов на развертывание своих оборонных дронов к концу 2026 года. Архив рубрики ~Коротко из Telegram~ Google собрал всё своё обучение по ИИ, коду и данным… Архив рубрики ~Коротко из Telegram~ Математик опроверг гипотезу Якоби с помощью ИИ-модели Гипотеза 1939 года… Архив рубрики ~Коротко из Telegram~ xAI запустила Grok Bot — ИИ-агента с собственным компьютером Агент… Архив рубрики ~Коротко из Telegram~ Google выпустила Gemini 3.7 Flash — через три недели после… Архив рубрики ~Обо всем~ Марсианский метеорит из Алжира оказался шерготтитом редкого типа. NWA 13441 нашли в 2019 году Новости робототехники Роботы на Уолл-стрит: нетрадиционные пути выхода на публичные рынки для робототехнических компаний Новости робототехники Универсальный железнодорожный робот заменит людей на опасных участках Архив рубрики ~Коротко из Telegram~ ☀️ Видео KodeCloud разбирает квантизацию — почему модель на 70… Архив рубрики ~Коротко из Telegram~ Батарейки из водорослей Учёные из Кембриджского университета вместе с биодизайнером… Архив рубрики ~Коротко из Telegram~ «Пятёрочка» научилась напоминать, что у вас скоро скиснет В приложении… Архив рубрики ~Коротко из Telegram~ Nebius: $582 млн выручки и $5,7 млрд капекса Голландская компания… Архив рубрики ~Коротко из Telegram~ CXMT обошла Tencent и стала самой дорогой компанией Китая Китайский…

Оставить комментарий