Архив рубрики ~Лента новостей~

HydraFusion от GitHub снижает затраты на разработку кода для ИИ во всех тестах производительности. Однако качество сопоставимо только в одном тесте.

HydraFusion от GitHub снижает затраты на разработку кода для ИИ во всех тестах производительности. Однако качество сопоставимо только в одном тесте.
HydraFusion от GitHub снижает затраты на разработку кода для ИИ во всех тестах производительности. Однако качество сопоставимо только в одном тесте.

Шон Майкл Кернер

На данном этапе внедрения ИИ становится совершенно очевидно, что не существует ни одной модели, идеально подходящей для всех задач. Именно поэтому маршрутизация с помощью моделей стала обязательным условием.

Производители на рынке маршрутизации моделей сейчас рекламируют оркестровку нескольких моделей как повышение качества, но данных, подтверждающих это утверждение, гораздо меньше, чем предполагает маркетинг. Эта тенденция наблюдается как в GitHub, так и в Nvidia и OpenRouter. Новейший релиз GitHub — наиболее яркий тому пример: компания позиционирует HydraFusion как систему, обеспечивающую качество на передовом уровне, и её собственная таблица результатов подтверждает это лишь в одном из трёх тестов.

В пятницу Microsoft анонсировала новый подход к маршрутизации на основе моделей, получивший название HydraFusion. Название HydraFusion заимствовано из HyDRA (Hybrid Dynamic Routing Architecture) — гибридной динамической архитектуры маршрутизации, исследования в области маршрутизации, опубликованного исследователями Microsoft ранее в этом году.

Проект HydraFusion — это исследовательская предварительная версия, доступная через Copilot CLI, которая в режиме реального времени перенаправляет каждый запрос на кодирование между моделями, а не отправляет каждую задачу одной выбранной модели. В своем лучшем бенчмарке HydraFusion снизила предполагаемые затраты до 67% по сравнению с использованием только Claude Opus 5. HydraFusion уже доступна разработчикам на всех тарифных планах Copilot через флаг /experimental в Copilot CLI, при этом использование оплачивается по стандартной ставке токенов для каждой базовой модели.

«Я бы сказал, что выбор правильной модели быстро становится обязательным условием, но HydraFusion отличается тем, что решает вопрос „какой наилучший способ решения этой задачи“, а не „какая модель должна справиться с этой задачей?“», — сказал Марио Родригес, директор по продуктам GitHub, в интервью VentureBeat. «HydraFusion не просто запрашивает модель, он динамически формирует стратегию выполнения — определяет, лучше ли для решения задачи использовать одну модель, следует ли начать с более быстрой модели и постепенно повышать сложность, или же работа выиграет от независимой модели, которая проверит и улучшит результат».

Как это работает

HydraFusion оценивает каждый запрос на кодирование и назначает ему один из трех шаблонов выполнения до того, как будет произведен какой-либо вызов модели. Вместо того чтобы запрашивать единственную модель, система формирует стратегию выполнения для задачи, выбирая один из трех шаблонов, описанных ниже, как поясняет Родригес.

Единая модель. Одна модель решает задачу напрямую, без дополнительной проверки или этапа эскалации, когда логика маршрутизации определяет, что запрос в этом не нуждается.

Каскад. Эффективная модель сначала разрабатывает проект решения, а контроль качества решает, принять ли этот проект или передать ту же задачу более совершенной модели.

Критика. Одна модель создает черновик. Независимая модель из другого семейства моделей проверяет его в изолированном контексте без использования инструментов. Затем модель, создающая черновик, вносит в него изменения один раз на основе этой проверки.

Собственные данные GitHub не подтверждают концепцию «передового качества».

В ходе офлайн-оценок по трем эталонным тестам GitHub сравнил HydraFusion с Claude Opus 5 и GPT-5.6 Sol в качестве базовых тестов. GitHub представил предварительную версию исследования как демонстрирующую качество на уровне передовых разработок. Однако собственная таблица результатов показывает, что это утверждение справедливо только для одного из трех проведенных тестов.

В TerminalBench 2.1. HydraFusion показала на 4,9 процентных пункта более высокое качество выполнения проверенных задач по сравнению с базовым показателем Opus 5, при этом расчетная стоимость оказалась на 67% ниже.

DeepSWE. HydraFusion показала качество на 1,5 процентных пункта ниже, чем Opus 5, при этом ее расчетная стоимость оказалась на 36% ниже.

По результатам CheckpointBench, HydraFusion показала качество на 0,1 процентных пункта ниже, чем Opus 5, при этом расчетная стоимость оказалась на 65% ниже.

Стоимость снизилась по всем трем показателям. Качество соответствовало или превосходило показатели Opus 5 по одному из трех критериев.

Согласно одному из технических описаний, опубликованных в интернете, механизм, лежащий в основе этой модели, основан на аргументе о распределении ресурсов, а не на заявлении о возможностях. «Вы платите за дешевую модель при каждом каскадном запросе», — написал на X Аван Фарз, разработчик, проанализировавший опубликованные результаты HydraFusion. Более дорогая модель, согласно анализу Фарза, работает только с подмножеством задач, не прошедших проверку качества.

Не все реакции на запуск воспринимали разделение результатов бенчмарка как оговорку. «Выбор модели ИИ перестал быть просто решением. Он стал деталью реализации», — написал Мартин Шермент, комментатор по вопросам ИИ, на X. Шермент представил релиз как доказательство того, что выбор модели для каждой задачи становится скорее инфраструктурным, чем самостоятельным решением.

Разрыв между маркетинговыми данными и результатами сравнительных тестов не является уникальной особенностью GitHub.

Маршрутизация моделей — это не новость, на самом деле у GitHub уже есть собственная функция маршрутизации моделей, называемая автоматическим режимом, которая была запущена ранее в этом году.

Родригес отметил, что автоматический выбор модели и HydraFusion работают на разных уровнях.

Он пояснил, что Auto определяет, какая отдельная модель лучше всего подходит для решения задачи, в то время как HydraFusion ищет наилучшее сочетание моделей и этапов выполнения, которое обеспечит наилучший результат для данной задачи.

«На практике Auto — это интеллектуальный выбор модели, а HydraFusion — это организация рабочего процесса», — сказал Родригес. «В HydraFusion система может определить, что одной модели достаточно, или же она может использовать одну черновую модель, другую — для независимой оценки работы, или же перейти к более совершенной модели, если первая попытка не соответствует требованиям качества. Мы рассматриваем эти возможности как взаимодополняющие и оцениваем возможность интеграции HydraFusion с Auto».

Помимо возможностей самого GitHub, тот же разрыв между качественным маркетингом и качественными эталонными показателями наблюдается и в других областях рынка маршрутизации. Nvidia NeMo Switchyard, выпущенный в августе вместе с моделью Nemotron 3.5 Lightning, позиционируется как устройство, обеспечивающее точность на уровне передовых технологий, при этом снижая затраты на выполнение задач примерно до трети от затрат на выполнение только Claude Opus 4.8. Однако наиболее подробный внешний тест, опубликованный Nvidia — от LangChain, проведенный на 145 многоходовых задачах — показывает реальную цену: маршрутизация всего 7% вызовов к передовой модели сократила затраты на 74%, при этом потеряв измеримую долю точности по сравнению с базовым показателем, основанным только на передовой модели.

В собственных данных OpenRouter наблюдается аналогичная разница. Новый маршрутизатор Auto, выпущенный компанией в августе, позиционируется как превосходящий своего предшественника «по широкому спектру задач и ценовым уровням». Опубликованная таблица результатов тестов подтверждает это в трех из пяти категорий и показывает, что в двух других категориях он уступает старому маршрутизатору: MMLU Pro (85,2% против 86,6%) и τ³-bench Banking (20,6% против 21,0%).

Что это значит для предприятий

Для инженерных групп, оценивающих агентов кодирования, HydraFusion является сигналом того, что управление затратами перемещается внутрь уровня модели, а не остается отдельным инфраструктурным решением.

На данный момент HydraFusion применима только к задачам кодирования на первом этапе с одним запросом, а многоэтапная оркестрация все еще находится в разработке, согласно GitHub. Предприятия, оценивающие агентов кодирования исключительно по качеству, уже упускают половину того, на что сейчас оптимизируют поставщиков.

Для команд, оценивающих HydraFusion или любой другой подобный инструмент маршрутизации, таблица результатов тестов является ключевым моментом. Собственные данные GitHub показывают снижение стоимости во всех тестах и сохранение качества в одном из них. Стоит ознакомиться с этой разницей до того, как читать рекламные тексты.

Опрос по корпоративной агентской оркестрации

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Компания Arm запускает платформу Total Design for Physical AI and Robotics. Новости робототехники Система Cybercab от Tesla запущена, и уже проводится расследование. Новости робототехники Почему искусственный интеллект является безопасностью рабочей площадки Новости робототехники Сегодня ночью украинские БЭКи атаковали район Геленджика, рядом с Новороссийском Архив рубрики ~Обо всем~ Лидеры в области качества предостерегают от оцифровки неэффективных процессов. Архив рубрики ~Обо всем~ Огромный декагон сформировался вокруг южного полюса Сатурна. Атмосферная волна появилась недавно Новости робототехники Датчики давления могут повысить точность захвата роботов. Новости робототехники Компания Poseidon Aerospace привлекла 60 миллионов долларов перед первым испытательным полетом без пилота. Архив рубрики ~Коротко из Telegram~ Телевизоры LG могут следить за тем, что происходит у вас… Архив рубрики ~Коротко из Telegram~ Крошечная open‑source‑модель MiniCPM5-2B обошла конкурентов до 4B параметров ⚡ Канал… Архив рубрики ~Коротко из Telegram~ Бесплатная обработка голоса в аудио Если записываешь голос на встроенный… Архив рубрики ~Обо всем~ Конец универсального диагноза болезни Паркинсона: почему 2026 год станет годом, когда неврология перейдет на высокоточное исследование. Архив рубрики ~Коротко из Telegram~ Дата-центр Stargate в Абилине назвали «местом рождения AGI» Глава Crusoe… Архив рубрики ~Коротко из Telegram~ Небольшой дайджест — коротко о найденных новостях 1️⃣ Российский облачный… Новости робототехники Компания Arm запускает платформу Total Design for Physical AI and Robotics. Новости робототехники Система Cybercab от Tesla запущена, и уже проводится расследование. Новости робототехники Почему искусственный интеллект является безопасностью рабочей площадки Новости робототехники Сегодня ночью украинские БЭКи атаковали район Геленджика, рядом с Новороссийском Архив рубрики ~Обо всем~ Лидеры в области качества предостерегают от оцифровки неэффективных процессов. Архив рубрики ~Обо всем~ Огромный декагон сформировался вокруг южного полюса Сатурна. Атмосферная волна появилась недавно Новости робототехники Датчики давления могут повысить точность захвата роботов. Новости робототехники Компания Poseidon Aerospace привлекла 60 миллионов долларов перед первым испытательным полетом без пилота. Архив рубрики ~Коротко из Telegram~ Телевизоры LG могут следить за тем, что происходит у вас… Архив рубрики ~Коротко из Telegram~ Крошечная open‑source‑модель MiniCPM5-2B обошла конкурентов до 4B параметров ⚡ Канал… Архив рубрики ~Коротко из Telegram~ Бесплатная обработка голоса в аудио Если записываешь голос на встроенный… Архив рубрики ~Обо всем~ Конец универсального диагноза болезни Паркинсона: почему 2026 год станет годом, когда неврология перейдет на высокоточное исследование. Архив рубрики ~Коротко из Telegram~ Дата-центр Stargate в Абилине назвали «местом рождения AGI» Глава Crusoe… Архив рубрики ~Коротко из Telegram~ Небольшой дайджест — коротко о найденных новостях 1️⃣ Российский облачный…

Оставить комментарий