Маршрутизатор Switchyard от Nvidia перераспределяет модели ИИ в процессе выполнения задачи, сокращая затраты на выполнение задачи до одной трети, согласно собственным тестам компании.
Шон Майкл Кернер
Предприятия, использующие постоянно работающих ИИ-агентов, постоянно сталкиваются с одним и тем же компромиссом. Отправка каждой задачи на передовую модель приводит к быстрому росту затрат. Разработка собственной логики маршрутизации для отправки простых задач на более дешевые модели превращает это в отдельный инженерный проект, который необходимо поддерживать каждый раз при изменении рабочего процесса.
Nvidia предлагает решение, которое затрагивает обе стороны этой проблемы одновременно. Во вторник компания представила Nemotron 3.5 Lightning, открытую модель смешанного набора экспертов с 30 миллиардами параметров, разработанную для обработки больших объемов специализированных задач агентов, а также NeMo Switchyard, библиотеку с открытым исходным кодом, которая направляет каждый этап рабочего процесса агента к той модели, которая ему лучше всего подходит.
Основные показатели: по данным Nvidia, технология Lightning обеспечивает до 4 раз более высокую скорость работы, чем сопоставимые модели в своем классе, выполняя задачи агентов примерно на 30% быстрее, чем Qwen3.6-35B, при той же точности. В сочетании с Switchyard, как утверждает Nvidia, эта комбинация обеспечивает выполнение задач на уровне передовых технологий, при этом снижая затраты на тестирование примерно до трети от затрат на запуск Opus 4.8 в одиночку.
Время выхода Nvidia совпало с самым активным периодом внедрения открытых весовых коэффициентов в отрасли за последние месяцы. Alibaba, Moonshot, Zhipu и DeepSeek с весны выпустили конкурентоспособные открытые модели из Китая, некоторые из которых достигли или приблизились к передовым показателям производительности, при этом превосходя американские лаборатории по размеру или цене. Meta усилила это давление, выпустив собственную открытую агентскую модель с 30 миллиардами параметров, Muse Glimmer. Открытые весовые коэффициенты за считанные месяцы превратились из конкурентного преимущества в обязательное условие, и релиз Nvidia приходится на самый разгар этого сдвига, а не на его опережение.
Суть в правильном сочетании. Одна только модель не решает проблему стоимости, а маршрутизатор сам по себе не имеет эффективного способа маршрутизации. Nvidia делает ставку на то, что именно открытый исходный код, применяемый как на уровне модели, так и на уровне маршрутизации, действительно повлияет на снижение стоимости агентного ИИ, а не одна более дешевая модель и не более интеллектуальный маршрутизатор, добавленный к чьей-то чужой системе.
Реальными конкурентами Switchyard являются не другие открытые модели, а Not Diamond, которая уже используется в автоматическом режиме OpenRouter, и RouteLLM, платформа с открытым исходным кодом от Калифорнийского университета в Беркли и LMSYS. Ни одна из них не выпускает собственную модель. Nvidia делает ставку на то, что владение обеими сторонами решения под одной открытой лицензией — это то, чего не могут предложить конкуренты, выпускающие только маршрутизаторы или только модели.
«В этом и заключается сила системы моделей, которая подбирает подходящую модель для каждого этапа рабочего процесса», — заявила Кари Бриски, вице-президент по генеративному искусственному интеллекту в Nvidia, на брифинге.
Как маршрутизатор на самом деле меняет рабочий процесс
Модельная маршрутизация — не новая категория. OpenRouter, LiteLLM и несколько независимых стартапов, занимающихся маршрутизацией, уже позволяют разработчикам перенаправлять трафик между несколькими провайдерами. Switchyard интегрируется с несколькими из них, а не заменяет их полностью.
Основная проблема, которую решает Switchyard, заключается в том, что правильная модель меняется по мере того, как агент выполняет задачу. Состояние агента изменяется по мере того, как инструменты возвращают результаты, появляются ошибки или какой-либо шаг оказывается рутинным, а не сложным, и фиксированный выбор модели не может адаптироваться ни к чему из этого.
Бриски описал стратегии маршрутизации, которые реагируют на это изменяющееся состояние, а не на статическую категорию задач.
«В нем много разных стратегий маршрутизации, — сказал Бриски. — Можно использовать случайный маршрутизатор, что не очень хорошо, или маршрут, основанный на состоянии агента, или маршрут, основанный на классификаторе. В зависимости от выбранной стратегии маршрутизации, он стремится выбрать наилучшую модель. В некоторых случаях для действительно эффективных задач лучше использовать модель, подобную Lightning, и маршрутизатор действительно выберет Lightning, если она включена в ваш пул моделей».
Стоимость напрямую влияет на решение о маршрутизации, а не рассматривается как дополнительный фактор. В ответ на вопрос VentureBeat Бриски сказал, что Switchyard может оценить многословность модели, то есть, сколько токенов данная модель обычно генерирует для задачи, и использовать этот прогноз, чтобы направить работу в сторону более дешевого варианта еще до принятия решения.
Проблема, которая мешает этому стать самостоятельным интеграционным проектом, заключается в том, где находится Switchyard. Nvidia разделила своих партнеров на две группы: агентские фреймворки, которые напрямую вызывают Switchyard, включая Cognition, LangChain и Nous Research, и шлюзы LLM, которые встроили поддержку Switchyard в свои собственные продукты, включая Kong, LiteLLM и OpenRouter. Kong поставляет Switchyard встроенным в Kong AI Gateway. Бриски упомянул тот же список партнеров-шлюзов, описывая, как библиотека вписывается в существующую экосистему маршрутизации.
«Мы ценим экосистему и хотим быть уверены в ее интеграции», — сказал Бриски. «Мы сотрудничаем с OpenRouter, LiteLLM и Kong, и они уже интегрировали наш алгоритм маршрутизации, так что вы можете начать использовать его там, где уже применяете лучшие инструменты».
Nvidia поделилась результатами тестирования Switchyard девятью компаниями, при этом некоторые из них предоставили конкретные цифры. LangChain сообщила о снижении затрат на 74% по 145 многоходовым задачам Deep Agents за счет перенаправления всего 7% вызовов на модель с более высокой точностью, при этом снижение точности составило 6%. Ramp заявила, что достигла производительности модели с более высокой точностью на Ramp SWE-Bench, снизив при этом затраты на 58% и время выполнения на 33%. Cognition интегрировала поэтапный маршрутизатор Switchyard в Devin Desktop для внутреннего использования и сообщила о производительности, близкой к производительности модели с более высокой точностью, на FrontierCode Main, снизив при этом средние затраты на 28% по сравнению с перенаправлением всех вызовов на одну модель с более высокой точностью.
Архитектурные и производительные преимущества Lightning.
Nemotron 3.5 Lightning — это самостоятельная открытая модель, разработанная для выполнения больших объемов специализированных задач, а не для общего использования.
Она расширяет гибридную архитектуру Mamba-Transformer, представляющую собой скрытую смесь экспертов, которую Nvidia представила в семействе Nemotron 3 в декабре 2025 года. Эта же линейка лежит в основе Nemotron 3 Super, который Nvidia использует в качестве базового уровня для Lightning в своих сравнениях после обучения. Размещенная в маршрутизирующей системе, такой как Switchyard, она создана для быстрого и недорогого решения, а не для передовых технологий, но работает и поставляется независимо от любого маршрутизатора.
Согласно индексу искусственного интеллекта (Artificial Analysis Intelligence Index), общему бенчмарку возможностей, охватывающему девять оценок, Lightning набирает 24 балла, что соответствует показателю gpt-oss-120b и уступает Nemotron 3 Super, Gemma 4 31B, Claude 4.5 Haiku и Mistral Medium 3.5, у которых по 30 баллов. Lightning не является лидером по общему интеллекту в своем классе, и Nvidia не утверждает обратного.
Фактически, утверждение более узкое: согласно данным PinchBench, предоставленным Nvidia, Lightning достигает точности Qwen3.6-35B примерно на 30% быстрее и превосходит точность Gemma 4 26B при аналогичном времени выполнения в PinchBench, реальном тесте производительности агентов, охватывающем программирование, исследования и управление файлами. Это компромисс между скоростью и точностью, а не преимущество в производительности.

По словам Nvidia, наибольший прирост производительности наблюдается после обучения. Компания поделилась данными «до» и «после» от четырех партнеров, получивших ранний доступ: CrowdStrike — обнаружение вредоносного контента на основе базовой модели Nemotron 3 Super, CodeRabbit — маршрутизатор кода на основе базовой модели GPT 5.4 Nano, Harvey и Trajectory — выполнение юридических задач на основе базовой модели Opus 4.6, и Lila Sciences — моделирование энергопотребления на основе базовой модели Opus 4.8. Наиболее показательным является пример CodeRabbit: Nvidia утверждает, что стандартный алгоритм модели NeMo Auto, обученный в течение одной эпохи, был интегрирован в работающий агент маршрутизатора стоимостью 85 долларов примерно за два часа.

Что это значит для предприятий
На растущем рынке открытых моделей нет недостатка в конкурентоспособных предложениях. Новая версия Nemotron Lightning станет еще одним вариантом, который стоит рассмотреть организациям.
Что касается моделей, то в собственном сравнительном анализе Lightning в качестве прямой точки сравнения выбрана модель Qwen3.6-35B. На прямой вопрос VentureBeat о том, как Lightning сравнивается с китайскими моделями в целом, Бриски не предложил прямого сравнения, указав вместо этого на открытость и возможность индивидуальной настройки как на отличительные черты.
«Наше ценностное предложение не просто открытое, оно очень гибко настраивается», — сказал Бриски.
Для предприятий, создающих агентскую инфраструктуру, выделяются три основные тенденции:
Решение о маршрутизации становится динамическим, а не статическим. Предприятия, которые строили конвейеры обработки запросов на основе единой модели по умолчанию, переходят к маршрутизации на каждом этапе на основе сигналов в реальном времени, таких как состояние агента и стоимость токена, а не на основе фиксированного назначения, установленного на этапе проектирования.
Теперь открытый исходный код используется для снижения затрат на двух уровнях, а не на одном. Сочетание открытой модели с открытым маршрутизатором, который контролируется поставщиком от начала до конца, — это более новый аргумент, чем просто более дешевые грузы, и стоит понаблюдать, последуют ли другие лаборатории той же схеме.
В конкурентной борьбе приоритет смещается от выбора лучшей модели к выбору лучшей системы. По мере развития библиотек маршрутизации, конкурентное преимущество смещается от модели, используемой предприятием по умолчанию, к тому, насколько хорошо слой маршрутизации сопоставляет модели с задачами в производственной среде, что становится сложнее оценить и сложнее вывести на рынок.
Источник: venturebeat.com
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
