Роботы получили локальный мозг. NVIDIA открыли Cosmos 3 Edge на 4 млрд параметров
NVIDIA выпустили Cosmos 3 Edge компактную открытую world model, созданную специально для роботов, беспилотных автомобилей и камер, которым некогда ждать ответа из облака.
Это не очередной чат-бот на четыре миллиарда параметров. Модель должна понимать, что происходит в физическом мире, прогнозировать последствия и сразу решать, какое действие выполнить дальше.
По сути, NVIDIA собрали локальный мозг для машин.
Увидел, подумал, сделал
Обычная модель компьютерного зрения умеет распознать предмет в кадре. Например, понять, что перед роботом лежит банан.
Cosmos 3 Edge идет дальше. Она определяет положение объекта, отслеживает движение манипулятора, прогнозирует момент контакта и выбирает действие, которое поможет успешно схватить банан и положить его на тарелку.
Одна модель умеет:
- Понимать происходящее на изображениях и видео.
- Прогнозировать, как сцена изменится через несколько секунд.
- Симулировать последствия действий.
- Восстанавливать действие по его результату.
- Генерировать команды для роботов и автономных систем.
На вход можно отправлять текст, изображения, видео и траектории действий. На выходе получать объяснения, новые кадры, прогноз развития сцены или готовые управляющие команды.
Настоящий ИИ на краю
Главная фишка Cosmos 3 Edge локальный запуск рядом с камерами и сенсорами.
Модель работает на NVIDIA Jetson, DGX, RTX PRO и обычных GeForce RTX. Отдельный reasoning-модуль на два миллиарда параметров, построенный на Nemotron, можно запускать даже на Jetson Orin с 8 ГБ памяти.
В режиме управления роботом Cosmos обрабатывает картинку в разрешении 640×360, генерирует сразу 32 действия за один проход и работает на частоте 15 Гц на Jetson Thor.
Для физического ИИ это критично. Если робот тянется к человеку, машина перестраивается в соседний ряд, а камера замечает падение рабочего на заводе, ждать похода запроса в дата-центр и обратно никто не будет.
Мозг должен находиться там же, где происходят события.
Два трансформера под одним капотом
Внутри Cosmos 3 Edge работают сразу две башни:
- Авторегрессионный трансформер отвечает за понимание изображения, текста и логические рассуждения.
- Диффузионный трансформер прогнозирует и генерирует видео, звук и действия.
Они используют разные механизмы генерации, но связаны общим мультимодальным вниманием.
Если перевести с языка исследователей на человеческий, одна половина модели отвечает на вопрос «что сейчас происходит», а вторая симулирует «что произойдет дальше, если я сделаю вот это».
Благодаря общей картине мира модель связывает пиксели с движением, физикой, пространством и управляющими командами.
Роботы, автопилоты и камеры с мозгами
NVIDIA выделяет три основных сценария.
Робототехника. Cosmos можно дообучить на собственных данных робота и превратить в локальную политику управления для манипуляторов, складских машин и гуманоидов.
Автономный транспорт. Модель понимает дорожные сцены, рассуждает о ситуации в трафике и прогнозирует намерения пешеходов, водителей и других участников движения.
Умная инфраструктура. Камеры на заводах, складах и дорогах смогут не просто фиксировать видео, а анализировать поток в реальном времени: замечать аварии, опасное поведение, нарушения техники безопасности и логистические проблемы.
По данным NVIDIA, среди открытых моделей сопоставимого размера Cosmos 3 Edge занимает первое место в VANTAGE-Bench по анализу реальных видеосцен.
NVIDIA открыли не только веса
Вместе с моделью опубликованы:
- Веса Cosmos 3 Edge.
- Код и конфигурации.
- Рецепты постобучения.
- Инструменты для адаптации под собственных роботов и датасеты.
- Версия Cosmos 3 Edge Policy, дообученная на наборе DROID для управления роботизированными манипуляторами.
Модель распространяется по лицензии OpenMDW 1.1 и разрешена для коммерческого и некоммерческого использования.
Главный сдвиг здесь даже не в рекорде очередного бенчмарка. До сих пор серьезный физический ИИ обычно требовал мощного сервера или постоянного подключения к облаку. NVIDIA пытаются уместить весь цикл «увидеть — понять — предсказать — действовать» непосредственно в устройство.
Теперь камера может рассуждать без отправки видео наружу, автомобиль — реагировать без задержки сети, а робот — самостоятельно представлять последствия своего следующего движения.
Похоже, после локальных языковых моделей начинается новая гонка, кто первым засунет полноценную модель мира в каждую машину, камеру и железную руку.
Доверили бы вы такой нейросети управлять автомобилем или роботом рядом с людьми?
Не отставайте от технологий! Подписывайтесь на Telegram-канал, чтобы быть в курсе последних трендов и лайфхаков.
Источник: vc.ru
Похожие записи
Оцените материал:
Похожие записи
Hyundai станет единственным владельцем Boston Dynamics Для этого компания выкупит…
16.07.2026
Кто тут хороший оператор? Mondo Robotics показала Beni — двухолёсного…
13.07.2026
Квартирный вопрос Чтобы робот ничего лишний раз не разгромил, учёные…
15.07.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
