Искусственный интеллект создает виртуальные площадки, чтобы помочь роботам получить важные обучающие данные.
Роботы, идущие по улице в окружении изумленных прохожих, становятся все более распространенным зрением. Но эти машины пока еще не являются универсальными помощниками, которых вы хотели бы видеть на кухне или заводе, и основным узким местом является сбор данных. Как и люди, роботы лучше всего учатся на собственном опыте. Проблема заключается в том, что физическое обучение этих машин множеству действий в различных условиях требует больших трудозатрат и времени.
«Естественной идеей является использование моделирования в качестве тренировочной площадки. Хотя за последние несколько лет был достигнут значительный прогресс в физических механизмах, используемых в робототехнических симуляторах, одной из оставшихся проблем остается создание достаточно богатого и разнообразного контента для моделирования, способного отразить сложность реального мира», — говорит Расс Тедрейк, профессор электротехники и компьютерных наук (EECS), аэронавтики и космонавтики, а также машиностроения в Массачусетском технологическом институте (MIT) и ведущий исследователь в Лаборатории компьютерных наук и искусственного интеллекта (CSAIL) MIT.
Оказывается, агенты искусственного интеллекта, или полуавтономные программы, которые «думают» и выполняют четко определенные задачи, могут помочь в создании реалистичных виртуальных локаций, необходимых роботам. Новая система « SceneSmith », разработанная исследователями из MIT CSAIL и Toyota Research Institute, использует трех агентов для воссоздания объектов, стен и общего вида трехмерной сцены. Ее воссозданные интерьеры, такие как рестораны, спальни и отели, более реалистичны и детализированы, чем в предыдущих системах, что помогает роботам оттачивать навыки и пробовать различные способы выполнения задач, прежде чем их включат. В свою очередь, инженеры экономят время на тестировании в реальных условиях.
Агенты обладают представлением о том, как должны выглядеть обычные места, поскольку каждый из них обращается к мультимодальной системе, называемой визуально-языковой моделью (ВЛМ) , а именно к современной ВЛМ GPT-5.2 . Она обучена на большом количестве текста и изображений из интернета для обработки визуальных подсказок. Эта продвинутая модель дает каждому агенту своего рода пространственные знания: сначала агент-«дизайнер» генерирует элементы сцены, затем «критик» дает совет, выглядит ли она реалистично, и, наконец, «оркестратор» управляет их обменом информацией, решая, когда дизайн завершен. Как только три ВЛМ завершают свое творческое сотрудничество, сцена готова к загрузке непосредственно в программное обеспечение для физического моделирования.
«Мы обнаружили, что система может создавать 3D-сцены так же, как это сделал бы человек-дизайнер», — говорит Николас Пфафф, аспирант кафедры электротехники и информатики Массачусетского технологического института, исследователь CSAIL и ведущий автор статьи, опубликованной на препринт-сервере arXiv , где работу представил Тедрейк. «Мы создали более 1300 сцен, используя ведущую модель VLM с априорными знаниями интернет-масштаба, и она создала невероятно креативные и разнообразные композиции. Я не обучал систему этому в заданиях; она просто импровизировала».
Поговори с моим агентом
Благодаря агентам VLM, вы можете попросить SceneSmith сделать что-то вроде «сгенерировать гараж с машиной, верстаком, шинами, сложенными в углу, и лестницей у стены», и получить виртуальную игровую площадку, богатую объектами, с которыми робот может повозиться. Эти комнаты украшены в шесть раз большим количеством предметов на сцену, чем при использовании предыдущих методов, что делает их отличным инструментом для обучения роботов таким навыкам, как поставить чашку в раковину, положить фрукты на тарелки и переместить банку газировки с полки на стол.
Благодаря множеству доступных виртуальных сред, вы можете оценить готовность вашего робота к работе без лишних проб и ошибок в реальном мире. Исследователи протестировали различные планы действий (также называемые «политиками») в цифровых мирах SceneSmith, сгенерировав при этом 100 уникальных пространств. Агент VLM оценивал каждую попытку и обнаружил, что планы робота были ошибочными, и машина часто не справлялась со своими задачами. Люди соглашались с выводами модели более чем в 99 процентах случаев, что может помочь робототехникам выявлять ошибочные подходы в симуляции до того, как робот начнет работать в реальном мире.
Но насколько реалистичны эти виртуальные миры на самом деле? Доказать это однозначно сложно, поэтому исследователи подошли к вопросу с нескольких сторон. Самый показательный тест: они поместили в сгенерированные среды предварительно обученную стратегию робота — контроллер ИИ, обученный в основном на реальных данных и никогда не видевший сцен SceneSmith. В одном из тестов пользователи сказали системе «взять яблоко из миски и положить его на разделочную доску», и смоделированный робот сделал именно это. Если бы сцены не были достаточно близки к реальным условиям, на которых обучалась стратегия, она бы просто не сработала.
Команда также дистанционно управляла роботами в виртуальном пространстве, направляя их к открытию шкафов, убиранию бутылок и перемещению между комнатами. Их эксперименты показали, что виртуальная среда выдерживает длительное физическое взаимодействие, выходя за рамки простого визуального осмотра.
За кулисами
Каждый из агентов, используемых SceneSmith, играет четко определенную роль в процессе генерации, поэтапно создавая сцены. По сути, они создают план помещения и воплощают его в жизнь.
Допустим, вы хотите создать сцену, похожую на первый этаж дома. «Дизайнер»-виртуальный моделировщик начинает с общей планировки, которую проверяет «критик», а затем «оркестратор» утверждает. Агенты повторяют этот подход на каждом этапе: добавляют мебель, размещают объекты на стенах, затем на потолке и, наконец, добавляют объекты, которыми могут манипулировать роботы. Например, виртуальные модели могут добавить шкафы, которые роботы могут открывать и закрывать — подвижный элемент, которого часто не было в предыдущих базовых версиях.
На каждом этапе второй виртуальный менеджер сцены (VLM) проверяет практичность сцены, например, советуя убрать ванну из гостиной. Третий виртуальный менеджер сцены обеспечивает создание высококачественной сцены, даже возвращаясь на несколько ходов назад, если визуальные эффекты не соответствуют требованиям. После завершения творческой работы трех виртуальных менеджеров сцены, механика физического мира добавляется с помощью программного обеспечения для моделирования.
Благодаря глубокому пониманию того, как должны выглядеть комнаты, где должны располагаться объекты и принципам физики реального мира, SceneSmith имеет заметное преимущество перед предыдущими методами. По сравнению с базовыми алгоритмами генерации сцен, такими как « HSM » и « Holodeck », SceneSmith создал окружения с большим количеством объектов, включая частный кабинет, гончарную мастерскую и даже игровую комнату в стиле Minecraft.
SceneSmith также пользовался популярностью среди более чем 200 пользователей. Они отметили, что визуальное оформление системы было более реалистичным более чем в 90% случаев. Кроме того, они заметили, что, в целом, система более точно следовала подсказкам, чем другие подходы. Другими словами, она лучше всего создавала виртуальные игровые площадки, которые пользователи действительно хотели видеть.
Система, объединяющая множество талантов.
Реализм, разнообразие и насыщенность — сильные стороны SceneSmith, даже когда речь идёт о создании отдельных 3D-объектов. Вы можете попросить программу создать передвижную тележку для еды, и она создаст 2D-изображение, которое затем преобразует в детализированную модель с физическими свойствами, такими как масса, трение и инерция.
Однако такой детальный процесс сопряжен с компромиссом в скорости. Создание одной сцены может занять несколько часов, поскольку агенты создают и тщательно изучают каждый объект. С увеличением вычислительной мощности система могла бы значительно повысить свою эффективность. Инженеры CSAIL также надеются расширить возможности системы, включив в нее деформируемые объекты (например, губки), если появятся обширные библиотеки 3D-моделей.
«SceneSmith представляет собой значительный шаг вперед в этом отношении, предоставляя агентную структуру для генерации готовых к моделированию внутренних помещений всего лишь на основе простой текстовой подсказки», — говорит Джереми Бинагия, специалист по прикладным наукам из Amazon Robotics, не участвовавший в исследовании. «Он продвигает передовые технологии несколькими способами, включая расширение пределов плотности объектов в моделируемой среде, обеспечение физической точности всех объектов (а не просто их визуальной реалистичности) и создание ресурсов, не ограниченных фиксированной библиотекой, поскольку их можно генерировать с помощью преобразования текста в 3D».
Похожие записи
- Искусственный интеллект меняет структуру рынка труда, и большинство моделей планирования к этому не готовы.
- Искусственный интеллект, призванный заменить работников Meta, совершил «масштабные, деструктивные действия».
- Искусственный интеллект, спортсмены и Кит Рабуа: StrictlyVC возвращается в Нью-Йорк 10 сентября.
Оцените материал:
Похожие записи
Девен Парекх из Insight Partners объясняет, почему компания диверсифицирует свой бизнес, в то время как все остальные делают ставку на OpenAI и Anthropic.
14.09.2026
Инженеры Делфтского технического университета создали дрон, который цепляется за ветки,…
13.09.2026
Немецкая компания Cubivan показала модульную конструкцию, которая выезжает из авто,…
13.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
