Как избежать телеоперации ловушки при разработке робототехники
Flexion обучение с подкреплением и симуляционной платформой моделей для роботов-гуоидманов. Источник: Сгибание
За последние 18 месяцев компания по производству гуманоидных роботов собрала миллиарды долларов, большая часть которых незаметно финансирует найм людей для управления роботами. Это означает, что в индустрии робототехники существуют проблемы телеопераций и данных, которые она продолжает описывать как трудовое решение.
Телеоперации и масштабные поставки с привлечением людей начали проводить методы обучения физическим системам искусственного интеллекта, привлекая серьезный капитал, наибольшую рабочую силу в странах с более низкой заработной платой и получением восторженных репортажей в качестве свидетельств прогресса. В основе всего этого лежит предположение, что достаточное количество демонстраций в конечном итоге привело к созданию роботов, способных к обобщению в исходных условиях.
Я считаю, что это предположение имеет гораздо большее внимание, чем оно есть.
Телеоперация натыкается на структурную стену
Языковые модели, изученные на текстах, могут быть основаны на поэтической деятельности, статьях и книгах. У роботов нет архива, из которого можно было бы уничтожить информацию – кто-то должен создавать каждую демонстрацию, а это означает, что данные могут расти только настолько быстро, что сегодня позволяет человеческий труд.
Наборы данных телеопераций более чем в 100 000 раз меньше тех, которые используются для изучения сегодняшним моделям языка и зрения. Этот разрыв не используется для расчета найма большего количества операторов, потому что реальный мир никогда не перестает меняться: полка переключается, дверная ручка немного меняется, и на линии появляется новый тип упаковки. Каждый требует нового варианта развития, а это означает, что проблема развивается быстрее, чем могут сделать сотрудники.
Качество данных – это другая проблема. Операторы не могут почувствовать то, что прикасается, или надежно оценить направление, поэтому они двигаются медленно и слишком корректно. Это робот заставляет изучать кадры, где кто-то борется с контроллером, и в конечном итоге именно это он и практикует.
Сохранить таблички для RoboBusiness 2026
Человеческая цена генерации данных
Ответная область проблемы с данными стала набором большего количества людей, исключительно работающих в странах с более низкой заработной платой, нанятых для съемок домашних дел, удаленного управления роботами или передвижения по объектам с использованием фотоаппаратов.
Вокруг него возникла целая коммерческая экосистема: стартапы в Китае, Индии, Европе и США продают данные телеопераций точно так же, как компании когда-то предоставляют размеченный текст для языковых моделей.
Первоначальная идея гуманоидных роботов завершилась в том, что люди не смогут заполнить эти рабочие места в будущем из-за демографических смен, нехватки рабочей силы и старения населения. Но если то, что мы на самом деле строим, — это инфраструктура, для изменения которой необходим постоянный поток человеческих демонстраций, тогда мы могли бы с тем же успехом поручить эту задачу людям напрямую.
Система, которая не может перейти с чем-то нового без свежего человеческого вклада, по сути, является просто системой труда.
Удобная защита для улучшения робототехникич2>
Стандартный ответ заключается в том, что телеоперация — это мост, способ начать работу, пока более эффективные методы обучения моделей роботов не отстают. Для узких, повторяющихся задач в контролируемых средах это справедливо.
Но на самом деле большая часть территории строит инфраструктуру для проведения демонстраций на неопределенный срок, без четкого объяснения того, как и когда это меняется.
В поле отслеживается то, что легко подсчитать – собранные элементы, записанные часы видеозаписи, задачи, выполненные в контролируемых условиях – ничто из этого не говорит вам, сможете ли робот перенести с чем-то, чего он раньше не видел, в месте, которое не было для этого подготовлено. Увеличение количества таких же работников усугубляет эту зависимость от людей, а не решает ее.
Flexion’Стек полной автономности включает в себя командный уровень, уровень движения и уровень управления. Источник: Сгибание
Путь, соответствующая задача
Когда исследователи обучили ранние языковые модели в огромных объемах текста, получили системы, которые могли в некоторой степени имитировать стиль Шекспира, но производили слова, которые не имели смысла. С первого взгляда впечатляет, но пока не научился рассуждать.
Прорыв произошел благодаря обучению с подкреплениями в синтетической среде, в результате чего были созданы системы, способные рассуждать, кодировать и побеждать в роли лидеров.
Индустрия робототехники в большей части застряла на этом раннем этапе. Масштабирование данных телеопераций эквивалентно масштабированию текста перед обучением с использованием в 100 000 раз меньшего количества данных. Вы реально роботов, которые немного двигают руками, иногда что-то хватают, иногда нет. Они могут смутно имитировать то, что показал им человек-оператор, но они не могут рассуждать в ситуации, которую они раньше не видели.
Существуют подходы, которые позволяют управлять дистанционным управлением и полной автономностью – эгоцентричным захватом видео и такими устройствами, как универсальный интерфейс манипуляции (UMI), который позволяет использовать более естественно традиционные задачи, наводить ручной захват, не управляя роботом удаленно.
Эти методы снижают нагрузку на операторов и создают более естественные данные о движении. Они по-прежнему требуют участия людей, но они менее агрессивны и для узких, четко определяющие задачи могут быть назначены Трамплином. Тем не менее, они не соблюдают полную свободу развития.
Обучение с поддержанием — вот что меняет ситуацию. Вместо того, чтобы имитировать то, что показал человек-оператор, система, обученная с помощью RL, все определяют метод проб и ошибок: пробуйте выбирать задачу, терпит неудачу, корректирует и повторяет через миллионы итераций, без участия человека.
Из этого следует таким образом моделирование; Выполнение миллионов итераций RL в первый раз в мире разрушает оборудование и занимает годы. В симуляциях вы мгновенно перезагружаетесь, работаете параллельно и постепенно меняете масштабы, с чем не может сравниться ни одна человеческая рабочая сила. В отличие от телеопераций, он масштабируется непосредственно с помощью компьютера; Чем больше графических процессоров, тем больше средних, больше вариаций и более быстрая итерация.
Люди, выполняющие телеоперации, зарабатывают так, чтобы знать, является ли автономия действительной целью, и то же самое делают люди, финансирующие эти проекты. Если у вас нет данных, показывающих, что зависимость со стороны людей со временем снижается, телеоперация переходит от временного метода к постоянному методу.
Об авторе
Никита Рудин — соучредитель и генеральный директор Flexion. Рудин защитил докторскую диссертацию. в лаборатории робототехнических систем в ETH Zurich, одновременно работая в NVIDIA, где он занимался крупномасштабным обучением с подкреплением, циклическим управлением и роботизированным моделированием.
В NVIDIA Рудин входил в команды разработчиков Isaac Gym и Isaac Lab — инструментов моделирования, которые сейчас широко используются в робототехнической индустрии. Сейчас он возглавляет Flexion, недавно привлек 50 миллионов долларов от DST/NVentures на создание универсального “brain” для роботов-гуманоидов.
п>
Пост «Как избежать ловушки телеоперации при разработке робототехники» впервые появился в The Robot Report.
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
