Архив рубрики ~Лента новостей~

Как роботы начинают учиться гораздо быстрее

Как роботы начинают учиться гораздо быстрее
c0e99c27842075e303defdab0fa5f41b

Уже давно робототехника жила по следующим принципам: мы строили карту мира, решали обратную кинематику, настраивали регуляторы, а потом всё снова, когда менялась задача или робот. Это работает в стерильных условиях, но ломается в реальности с шумными сенсорами, контактами и мягкими материалами. Исследователи из Оксфорда предлагают другой путь: когда мир переусложнён для ручного описания объектов, статистика и большие датасеты помогают обобщать мир быстрее и шире.

Почему традиционный стек хрупок и плохо масштабируется

Что именно сделали исследователи

Сердце системы — открытая библиотека lerobot от Hugging Face. Она объединяет низкоуровневое управление реальными роботами, стандартизированный формат данных, быстрые реализации методов RL и имитации, а также удобные скрипты для экспериментов и инференса.

lerobot — вертикально интегрированная библиотека для обучения роботов в реальном мире

Авторы не переписывают учебники по управлению роботами и глубокому обучению. Вместо этого они показывают, почему идеи обучения на данных и новые модели действий сходятся именно сейчас: от простых контроллеров для одной задачи к универсальным, языково-условным политикам, работающим на разных роботах.

Данные как топливо

LeRobotDataset — единый формат мультимодальных временных рядов с сенсорикой, моторикой, многокамерным видео и метаданными задач. Он экономно хранит табличные фичи и видео, умеет стримить с Hugging Face Hub без большой RAM, поддерживает оконную выборку истории для политик. То есть можно записать телепоуправление, тут же собрать датасет и запустить обучение, не возясь с разнородными файлами.

Как выглядят реальные записи: приводы, проприоцепция и видео сцены
Пары наблюдение–действие из демонстраций: база для имитационного обучения

Когда пробовать и ошибаться к месту

Обучение с подкреплением описывает управление как диалог агента со средой. В робототехнике оно привлекательно тем, что позволяет учить политику напрямую по взаимодействиям, без явной модели динамики. Но есть два камня преткновения — безопасность и эффективность. На железе каждая неудачная попытка стоит времени и ресурса.

Авторы показывают, как смягчить эти ограничения:

  • off-policy RL и схемы offline-to-online бережно используют собранные сценарии;

  • классификаторы вознаграждения по примерам успеха/неуспеха заменяют сложную ручную разметку наград;

  • человек может точечно подправлять действия, а система учится быстрее.

Две типичные задачи RL: манипуляция и локомоция
HIL-SERL: ускоренное RL на реальном роботе с вмешательством человека
Архитектура актор–обучатель: надёжное исполнение и параллельное обучение

В результате появляется практичный пайплайн: учим классификатор награды на открытом датасете, запускаем обучение с подкреплением, добавляем пользовательские вмешательства и смешиваем офлайн и онлайн данные. В работах авторов такой подход выводит сложные манипуляции к почти идеальному успеху за 1–2 часа на доступной платформе.

Когда лучше повторять за экспертом

Имитационное обучение снимает ещё два барьера: не нужны симуляторы и проектирование награды. Но простая регрессия действий ломается на мультимодальных демонстрациях и накапливает ошибки. Потому исследователи делают акцент на генеративные политики: диффузионные модели, потоки и трансформеры. Они восстанавливают фрагменты действий по наблюдениям и устойчивее держатся в реальном мире.

Diffusion Policy: условная денойзинг‑генерация пачки действий
ACT: трансформер, предсказывающий действия кусками для стабильности

Следующий шаг — универсальные модели. Здесь авторы сопоставляют современные решения: SmolVLA учится на миллионах разнородных демонстраций, используют текстовые инструкции и зрение, а действия восстанавливают через flow matching. Интересно то, что такие модели переносятся между задачами и роботами, не теряя в качестве.

SmolVLA: компактная VLA‑архитектура с flow matching

Что это даёт на практике

В обзоре есть готовые скрипты для записи данных с робота, создания датасета, обучения классификатора вознаграждения, запуск RL с актором и обучателем, а также быстрый старт для имитации на открытых наборах. Встроенный стриминг с Hugging Face даёт десятки итераций в секунду без копания в хранилищах, а унифицированный API снижает порог входа для лабораторий без дорогих манипуляторов. В итоге можно быстрее превращать свои идеи в работающие политики.

Итак, робототехника вступает в фазу, где интеллект перестаёт быть результатом точных уравнений — и становится свойством данных и архитектур. Это поворотный момент от ручной настройки к самообучающимся системам.

Роботам нужен не один идеальный алгоритм, а связанный набор инструментов: стандартизованные данные, безопасные и эффективные методы RL, сильные генеративные модели для имитации и удобная инфраструктура. Чем больше мы делимся данными и кодом, тем быстрее появятся универсальные, языково‑условные политики, которые уверенно работают на разных задачах и платформах.

📜 Полная статья

💾 Код

***

Если вам интересна тема ИИ, подписывайтесь на мой Telegram‑канал — там я регулярно делюсь инсайтами по внедрению ИИ в бизнес, запуску ИИ-стартапов и объясняю, как работают все эти ИИ-чудеса.

Источник: habr.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Соучредитель Uber привлек $1,7 млрд для нового робототехнического стартапа ATOMS Новости робототехники [Перевод] В Корее произошла первая в мире забастовка против использования гуманоидных роботов на производстве Новости робототехники Украинские беспилотники доставляют роботов непосредственно в зону боевых действий по морю и воздуху. Новости робототехники AMD представила модуль Kria для управления в кратчайшие сроки и унифицированную память для роботов. Архив рубрики ~Коротко из Telegram~ Создатель Twitter Джек Дорси выпустил аналог Discord и Slack —… Новости робототехники Роботакси Tesla движутся в обратном направлении. Архив рубрики ~Обо всем~ Вы умеете читать чужие мысли. Но наука уже 50 лет не может понять как Архив рубрики ~Обо всем~ Ложечка кваркового супа. Об истинных и возможных свойствах кварк-глюонной плазмы Архив рубрики ~Коротко из Telegram~ сегодня в интернетах все ждут подключение GPT-5.6 к cerebras со… Архив рубрики ~Коротко из Telegram~ Учёные нашли математический способ отличать настоящее искусство от изображений,… Архив рубрики ~Коротко из Telegram~ Samsung законтрил будущий iPhone Ultra — корейцы представили аж… Архив рубрики ~Коротко из Telegram~ ИИ-агентам выдали бесконечную память — вышел Obsidian Mind, который создаёт… Архив рубрики ~Коротко из Telegram~ OpenAI обновила свой сборник юзкейсов для Codex — теперь… Архив рубрики ~Коротко из Telegram~ Anthropic запустила самую мощную и дешевую в мире команду… Новости робототехники Соучредитель Uber привлек $1,7 млрд для нового робототехнического стартапа ATOMS Новости робототехники [Перевод] В Корее произошла первая в мире забастовка против использования гуманоидных роботов на производстве Новости робототехники Украинские беспилотники доставляют роботов непосредственно в зону боевых действий по морю и воздуху. Новости робототехники AMD представила модуль Kria для управления в кратчайшие сроки и унифицированную память для роботов. Архив рубрики ~Коротко из Telegram~ Создатель Twitter Джек Дорси выпустил аналог Discord и Slack —… Новости робототехники Роботакси Tesla движутся в обратном направлении. Архив рубрики ~Обо всем~ Вы умеете читать чужие мысли. Но наука уже 50 лет не может понять как Архив рубрики ~Обо всем~ Ложечка кваркового супа. Об истинных и возможных свойствах кварк-глюонной плазмы Архив рубрики ~Коротко из Telegram~ сегодня в интернетах все ждут подключение GPT-5.6 к cerebras со… Архив рубрики ~Коротко из Telegram~ Учёные нашли математический способ отличать настоящее искусство от изображений,… Архив рубрики ~Коротко из Telegram~ Samsung законтрил будущий iPhone Ultra — корейцы представили аж… Архив рубрики ~Коротко из Telegram~ ИИ-агентам выдали бесконечную память — вышел Obsidian Mind, который создаёт… Архив рубрики ~Коротко из Telegram~ OpenAI обновила свой сборник юзкейсов для Codex — теперь… Архив рубрики ~Коротко из Telegram~ Anthropic запустила самую мощную и дешевую в мире команду…