Архив рубрики ~Лента новостей~

Как роботы начинают учиться гораздо быстрее

Как роботы начинают учиться гораздо быстрее
c0e99c27842075e303defdab0fa5f41b

Уже давно робототехника жила по следующим принципам: мы строили карту мира, решали обратную кинематику, настраивали регуляторы, а потом всё снова, когда менялась задача или робот. Это работает в стерильных условиях, но ломается в реальности с шумными сенсорами, контактами и мягкими материалами. Исследователи из Оксфорда предлагают другой путь: когда мир переусложнён для ручного описания объектов, статистика и большие датасеты помогают обобщать мир быстрее и шире.

Почему традиционный стек хрупок и плохо масштабируется
Почему традиционный стек хрупок и плохо масштабируется

Что именно сделали исследователи

Сердце системы — открытая библиотека lerobot от Hugging Face. Она объединяет низкоуровневое управление реальными роботами, стандартизированный формат данных, быстрые реализации методов RL и имитации, а также удобные скрипты для экспериментов и инференса.

lerobot — вертикально интегрированная библиотека для обучения роботов в реальном мире
lerobot — вертикально интегрированная библиотека для обучения роботов в реальном мире

Авторы не переписывают учебники по управлению роботами и глубокому обучению. Вместо этого они показывают, почему идеи обучения на данных и новые модели действий сходятся именно сейчас: от простых контроллеров для одной задачи к универсальным, языково-условным политикам, работающим на разных роботах.

Данные как топливо

LeRobotDataset — единый формат мультимодальных временных рядов с сенсорикой, моторикой, многокамерным видео и метаданными задач. Он экономно хранит табличные фичи и видео, умеет стримить с Hugging Face Hub без большой RAM, поддерживает оконную выборку истории для политик. То есть можно записать телепоуправление, тут же собрать датасет и запустить обучение, не возясь с разнородными файлами.

Как выглядят реальные записи: приводы, проприоцепция и видео сцены
Как выглядят реальные записи: приводы, проприоцепция и видео сцены
Пары наблюдение–действие из демонстраций: база для имитационного обучения
Пары наблюдение–действие из демонстраций: база для имитационного обучения

Когда пробовать и ошибаться к месту

Обучение с подкреплением описывает управление как диалог агента со средой. В робототехнике оно привлекательно тем, что позволяет учить политику напрямую по взаимодействиям, без явной модели динамики. Но есть два камня преткновения — безопасность и эффективность. На железе каждая неудачная попытка стоит времени и ресурса.

Авторы показывают, как смягчить эти ограничения:

  • off-policy RL и схемы offline-to-online бережно используют собранные сценарии;

  • классификаторы вознаграждения по примерам успеха/неуспеха заменяют сложную ручную разметку наград;

  • человек может точечно подправлять действия, а система учится быстрее.

Две типичные задачи RL: манипуляция и локомоция
Две типичные задачи RL: манипуляция и локомоция
HIL-SERL: ускоренное RL на реальном роботе с вмешательством человека
HIL-SERL: ускоренное RL на реальном роботе с вмешательством человека
Архитектура актор–обучатель: надёжное исполнение и параллельное обучение
Архитектура актор–обучатель: надёжное исполнение и параллельное обучение

В результате появляется практичный пайплайн: учим классификатор награды на открытом датасете, запускаем обучение с подкреплением, добавляем пользовательские вмешательства и смешиваем офлайн и онлайн данные. В работах авторов такой подход выводит сложные манипуляции к почти идеальному успеху за 1–2 часа на доступной платформе.

Когда лучше повторять за экспертом

Имитационное обучение снимает ещё два барьера: не нужны симуляторы и проектирование награды. Но простая регрессия действий ломается на мультимодальных демонстрациях и накапливает ошибки. Потому исследователи делают акцент на генеративные политики: диффузионные модели, потоки и трансформеры. Они восстанавливают фрагменты действий по наблюдениям и устойчивее держатся в реальном мире.

Diffusion Policy: условная денойзинг‑генерация пачки действий
Diffusion Policy: условная денойзинг‑генерация пачки действий
ACT: трансформер, предсказывающий действия кусками для стабильности
ACT: трансформер, предсказывающий действия кусками для стабильности

Следующий шаг — универсальные модели. Здесь авторы сопоставляют современные решения: SmolVLA учится на миллионах разнородных демонстраций, используют текстовые инструкции и зрение, а действия восстанавливают через flow matching. Интересно то, что такие модели переносятся между задачами и роботами, не теряя в качестве.

SmolVLA: компактная VLA‑архитектура с flow matching
SmolVLA: компактная VLA‑архитектура с flow matching

Что это даёт на практике

В обзоре есть готовые скрипты для записи данных с робота, создания датасета, обучения классификатора вознаграждения, запуск RL с актором и обучателем, а также быстрый старт для имитации на открытых наборах. Встроенный стриминг с Hugging Face даёт десятки итераций в секунду без копания в хранилищах, а унифицированный API снижает порог входа для лабораторий без дорогих манипуляторов. В итоге можно быстрее превращать свои идеи в работающие политики.

Итак, робототехника вступает в фазу, где интеллект перестаёт быть результатом точных уравнений — и становится свойством данных и архитектур. Это поворотный момент от ручной настройки к самообучающимся системам.

Роботам нужен не один идеальный алгоритм, а связанный набор инструментов: стандартизованные данные, безопасные и эффективные методы RL, сильные генеративные модели для имитации и удобная инфраструктура. Чем больше мы делимся данными и кодом, тем быстрее появятся универсальные, языково‑условные политики, которые уверенно работают на разных задачах и платформах.

📜 Полная статья

💾 Код

***

Если вам интересна тема ИИ, подписывайтесь на мой Telegram‑канал — там я регулярно делюсь инсайтами по внедрению ИИ в бизнес, запуску ИИ-стартапов и объясняю, как работают все эти ИИ-чудеса.

Источник: habr.com

❌ Нет тегов для этой статьи

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Этот робот НАДЕРЁТ ЗАД любому — китайская Unitree показала первого… Архив рубрики ~Коротко из Telegram~ Проверяем ПК на СКРЫТЫЕ МАЙНЕРЫ — в сети выкатили… Архив рубрики ~Коротко из Telegram~ Runway показала GWM Worlds 2 — генеративное видео превращается в… Архив рубрики ~Коротко из Telegram~ OpenAI запустила детектор ИИ-текстов OpenAI представила AI Text Classifier —… Архив рубрики ~Коротко из Telegram~ GPT-6 уже называют самой близкой к AGI моделью OpenAI Новая… Архив рубрики ~Коротко из Telegram~ Suno закручивает гайки после сделки с Warner На бесплатном аккаунте… Архив рубрики ~Коротко из Telegram~ Abliteration AI продаёт модель, которая почти не умеет отказывать Стартап… Архив рубрики ~Обо всем~ Компания Human Longevity запускает проект по исследованию всего генома стоимостью 600 долларов. Архив рубрики ~Обо всем~ Бесконечная овечка. Что мы узнали о клонировании за 30 лет Архив рубрики ~Обо всем~ «Договориться можно обо всем»: Кеннеди писал не про уступки…. Архив рубрики ~Коротко из Telegram~ Новости недели Регуляторные решения в ЕС, крупная кибербезопасностная инициатива OpenAI… Архив рубрики ~Коротко из Telegram~ GPT-6 вышла Делюсь первыми независимыми тестами от Artificial Analysis, которые… Архив рубрики ~Коротко из Telegram~ Как финтех-гигант внедрил Runway в свой маркетинг Американский необанк Chime… Архив рубрики ~Коротко из Telegram~ По данным Reuters, Meta Platforms (признанная в России экстремистской организацией,… Новости робототехники Этот робот НАДЕРЁТ ЗАД любому — китайская Unitree показала первого… Архив рубрики ~Коротко из Telegram~ Проверяем ПК на СКРЫТЫЕ МАЙНЕРЫ — в сети выкатили… Архив рубрики ~Коротко из Telegram~ Runway показала GWM Worlds 2 — генеративное видео превращается в… Архив рубрики ~Коротко из Telegram~ OpenAI запустила детектор ИИ-текстов OpenAI представила AI Text Classifier —… Архив рубрики ~Коротко из Telegram~ GPT-6 уже называют самой близкой к AGI моделью OpenAI Новая… Архив рубрики ~Коротко из Telegram~ Suno закручивает гайки после сделки с Warner На бесплатном аккаунте… Архив рубрики ~Коротко из Telegram~ Abliteration AI продаёт модель, которая почти не умеет отказывать Стартап… Архив рубрики ~Обо всем~ Компания Human Longevity запускает проект по исследованию всего генома стоимостью 600 долларов. Архив рубрики ~Обо всем~ Бесконечная овечка. Что мы узнали о клонировании за 30 лет Архив рубрики ~Обо всем~ «Договориться можно обо всем»: Кеннеди писал не про уступки…. Архив рубрики ~Коротко из Telegram~ Новости недели Регуляторные решения в ЕС, крупная кибербезопасностная инициатива OpenAI… Архив рубрики ~Коротко из Telegram~ GPT-6 вышла Делюсь первыми независимыми тестами от Artificial Analysis, которые… Архив рубрики ~Коротко из Telegram~ Как финтех-гигант внедрил Runway в свой маркетинг Американский необанк Chime… Архив рубрики ~Коротко из Telegram~ По данным Reuters, Meta Platforms (признанная в России экстремистской организацией,…