AgentHands: Генерация интерактивных жестов рук для пространственно-ориентированных диалогов между агентами в XR.
AgentHands — это прототип XR-приложения на основе LLM, который дополняет разговорных агентов синхронизированными выразительными жестами рук, обеспечивая пространственно-ориентированное руководство, преодолевая разрыв в ментальном построении карт и повышая вовлеченность пользователя в выполнение физических задач.
Быстрые ссылки
- Бумага
- Делиться
- Скопировать ссылку ×
По мере того, как ИИ-помощники эволюционируют от простых текстовых интерфейсов к многомодальным компаньонам, мы наблюдаем сдвиг в сторону более проактивной, ситуативной помощи. Недавние инновации, такие как Project Astra и Gemini 3.1 Flash Live, уже позволяют пользователям обсуждать свое физическое окружение в режиме реального времени, часто используя визуальные ограничивающие рамки для идентификации объектов в видеопотоке с камеры. Хотя эти наложения очень эффективны для 2D-экранов, переход к иммерсивным платформам, таким как Android XR, представляет собой уникальную задачу: как нам выйти за рамки плоского пользовательского интерфейса и создать по-настоящему телесный, пространственно-ориентированный диалог?
Чтобы преодолеть этот разрыв, мы представляем AgentHands, опубликованный на CHI 2026, — исследовательский прототип, который переносит возможности жестов, синхронизированных с речью, в трехмерный мир. В человеческом общении наши руки делают больше, чем просто указывают; они описывают формы, имитируют действия и подчеркивают точки, и все это синхронизировано с нашим голосом. Используя возможности пространственного понимания расширенной реальности (XR), AgentHands воспроизводит эту естественную синергию. Продолжая наши предыдущие исследования в области ввода-вывода человека и разумного агента, AgentHands дополнительно наделяет агентов ИИ выразительными, синхронизированными жестами рук, которые преобразуют абстрактные словесные инструкции в интуитивные, физические демонстрации, делая разговоры об окружающей среде более естественными и увлекательными.
воспроизведение видео без звука зацикливание пауза видео без звука зацикливание включение звука видео выключение звука
Демонстрация AgentHands: Предоставление ИИ-агентам возможности использовать выразительные, синхронизированные жесты рук для пространственно-ориентированного общения в XR.
Таксономия для воплощенных агентов рук в XR
Для начала мы провели предварительное исследование с участием экспертов по XR и взаимодействию человека с компьютером (HCI) из Google, чтобы определить, что делает виртуальную руку «читаемой» в трехмерной среде. Мы обобщили эти данные в многомерную таксономию, которая определяет, как агент должен использовать свои руки, чтобы вести диалог в физическом пространстве пользователя.
- Выбор ведущей или ведомой руки и жесты: выбор между одной или двумя руками и выбор из библиотеки форм, например, «ладонь» для выражения осторожности или «цилиндрический захват» для имитации держания инструмента.
- Пространственность: Использование глубины XR для определения местоположения рук. Они могут находиться в воздухе для общего разговора, быть привязаны к объекту для идентификации конкретных частей тела или быть привязаны к пользователю для передачи социальных сигналов.
- Динамика времени и визуальные эффекты (VFX): Жесты в XR — это не просто статичные позы; они включают в себя анимированные движения, такие как «наливание» или «обводка». Мы также используем уникальный визуальный слой XR, добавляя эффекты, например, красное свечение для обозначения предупреждения о жаре.
Диаграмма таксономии AgentHands отображает шесть измерений: ведущая рука, жест, пространственность, временная динамика, интерактивность и визуальные эффекты.
Рабочий процесс AgentHands
Ключевое нововведение AgentHands заключается в его способности преобразовывать высокоуровневые рассуждения LLM в точные физические движения в реальном времени, соответствующие «голосу» агента и среде XR пользователя. Мы представляем следующие ключевые шаги для построения рабочего процесса AgentHands.
Экологическая осведомленность
Система начинается с облегченного модуля регистрации объектов. Используя отслеживание взгляда и реконструкцию сцены, пользователи могут быстро «помечать» объекты — например, орхидею или ноутбук — создавая пространственную запись с трехмерными ограничивающими рамками, на которые может ссылаться агент.
AgentHands использует отслеживание взгляда и понимание сцены для регистрации физических объектов в трехмерном реестре.
библиотека событий жестов рук
Мы создали библиотеку жестов рук, разделенных на три семантические категории: а) дейктические для обозначения чего-либо, б) иконические для изображения действий или форм и в) выразительные для передачи социальных сигналов и эмоций.
Репрезентативный набор моделей поведения, сгруппированных по семантическому назначению, для облегчения выбора LLM.
Рассуждения, встроенные в жесты
Когда пользователь задает вопрос, бэкэнд LLM генерирует ответ, включающий встроенные события жестов (GestureEvents). Каждое событие привязано к определенным ключевым словам и кодирует примитивы для поведения руки в соответствии с таксономическими параметрами.
Синхронизированное выполнение XR
Локальный парсер на XR-гарнитуре координирует воспроизведение речи (TTS) с анимационным движком. Используя временные метки на уровне слов, руки агента выполняют жесты, синхронизированные с произносимыми словами, обеспечивая четкую и выразительную пространственную привязку.
Благодаря интеграции этих модулей AgentHands создает бесшовный мост между лингвистическим намерением и физическим действием. Система преобразует стандартный вывод LLM в насыщенное мультимодальное представление, где сгенерированные агентом ответы проявляются как в речи, так и в пространственно точном движении, что позволяет демонстрировать сложные инструкции именно там, где они возникают в окружающей среде пользователя.
Полный рабочий процесс системы AgentHands, иллюстрирующий переход от речи пользователя и вида от первого лица (FPV) к событиям жестов, генерируемым LLM, и синхронизированному рендерингу XR.
Сценарии применения
Мы продемонстрировали, как эти телесные жесты в сочетании с пространственным восприятием XR улучшают наше понимание окружающей нас физической среды.
Интерактивное обучение: в случае ухода за орхидеями инструктор не просто говорит «проверьте корни»; он перемещает руки к основанию растения и показывает воздушные корни, объясняя их функцию.
AgentHands использует пространственные жесты, чтобы указать на воздушные корни при уходе за орхидеей.
Технические пошаговые инструкции: В случае работы с 3D-принтером агент может продемонстрировать точную последовательность действий «поворот и щелчок», необходимую для управления регуляторами и выбора файлов, что делает сложные этапы работы с физическим интерфейсом интуитивно понятными.
AgentHands демонстрирует точное взаимодействие с регуляторами для навигации по меню 3D-принтера.
Сопровождение в вопросах образа жизни: Агент может выступать в роли тренера по здоровому образу жизни, взаимодействуя с вашими физическими решениями. Например, агент может выполнять интерактивный «предупреждающий» жест, держа пользователя за руку и используя визуальный эффект, чтобы предостеречь его от нездорового поведения.
AgentHands использует ненавязчивые интерактивные жесты для поддержания здоровых повседневных привычек.
Исследование пользователей
Для оценки влияния этих жестов мы провели исследование с участием 12 испытуемых, сравнивая AgentHands с базовым вариантом, включающим только речь. В обоих условиях использовался один и тот же заранее подготовленный исследовательами вербальный контент, что гарантировало, что единственным различием было наличие изображенных рук и их синхронизированных жестов. Участники выполнили два процедурных задания, которые сочетали в себе повседневный уход и техническое управление.
- Задание по уходу за орхидеями: Пользователи научились определять части растения (воздушные корни, стебли) и выполнять многоэтапные мероприятия по уходу, включая целенаправленный полив и правильное внесение удобрений.
- Задача по эксплуатации 3D-принтера: Пользователям были даны инструкции по идентификации аппаратных компонентов, таких как сопло и печатная платформа, а затем описан порядок действий для включения устройства, установки SD-карты и работы с панелью управления.
Схема пользовательского исследования, демонстрирующая две рабочие среды: (a) станция по уходу за орхидеями и (b) станция управления 3D-принтером.
Результаты
Результаты подтвердили, что сочетание XR и жестов, сопровождающих речь, весьма эффективно для пространственно-ориентированного взаимодействия. Мы проанализировали данные по нескольким ключевым показателям эффективности коммуникации.
- Значительное улучшение пространственного восприятия: Участники отметили значительное облегчение в определении местоположения конкретных объектов и направлений, указанных агентом ( p < 0,05). Своевременное «приземление» указательного жеста точно в тот момент, когда агент произносил «это», исключило догадки, характерные для чисто словесных инструкций.
- Улучшенное понимание сложных действий: необходимые действия были оценены как более простые для выполнения ( p < 0,05). Один из участников отметил: «Только когда агент показал жест поднятия, я понял, что мне нужно поднять орхидею, чтобы вода стекла».
- Важные сигналы безопасности: Предупреждения оказались гораздо эффективнее, когда их сочетали с жестами и визуальными эффектами. Эффект «ожога», использованный во время работы с 3D-принтером, был назван «действительно впечатляющим», поскольку он гарантировал, что пользователи определенно заметили опасность перегрева сопла.
- Снижение когнитивной нагрузки: Участники отметили, что инструкции было легче понять и запомнить. Качественная обратная связь свидетельствовала о том, что руки ощущались как «партнер, направляющий меня», превращая поиск с помощью инструментов в смешанный, телесный диалог.
Статистические результаты опроса об опыте использования функций системы показывают, что AgentHands значительно превосходит базовую модель по таким параметрам, как определение местоположения, понимание действий и заметность предупреждений.
Заключение и дальнейшие направления
AgentHands представляет собой шаг к будущему, где системы искусственного интеллекта не просто анализируют окружающий мир, но и динамически взаимодействуют с ним. Используя жесты, имитирующие речь, и пространственные возможности XR для приведения разговора в соответствие с физическими движениями, мы можем снизить когнитивную нагрузку сложных задач и сделать пространственные вычисления более доступными и ориентированными на человека.
По мере того, как мы продолжаем разработку для экосистемы Android XR, мы изучаем способы сделать эти жесты еще более персонализированными, адаптируясь к доминирующей руке пользователя или изучая его специфические пространственные привычки, чтобы создать еще более бесшовное взаимодействие человека и ИИ.
Благодарности
Данное исследование было проведено главным образом Цзыи Лю во время его работы в качестве студента-исследователя в Google в рамках совместной работы нескольких команд. Мы выражаем искреннюю благодарность ключевым участникам Дэвиду Ли, Чжунъи Чжоу и Дэвиду Киму за их поддержку, а также Адаршу Коудле, Гуру Сомаддеру и Шахраму Изади за их стратегическое руководство и вдумчивые рецензии.
Источник: research.google
Похожие записи
- X направил уведомление о прекращении противоправных действий проекту с открытым исходным кодом Nitter из-за предполагаемого сбора данных.
- Первые результаты Jalapeño демонстрируют лидирующую в отрасли скорость и эффективность выполнения задач искусственного интеллекта | OpenAI
- «Ростелеком» запустил заселение в отели по «Цифровому ID» через Max
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
