Развитие AMIE в направлении проведения клинических консультаций с использованием аудиовизуальных средств экспертного уровня.
Мы усовершенствовали AMIE, нашу исследовательскую систему искусственного интеллекта для медицинских исследований, чтобы она могла проводить видеоконсультации в режиме реального времени, впервые продемонстрировав экспертный уровень производительности в рандомизированном контролируемом исследовании с использованием смоделированных консультаций.
Когда врач встречается с пациентом, консультация выходит далеко за рамки обмена словами. Врач наблюдает за походкой пациента, регистрирует видимые признаки дискомфорта, отмечает его дыхание и направляет пациента в проведении физического обследования. Этот непрерывный поток визуальной и слуховой информации органично интегрируется с устным клиническим анамнезом. Эти невербальные визуальные и слуховые сигналы имеют центральное значение для эффективной диагностики, доверия пациента и клинической коммуникации.
Системы искусственного интеллекта, способные к клиническому мышлению и диалогу, потенциально могут значительно расширить доступ к медицинской экспертизе и лечению, способствуя созданию будущего, в котором врачи смогут сосредоточить свое время на наиболее важных аспектах взаимодействия с пациентами. На ранних этапах работы наша исследовательская система искусственного интеллекта для клинического мышления и диалога Articulate Medical Intelligence Explorer (AMIE) продемонстрировала экспертный уровень производительности в текстовом диагностическом диалоге и оказалась эффективной в качестве вспомогательного средства для дифференциальной диагностики для врачей. Недавно мы расширили возможности AMIE, выйдя за рамки диагностики и охватив лечение и управление заболеваниями в течение длительного времени.
Мы также расширили возможности AMIE, включив в них оценку на уровне специалистов в области онкологии, кардиологии и офтальмологии, а также многомодальное диагностическое мышление на основе изображений и клинических документов в условиях моделирования с участием пациентов. Параллельно мы начали внедрять эти достижения в клиническую практику, используя систему контроля, ориентированную на врача, а также проводя первые клинические исследования в реальных условиях, включая исследование клинической осуществимости с медицинским центром Beth Israel Deaconess и продолжающееся общенациональное рандомизированное исследование в партнерстве с Included Health.
Несмотря на эти достижения, в наших исследованиях по-прежнему оставалось фундаментальное ограничение: текстовые интерфейсы игнорируют визуальные и слуховые аспекты клинической практики. Пациенты должны переводить сложные физические симптомы в письменные описания, что приводит к потере диагностической информации и может негативно сказаться на пациентах с ограниченной цифровой грамотностью или уровнем медицинской грамотности. Системы, использующие только текст, не могут самостоятельно отслеживать визуальные и слуховые сигналы, которые лежат в основе клинического мышления, и не могут направлять пациентов при проведении физического обследования, определяющего дифференциальный диагноз.
Сегодня в статье « На пути к экспертному уровню медицинского ИИ для видеоконсультаций в реальном времени » мы представляем AMIE в конфигурации видеоконсультаций в реальном времени — AMIE (Video), которая устраняет эти ограничения. Созданная на основе Gemini и Project Astra, система AMIE (Video) проводит синхронные клинические видеоконсультации, распознавая невербальные клинические сигналы, направляя пациентов-актеров во время виртуальных физических осмотров и проводя диагностическое расследование — все в реальном времени. В многоцентровом рандомизированном исследовании со 100 сценариями, 300 живыми консультациями и группой из 30 сертифицированных врачей общей практики мы представляем первую демонстрацию системы ИИ, демонстрирующей экспертный уровень производительности в клинических видеоконсультациях в реальном времени.
AMIE (Видео): Асинхронная многоагентная архитектура
Для эффективного ведения клинической беседы по видеосвязи необходимо сбалансировать противоречивые требования: система должна отвечать пациентам с естественной скоростью разговора, одновременно проводя тщательный клинический анализ и непрерывно обрабатывая визуальные и звуковые потоки. В настоящее время один агент не может удовлетворить всем этим требованиям. Глубокий анализ требует времени, но паузы в разговоре подрывают доверие и взаимопонимание с пациентом.
Для решения этой задачи AMIE (Video) использует асинхронную многоагентную архитектуру, которая распределяет обязанности между тремя специализированными агентами, работающими непрерывно параллельно:
- Агент-разговорщик: Агент, взаимодействующий с пациентом, обеспечивает быстрое и эффективное речевое взаимодействие с низкой задержкой. Он поддерживает естественный ход разговора, одновременно учитывая указания других агентов.
- Агент-планировщик: Работая в фоновом режиме, этот агент постоянно совершенствует клиническое мышление системы, обновляя дифференциальные диагнозы и планы лечения, выявляя пробелы в информации и пересматривая приоритеты различных клинических целей.
- Агент восприятия: Этот агент постоянно анализирует аудио- и видеопотоки, выявляя клинически значимые невербальные признаки (такие как видимые признаки дистресса, физические данные или слуховые сигналы) и контекстуализируя эти наблюдения в рамках текущего разговора.
Такая развязанная конструкция позволяет AMIE (Video) поддерживать естественную задержку в разговоре, одновременно выполняя диагностическое мышление и аудиовизуальное восприятие, которые в противном случае привели бы к неприемлемым задержкам. Автоматизированные оценки подтверждают, что каждый агент в этой трехагентной архитектуре вносит важный вклад в улучшение клинических показателей, таких как компетентность в сборе анамнеза, клиническом мышлении и рекомендациях по лечению, а также показателей, связанных с качеством диалога, включая навыки общения, ориентированные на пациента, и задержку ответа.
Обзор системы AMIE для проведения клинических видеоконсультаций в режиме реального времени, результаты исследования и основные выводы.
Управление разработкой с помощью автоматизированной оценки
Ключевой проблемой при создании аудиовизуального медицинского ИИ является характеристика перцептивных и логических возможностей системы в масштабе. Для руководства разработкой мы разработали таксономию клинических аудиовизуальных компетенций, имеющих отношение к телемедицине, на основе медицинской литературы, охватывающую невербальные визуальные сигналы, слуховые сигналы и приемы физического обследования. Затем мы создали автоматизированный набор инструментов оценки, структурированный на основе этой таксономии.
Данная система оценки сочетает в себе целевые одноэтапные аудиовизуальные обследования с многоэтапными симуляционными аудиоконсультациями. Одноэтапные аудиовизуальные обследования проверяют конкретные примеры клинического восприятия и рассуждения (например, правильное определение анатомической латеральности или распознавание признаков дыхательной недостаточности). А многоэтапные симуляционные аудиоконсультации оценивают сквозную производительность разговора, одновременно добавляя визуальные подсказки в виде текстовых описаний в симуляцию (например, симулятор пациента с болезнью Паркинсона, использующий ИИ для сценария с почерком, может добавить словесное описание: «[подносит бумагу к камере, показывая тесный, мелкий почерк]»). Вместе эти взаимодополняющие оценки позволили быстро усовершенствовать дизайн системы и детально охарактеризовать возможности и режимы отказов AMIE (видео) до проведения оценки человеком.
Оценка с помощью рандомизированного видеоисследования.
Для оценки клинической компетентности в более сложных и реалистичных условиях комплексной аудиовизуальной клинической консультации мы провели крупномасштабное рандомизированное исследование с использованием объективного структурированного клинического экзамена (OSCE) и синхронного интерфейса видеоконсультации.
Для охвата широкого спектра медицинских состояний в рамках нашего исследования было рассмотрено 100 клинических сценариев, охватывающих пять систем организма, включая сердечно-легочную, брюшную, голову/глаза/уши/нос/горло (HEENT), неврологические/психиатрические и опорно-двигательные заболевания. Пятнадцать обученных актеров, играющих пациентов, провели 300 стандартизированных консультаций в рамках трех групп исследования:
- AMIE (Видео): Видеоконфигурация системы AMIE для проведения видеоконсультаций в режиме реального времени.
- AMIE (текст): текстовая версия, служащая базовым вариантом для выделения вклада аудиовизуальных возможностей.
- Врач общей практики (видео): Десять сертифицированных врачей общей практики проводят консультации через один и тот же видеоинтерфейс.
Независимая группа из 20 опытных врачей общей практики оценила все консультации, используя установленные клинические критерии, включающие как общие шкалы оценки клинической компетентности, так и подробные критерии оценки, специфичные для каждого конкретного случая.
Качество видеоконсультаций, проводимых врачами общей практики и специалистами первичной медицинской помощи, оценивалось на основе точности диагностики, а также оценок клинических экспертов и предпочтений пациентов-актеров.
Ключевые результаты
Клинический уровень экспертного подхода: по основным клиническим компетенциям, тщательности сбора анамнеза, точности диагностики, целесообразности лечения и качеству коммуникации, клинические эксперты оценили AMIE (видео) наравне с врачами общей практики. AMIE (видео) также сравнялся или превзошел AMIE (текст) по этим параметрам.
Уверенность в физическом наблюдении и осмотре: видеометодика AMIE получила значительно более высокую оценку в среднем, чем методы AMIE (для врачей общей практики) и текстовый метод AMIE, позволяющие выявлять физические признаки и активно направлять актеров, изображающих пациентов, при выполнении виртуальных манипуляций во время осмотра. Это преимущество также отразилось в оценках восприятия конкретных случаев и оценочных критериях осмотра.
Пациенты-актеры отдали предпочтение видеосвязи: они значительно предпочли синхронный видеоинтерфейс текстовому чату, оценив его как гораздо более удобный и эффективный для обсуждения проблем со здоровьем. Они также положительно оценили видеоконсультации (AMIE) по таким параметрам, как эмпатия, взаимопонимание и уверенность в качестве оказываемой помощи, по сравнению как с врачами общей практики, так и с текстовыми консультациями (AMIE).
Сравнение видеоконфигурации AMIE с AMIE, использующей только текстовый чат. Результаты основаны на оценках клинических экспертов и предпочтениях пациентов-актеров.
Ограничения и ответственное развитие
Данное исследование имеет важные ограничения, и крайне важно интерпретировать полученные результаты в контексте этих ограничений. Исследование проводилось исключительно с участием профессиональных актеров, играющих пациентов, в смоделированных клинических условиях, а не с реальными пациентами, предъявляющими свои собственные требования к здоровью. Актеры, играющие пациентов, какими бы опытными они ни были, не могут в полной мере воспроизвести сложность и непредсказуемость реальных клинических ситуаций, и сценарии были ограничены состояниями, которые могут быть достоверно изображены посредством актерской игры, исключая важные клинические проявления, где аудиовизуальное восприятие имело бы диагностическое значение. Выходя за рамки исследования, целенаправленные автоматизированные оценки выявили случайные ошибки восприятия и рассуждения, несмотря на в целом высокое качество разговора и точность диагностики, и система по-прежнему демонстрирует периодические технические проблемы, которые могут нарушать естественность разговора. Учитывая прототипный характер проекта Astra, это включает в себя технические аспекты, которые могут быть решены в будущем на системном уровне, выходящем за рамки конкретного медицинского применения, исследованного в данной работе. Оценка этих результатов в исследованиях с реальными пациентами и реальными клиническими состояниями является важным следующим шагом, прежде чем можно будет сделать какие-либо выводы о практической пользе.
Взгляд в будущее
В данной работе показано, что переход от текстового к аудиовизуальному клиническому ИИ достижим на уровне экспертного качества. AMIE (Video) использует богатство восприятия клинической практики, наблюдая за невербальными сигналами, направляя физический осмотр и ведя естественный диалог посредством устной речи — возможности, которые более точно имитируют опыт видеоконсультации в рамках телемедицины.
На пути к ответственному использованию данных из реальной практики остаются важные вопросы. Наши выводы необходимо подтвердить на реальных пациентах, расширить, включив в них клинические случаи, которые невозможно воспроизвести на практике, и закрепить надежными механизмами обеспечения безопасности. Мы уже сделали первые шаги в этом направлении: исследование осуществимости в реальных условиях с медицинским центром Beth Israel Deaconess Medical Center предоставило первоначальные доказательства безопасности и полезности текстовой аудиовизуальной коммуникации в клинической практике, а наше текущее общенациональное рандомизированное исследование с Included Health продолжает оценку применения ИИ в реальной виртуальной медицинской помощи. В совокупности эти исследования помогут определить, как аудиовизуальные возможности могут быть ответственно интегрированы в клиническую практику. Хотя многое еще предстоит сделать, эти результаты знаменуют собой важную веху на пути к системам ИИ, которые однажды смогут улучшить качество медицинской помощи, взаимодействуя со сложной сенсорной составляющей клинической практики.
Благодарности
Описанное здесь исследование является результатом совместной работы многих команд в Google Research и Google Deepmind. Мы благодарны всем нашим соавторам — Махвишу Нагде, Джихёну Ли, Мэттью Томпсону, Си Джей Паку, Тиму Стротеру, Валентину Лиевину, Роме Рупарелю, Акшаю Гоэлю, Тейе Бергамаски, Сухане Беди, Мет Шах, Павлу Дубову, Ливиу Панаит, Тошиюки Фукудзава, Сэму Шмидгаллу, Крейгу Шиффу, Джозефу Сюю, Алие. Рысбек, Яна Лунц, Ян Фрейберг, Ребекка Хеменуэй, Санни Вирмани, Дэвид Рац, Кэри Радебо, Жоэль Барраль, Кави Гоэл, Дэйл Р. Вебстер, Кэтрин Чоу, Авинатан Хассидим, Йосси Матиас, Джеймс Маника, Грегори Уэйн, Тао Ту, Юн Лю, Итан Го, Кристина Чен, Рютаро Танно и Кэмерон Чен.
Источник: research.google
Похожие записи
Оцените материал:
Похожие записи
OpenAI удаляет функцию ChatGPT после утечки личных разговоров в поиск Google
15.08.2025
С каждым днём становится всё сложнее отличать обычные видосы от нейросетевых
29.10.2025
Intel перестала работать над 12 пакетами для дистрибутива Debian
06.10.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
