Архив рубрики ~Лента новостей~

SymptomAI: На пути к созданию разговорного ИИ-агента для повседневной оценки симптомов

SymptomAI: На пути к созданию разговорного ИИ-агента для повседневной оценки симптомов
SymptomAI: На пути к созданию разговорного ИИ-агента для повседневной оценки симптомов

Мы представляем первое в своем роде исследование применения искусственного интеллекта для дифференциальной диагностики и проверки симптомов, проведенное в рамках общенационального исследования.

Быстрые ссылки

Значительная часть клинических диагнозов может быть установлена исключительно на основе языковых интервью. Эти диагностические интервью обычно проводятся врачами в ходе взаимодействия врача и пациента во время очных или дистанционных визитов. Хотя такое взаимодействие является золотым стандартом оценки симптомов, оно часто сталкивается с финансовыми , географическими и системными барьерами, ограничивающими его доступность. Современные языковые модели (ЯМ) продемонстрировали высокие возможности оценки дифференциальной диагностики при оценке на тщательно отобранных медицинских тематических исследованиях, что подчеркивает их потенциал в поддержке диагностического процесса. Однако существующие оценки в значительной степени опираются на тщательно отобранные, очень подробные и иногда синтетические описания случаев пациентов, которые могут не отражать реальный опыт и вариативность клинических проявлений. Эти оценки не учитывают, как обычные пациенты сообщают о своих симптомах, например, с разным уровнем медицинской грамотности, неполной информацией и другими сложностями, возникающими в ходе естественного разговора. Это представляет собой ключевой пробел, приводящий к неопределенности в отношении того, как ЯМ могут работать в реальных условиях.

Для решения этой проблемы мы провели сравнительное исследование на практике с использованием набора экспериментальных прототипов разговорных ИИ-агентов, разработанных для изучения того, как разговорный ИИ может проводить комплексные опросы о симптомах и дифференциальную диагностическую оценку в целях сравнительного анализа исследований. В нашей недавней исследовательской работе «SymptomAI: к разговорному ИИ-агенту для повседневной оценки симптомов» мы делимся результатами рандомизированного национального исследования (n=13 917), в котором участники исследования, давшие согласие на участие, взаимодействовали с одним из пяти возможных агентов SymptomAI Gemini Flash 2.0. Все диагнозы, метки и ассоциации заболеваний, сгенерированные в ходе исследования, предназначались только для анализа в исследовательских целях и не являлись подтвержденными клиническими диагнозами или официальными медицинскими заключениями. Через две недели после взаимодействия с ИИ-агентами мы попросили участников исследования сообщить о любых диагнозах, полученных ими во время визита к врачу. Используя эти данные, мы провели исследование аннотирования клиническими экспертами, сравнивая диагностическую эффективность SymptomAI с медицинскими заключениями реальных врачей.

После оценки точности дифференциальной диагностики (ДД) SymptomAI мы дополнительно сравниваем диагнозы SymptomAI с биосигналами, полученными с помощью носимых устройств Fitbit участников за время, предшествующее их разговору с SymptomAI. Мы показываем, что разговоры с SymptomAI, которые привели к диагнозу инфекционного заболевания, совпадают с физиологическими тенденциями, которые могут указывать на иммунный ответ, что является дополнительным доказательством эффективности SymptomAI.

В рамках данного исследования мы использовали набор разговорных ИИ-агентов для проведения комплексного опроса пациентов и оценки дифференциальной диагностики. Участник мог обсудить с агентом свои симптомы, получить список возможных дифференциальных диагнозов и ввести свой последующий диагноз.

Как это работает

Мы привлекли к исследованию 13 917 участников, давших согласие на участие. Каждый из них описывал свои симптомы одному из пяти случайно выбранных агентов SymptomAI, каждый из которых обладал различной степенью гибкости в проведении опроса о симптомах. Во время этих бесед участники описывали свои симптомы, а SymptomAI задавал уточняющие вопросы. Беседы завершались окончательным дифференциальным диагнозом (ДД, список возможных диагнозов) и рекомендациями по дальнейшим действиям. Затем участники могли обратиться к врачу и через две недели должны были поделиться результатами визита с помощью опроса. Для оценки и определения исходного уровня оценки SymptomAI мы провели исследование с участием клинических экспертов, в ходе которого группа из трех сертифицированных врачей проанализировала стенограммы бесед и предоставила свою собственную оценку (т.е. дифференциальный диагноз). Затем каждый врач вслепую оценил ДД, предоставленный SymptomAI, и ДД, предоставленные другими врачами.

Ключевые результаты

Предпочтение клинических экспертов к SymptomAI DDx

Мы обнаружили, что врачи отдавали предпочтение дифференциальному диагнозу, сгенерированному SymptomAI, по сравнению с диагнозами, предоставленными другими врачами, более чем в 50% случаев. Это указывает на то, что дифференциальный диагноз SymptomAI совпадал с медицинскими заключениями наших врачей так же часто или даже чаще, чем с заключениями других врачей.

На горизонтальной гистограмме сравнивается распределение оценок, выставленных врачами и SymptomAI, и видно, что SymptomAI значительно чаще отдают предпочтение первому месту (53,3%).

Дифференциальный диагноз, сгенерированный SymptomAI, с большей вероятностью был признан нашими клиническими экспертами лучшим дифференциальным диагнозом по общему качеству.

Клинические эксперты сочли SymptomAI DDx более точным.

Аналогичным образом мы сравниваем точность дифференциальных диагнозов (ДД), сгенерированных SymptomAI, и диагнозов, предоставленных реальными врачами, используя критерий точности Top-5 (т.е., соответствует ли истинный диагноз, предоставленный личным лечащим врачом наших участников, одному из пяти возможных диагнозов в ДД). Мы попросили каждого из наших врачей определить, присутствует ли предоставленный диагноз в каждом из ДД, включая как ДД, сгенерированные SymptomAI, так и ДД, предоставленные врачами. Мы обнаружили, что врачи чаще оценивали ДД, сгенерированные SymptomAI, как точные, чем ДД, предоставленные другими врачами.

Горизонтальная гистограмма под названием «Общая точность по 5 лучшим показателям» демонстрирует более высокую точность SymptomAI.

В сгенерированных SymptomAI дифференциальных диагнозах чаще встречались диагнозы, указанные самими пациентами и предоставленные медицинским работником.

Получение большего количества информации повышает эффективность.

В рамках данного исследования мы оценили различные подходы к проведению интервью для сбора анамнеза. Участники были случайным образом распределены на пять групп, каждая из которых использовала различные стратегии подсказок. Две группы ( Dynamic Live и Dynamic Final ) получили полную свободу действий для задавания неограниченных дополнительных вопросов, еще две группы ( Fixed Canonical и Flexible Canonical ) задавали вопросы из набора стандартных вопросов для сбора анамнеза, изучаемых в медицинском вузе, и, наконец, базовая версия LM без подсказок, представляющая собой полностью управляемый пользователем опыт, который является текущим статус-кво при обращении к чат-ботам LM. Мы обнаружили, что все стратегии подсказок, управляемые агентом (т.е., где SymptomAI активно задавал дополнительные вопросы), значительно превосходили базовую версию, демонстрируя ценность получения информации от участников для повышения точности дифференциальной диагностики.

На сгруппированной столбчатой диаграмме показана точность пяти наиболее значимых результатов по пяти стратегиям подсказок: базовая, фиксированная каноническая, гибкая каноническая, динамическая в реальном времени и динамическая финальная. SymptomAI неизменно демонстрирует более высокую точность по всем стратегиям.

Точность работы SymptomAI и врачей в зависимости от экспериментальной группы SymptomAI.

На диаграмме с колебаниями, озаглавленной «Вовлеченность пользователей в зависимости от стратегии подсказок», сравнивается распределение общего количества слов, произнесенных пользователями, при использовании пяти различных стратегий подсказок.

Общее количество слов, использованных пользователями в экспериментальной группе SymptomAI.

Производительность SymptomAI на примерах с низкой степенью достоверности

Мы обнаружили, что превосходство SymptomAI над клиническими базовыми показателями было наиболее выражено в случаях, когда врачи были наименее уверены в своем собственном дифференциальном диагнозе.

Гистограмма показывает, что SymptomAI сохраняет более высокую точность Top-5 при различных уровнях уверенности врачей, оцениваемых ими самими.

Пять показателей точности, присвоенных врачами системе SymptomAI и исходным дифференциальным диагнозам, сгруппированных по степени уверенности врача в собственном дифференциальном диагнозе.

Диагностика, проводимая с помощью SymptomAI, коррелирует с биосигналами.

Учитывая точность SymptomAI по сравнению с клиническими базовыми показателями, мы можем также изучить его потенциал в масштабах всей системы. В настоящее время высокая стоимость клинических меток препятствует проведению анализа данных в масштабах населения в реальных условиях. Точные системы проверки симптомов, такие как SymptomAI, потенциально могут обеспечить автоматическую эталонную маркировку клинических диагнозов, что может открыть возможности для крупномасштабного анализа физиологических данных — задача, которая в настоящее время невыполнима в больших масштабах.

Одним из таких примеров является сопоставление биосигналов, регистрируемых носимыми устройствами, с различными категориями заболеваний. Наиболее заметные изменения в биосигналах наблюдаются при острых респираторных инфекциях. Для изучения этого явления в масштабах популяции мы собирали ежедневные биометрические данные от участников, давших согласие на участие, в течение 30 дней до их взаимодействия с SymptomAI. Мы обнаружили четкие сдвиги биосигналов, указывающие на начало симптомов в дни, предшествующие сообщению пользователем о симптомах. Важно отметить, что разделение между когортами было получено путем категоризации наиболее часто встречающегося диагноза SymptomAI и группировки диагнозов, классифицированных как респираторные инфекции. Эта когорта исключает неинфекционные респираторные заболевания, такие как аллергический ринит или хроническая обструктивная болезнь легких. Корреляция пиков сдвига биосигналов, регистрируемых носимыми устройствами, совпадающая с датой сообщения о симптомах у этих участников, служит наблюдательным физиологическим доказательством, соответствующим сообщенным ими симптомам.

Сетка из девяти линейных графиков сравнивает изменения биометрических показателей с течением времени в исходных условиях и в периоды инфекции.

Биосигналы, регистрируемые с помощью носимых устройств, за несколько дней до разговора с SymptomAI относительно исторического среднего значения за базовый период с -30 по -15 день для инфицированной ( красный ) и базовой ( серый ) групп. Инфицированная группа включает участников, у которых SymptomAI диагностировала респираторную инфекцию, а базовая группа включает всех остальных участников нашего набора данных. День 0 обозначает дату разговора с SymptomAI.

Применение наряду с биосигналами

Оценка симптомов на основе ИИ открывает двери для новых исследований. Используя SymptomAI для анализа большого объема сообщений о симптомах и сопоставляя их с данными Fitbit в режиме реального времени, мы можем изучать цифровые биосигнальные фенотипы при широком спектре заболеваний. Наш анализ выявил отчетливые изменения физиологических показателей, включая сердечно-сосудистую функцию, дыхание, температуру кожи и качество сна, за несколько дней до разговора пользователя с SymptomAI. Эти объективные изменения тесно связаны со временем разговора о симптомах, предлагая потенциальный способ подтверждения симптомов, о которых сообщают пациенты, или предоставления пассивных данных для дифференциальной диагностики наряду с их рассказом о симптомах. Кроме того, эта доступность в режиме реального времени подчеркивает ключевое преимущество ИИ-проверки симптомов. В отличие от традиционных клинических приемов, которые могут страдать от задержек в расписании, участники могут принимать участие в исследовании SymptomAI одновременно с появлением симптомов. Это потенциально может повысить точность сообщаемых пациентами временных рамок начала симптомов — важная деталь для анализа состояния здоровья в масштабах населения.

Ограничения

SymptomAI — это исследовательский проект, который может представлять собой значительный шаг вперед в области оценки симптомов на основе искусственного интеллекта и демонстрирует потенциал, который он может предоставить широкой общественности, стремящейся понять свои симптомы. Хотя оценка эффективности внедрения в популяции показывает точность оценки симптомов посредством дистанционных интервью с пациентами, существуют определенные ограничения при сравнении с оценками врачей.

Во-первых, дифференциальная диагностика сама по себе является неоднозначной задачей, и даже сообщенные диагнозы могут меняться и развиваться в течение длительного времени. Оценка симптомов представляет собой моментальный снимок и фиксирует симптомы в тот момент, когда они проявляются. Из-за масштаба нашего исследования мы не смогли контролировать частоту и время сообщения о симптомах. В результате некоторые участники могли сообщать о своих симптомах задолго до того, как появились более репрезентативные индикаторы, в то время как другие могли сообщать об очевидных индикаторах из информированного контекста после многолетнего опыта хронического заболевания. В будущих исследованиях можно сосредоточиться на конкретных заболеваниях на конкретных этапах развития симптомов, таких как метаболический синдром с ранним началом или симптомы, обсуждавшиеся в начале респираторных инфекций. Все диагнозы, обозначения и ассоциации заболеваний, сгенерированные в ходе исследования, получены с помощью ИИ исключительно для исследовательского анализа и не являются подтвержденными клиническими диагнозами или официальными медицинскими заключениями.

Во-вторых, в ходе нашей оценки врачи просматривали статичные стенограммы чатов и не имели возможности задавать собственные уточняющие вопросы. Врачи могли бы интуитивно получить другую информацию, если бы сами направляли опрос о симптомах. Более того, хотя недавние исследования показали, что системы разговорного ИИ могут получать клинические данные с уровнем детализации и точности, сопоставимым с уровнем врача, такие системы могут упускать из виду альтернативные сигналы, такие как язык тела, визуальная оценка, медицинские записи или, в контексте первичной медицинской помощи, существующий контакт с пациентом.

В заключение мы представляем SymptomAI, экспериментального разговорного ИИ-агента для проведения реальных опросов пациентов и оценки симптомов. Мы демонстрируем сквозную производительность SymptomAI в реальных условиях, оценивая точность диагностики на выборке населения, и показываем, как диагнозы, поставленные SymptomAI, могут позволить анализировать сигналы популяционного масштаба, такие как данные с носимых биоустройств, для выявления связей между физиологическими сигналами и сообщаемыми заболеваниями.

Благодарности

Данная работа является результатом равного вклада Джо Бреды, Джейка Саншайна и Дэниела Макдаффа. Мы хотели бы поблагодарить наших соавторов и сотрудников из Google Research и Google DeepMind за их вклад в эту работу.

Источник: research.google

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ ИИ-агентам выдали бесконечную память — вышел Obsidian Mind, который создаёт… Архив рубрики ~Коротко из Telegram~ OpenAI обновила свой сборник юзкейсов для Codex — теперь… Архив рубрики ~Коротко из Telegram~ Anthropic запустила самую мощную и дешевую в мире команду… Архив рубрики ~Коротко из Telegram~ С 28 июля Apple запускает в США сервис продажи своих… Архив рубрики ~Коротко из Telegram~ TON резко вырос после заявления Дурова Криптовалюта TON подорожала почти… Архив рубрики ~Коротко из Telegram~ ТВОЯ ИДЕЯ УЖЕ СТАЛА САЙТОМ Российские разрабы из «Мастерицы» сломали… Архив рубрики ~Коротко из Telegram~ Распознаем генерацию нейронки с одного взгляда — ИИ уже настолько… Архив рубрики ~Коротко из Telegram~ Иногда на жаре телефон раскаляется, тормозит, а зарядка и камера… Новости робототехники Xiaomi научила роботов осваивать новые задачи за 10 часов Вслед… Архив рубрики ~Коротко из Telegram~ Вышел самый мощный оркестратор нейронок Claudexor — он объединяет Claude… Архив рубрики ~Коротко из Telegram~ Для Hermes Agent выкатили список лучших скиллов, плагинов и тулз… Архив рубрики ~Коротко из Telegram~ Для Claude Code сделали скилл Hyper Research — он… Архив рубрики ~Коротко из Telegram~ Для Codex вышел мощный скилл, который находит и подтверждает… Архив рубрики ~Коротко из Telegram~ Засыпать под подкасты и стримы — плохая идея: фоновый… Архив рубрики ~Коротко из Telegram~ ИИ-агентам выдали бесконечную память — вышел Obsidian Mind, который создаёт… Архив рубрики ~Коротко из Telegram~ OpenAI обновила свой сборник юзкейсов для Codex — теперь… Архив рубрики ~Коротко из Telegram~ Anthropic запустила самую мощную и дешевую в мире команду… Архив рубрики ~Коротко из Telegram~ С 28 июля Apple запускает в США сервис продажи своих… Архив рубрики ~Коротко из Telegram~ TON резко вырос после заявления Дурова Криптовалюта TON подорожала почти… Архив рубрики ~Коротко из Telegram~ ТВОЯ ИДЕЯ УЖЕ СТАЛА САЙТОМ Российские разрабы из «Мастерицы» сломали… Архив рубрики ~Коротко из Telegram~ Распознаем генерацию нейронки с одного взгляда — ИИ уже настолько… Архив рубрики ~Коротко из Telegram~ Иногда на жаре телефон раскаляется, тормозит, а зарядка и камера… Новости робототехники Xiaomi научила роботов осваивать новые задачи за 10 часов Вслед… Архив рубрики ~Коротко из Telegram~ Вышел самый мощный оркестратор нейронок Claudexor — он объединяет Claude… Архив рубрики ~Коротко из Telegram~ Для Hermes Agent выкатили список лучших скиллов, плагинов и тулз… Архив рубрики ~Коротко из Telegram~ Для Claude Code сделали скилл Hyper Research — он… Архив рубрики ~Коротко из Telegram~ Для Codex вышел мощный скилл, который находит и подтверждает… Архив рубрики ~Коротко из Telegram~ Засыпать под подкасты и стримы — плохая идея: фоновый…

Оставить комментарий