Почему интерфейсы искусственного интеллекта в здравоохранении должны адаптироваться к опыту пользователей?
Искусственный интеллект в здравоохранении и оздоровлении
Почему интерфейсы искусственного интеллекта в здравоохранении должны адаптироваться к опыту пользователей?
Исследователи из Массачусетского технологического института и их коллеги обнаружили, что инструменты объяснимости ИИ в секторе здравоохранения могут давать совершенно разные результаты в зависимости от того, кто их использует.
При диагностике кожных заболеваний неспециалисты повысили точность своих результатов с помощью ИИ, хотя улучшение в основном произошло за счет доверия к модели. Врачи первичного звена продемонстрировали другую закономерность: они показали лучшие результаты, когда получили прогноз ИИ без объяснений.
В исследовании, опубликованном в журнале Nature Medicine, рассматривалась дерматологическая диагностика, где инструменты искусственного интеллекта уже помогают некоторым врачам и все чаще используются пациентами через поисковые системы на основе ИИ.
Марзие Гассеми, доцент кафедры электротехники и компьютерных наук Массачусетского технологического института, заявила, что полученные результаты требуют тщательного подхода к проектированию интерфейсов искусственного интеллекта в сфере здравоохранения.
«Хорошие системы искусственного интеллекта могут повысить эффективность в некоторых областях здравоохранения, но это необходимо тщательно сбалансировать с алгоритмической предвзятостью, которая может привести к увеличению количества ошибок», — сказала она. «Мы знаем, что как ИИ, так и методы объяснимости могут вызывать у людей предвзятость автоматизации, и этот эффект привязки необходимо учитывать при проектировании систем ИИ».
Интерфейс изменяет диагноз.
Цель объяснимого искусственного интеллекта — предоставить пользователям основания для оценки результатов работы модели. Система может выделить области медицинского изображения, которые повлияли на поставленный диагноз. Другой подход может показать похожие изображения, подтверждающие прогноз.
Крупные языковые модели предлагают другой путь. Они могут предоставить простое объяснение рассуждений модели, представив диагноз в терминах, понятных широкой аудитории.
В ходе исследования, проведенного под руководством MIT, были протестированы несколько из этих подходов. Участники видели медицинские изображения вместе с прогнозом кожного заболевания, полученным с помощью ИИ. Один интерфейс предоставлял прогноз и уровень достоверности без каких-либо пояснений. Другой возвращал похожие изображения, а отдельная система использовала тепловые карты для определения областей интереса. Исследователи также протестировали пояснения, сгенерированные с помощью LLM.
Неспециалисты оценивали, содержат ли изображения родинок в себе признаки рака. Перед врачами стояла более широкая задача: им нужно было составить дифференциальный диагноз дерматологического заболевания.
Неспециалисты чаще всего полагались на языковые объяснения.
Каждый из подходов, повышающих объяснимость результатов, улучшил точность измерений для неспециалистов в исследовании. Инструменты в основном помогли участникам идентифицировать нераковые родинки.
Исследователи также протестировали модель с ограничениями по справедливости, предназначенную для устранения предвзятости по отношению к людям с более темным цветом кожи. Эта модель повысила точность и уменьшила диагностические расхождения, основанные на цвете кожи. Повышение производительности сопровождалось риском. Неспециалисты в значительной степени полагались на рекомендации модели, и неправильные результаты модели ухудшали их производительность больше, чем правильные улучшали.
«Причина, по которой пользователи, не являющиеся экспертами, работают лучше, заключается в том, что они больше полагаются на модели. Когда модель ошибается, это больше вредит производительности, чем помогает, когда модель работает правильно. Нам просто удалось обучить очень хорошие модели ИИ для этих условий», — сказал Гассеми.
Объяснения, основанные на модели LLM, вызвали наиболее сильный эффект доверия. Участники доверяли этим объяснениям независимо от того, были ли результаты модели правильными или неправильными. По словам исследователей, они также сочли расплывчатые или общие объяснения более убедительными.
Пользователи, получившие помощь от LLM, сообщили о большей уверенности в неверных ответах. Этот результат оказывает давление на дизайн интерфейсов диагностических систем, ориентированных на потребителя, где правдоподобное текстовое объяснение может выглядеть авторитетно, даже если модель допустила ошибку.
Роксана Данешджу, доцент кафедры биомедицинской обработки данных и дерматологии Стэнфордского университета, заявила, что пациенты с ограниченными медицинскими знаниями подвергаются наибольшему риску столкнуться с некорректными результатами работы объяснимого искусственного интеллекта.
«Эти результаты важны, поскольку пациенты все чаще обращаются к ИИ за помощью в вопросах здравоохранения», — сказала она. «Наши выводы показывают, что люди с наименьшими медицинскими знаниями чаще всего вводятся в заблуждение, когда объяснимые модели ИИ выдают ошибочные результаты».
Врачи первичного звена использовали ИИ по-разному.
Врачи не реагировали на неверные объяснения ИИ таким же образом. Они сохраняли устойчивость, даже когда система выдавала ошибочную рекомендацию или объяснение. Наилучшие результаты были достигнуты при использовании более ограниченного интерфейса, где система предоставляла врачам прогноз модели без сопутствующего объяснения.
Объяснения с использованием LLM показали наименьшее улучшение точности среди протестированных методов объяснения для клиницистов. Результат не доказывает, что объяснения не играют никакой роли в клинической практике. Он показывает, что формат объяснения, подходящий для пациента или новичка, может не подойти опытному пользователю, выполняющему дифференциальную диагностику.
Ведущий автор исследования Орсон Сюй, доцент кафедры биомедицинской информатики Колумбийского университета, сказал: «В конечном итоге все сводится к тому, как каждая группа использует это объяснение. У врача уже есть в голове диагноз, и он проверяет ИИ на соответствие собственной подготовке, поэтому неправильное объяснение выявляется».
«Между тем, неспециалист может использовать это же самое объяснение, чтобы сформировать своё мнение, поэтому правдоподобное, уверенно звучащее обоснование может склонить его к неверному ответу. В итоге один и тот же инструмент становится преимуществом для одного пользователя и недостатком для другого».
В исследовании утверждается, что объяснение не следует рассматривать как стандартный компонент интерфейса, работающий одинаково для всех ролей. Базовый уровень квалификации пользователя влияет на то, будет ли объяснение служить проверкой модели или заменой независимого суждения.
Влияние времени на предвзятость автоматизации
Исследователи также изучили, когда пользователи видели помощь ИИ. Люди становились более уважительными, когда система показывала объяснение до того, как у них появлялась возможность поставить собственный диагноз. Этот вывод указывает на практическое дизайнерское решение: интерфейс мог бы запрашивать у пользователя первоначальную диагностическую гипотезу, а затем предоставлять рекомендацию ИИ, которая выявляет альтернативные состояния для рассмотрения.
Исследование показало, что пользователи, которые в наибольшей степени полагались на ИИ, также демонстрировали наихудшие результаты при выполнении задания без поддержки ИИ. Эти участники могут получить выгоду от помощи модели, хотя они также подвергаются наибольшему риску, когда модель выдает некорректный результат.
В ходе исследования сравнивались результаты работы людей и ИИ при различных проявлениях заболеваний. Системы ИИ превосходили людей, когда симптомы проявлялись слабо выраженно. Люди показывали гораздо лучшие результаты, когда изображение содержало нетипичные симптомы или несвязанные с ними особенности.
Инструменты для врачей могут нуждаться в непосредственном выводе результатов моделирования, который бы поддерживал проверку на основе профессионального суждения. Инструменты, предназначенные для пациентов, требуют особого внимания к объяснениям LLM, особенно в тех случаях, когда система представляет уверенное объяснение неверной рекомендации.
См. также: Модель PRISM2 использует клинический диалог для интерпретации патологических препаратов.

Хотите узнать больше об искусственном интеллекте и больших данных от лидеров отрасли? Посетите выставку AI & Big Data Expo, которая пройдет в Амстердаме, Калифорнии и Лондоне. Это масштабное мероприятие является частью TechEx и проводится одновременно с другими ведущими технологическими выставками, включая Cyber Security & Cloud Expo. Для получения дополнительной информации нажмите здесь.
AI News — это проект TechForge Media. Здесь вы можете ознакомиться с другими предстоящими мероприятиями и вебинарами, посвященными корпоративным технологиям.
Источник: www.artificialintelligence-news.com
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
