Исследователи из MIT и коллаборация выяснили, что инструменты объяснимого ИИ в здравоохранении дают резко разные результаты в зависимости от того, кто ими пользуется. Работа опубликована в Nature Medicine и построена на задаче диагностики кожных заболеваний — области, где ИИ уже помогает части клиницистов и всё чаще доходит до пациентов через ИИ-поисковые продукты.
При диагностике болезней кожи неспециалисты с поддержкой ИИ повышали точность, но в основном за счёт делегирования решения модели. Врачи первичного звена, наоборот, показывали лучшие результаты, когда получали предсказание ИИ без объяснения.
Что именно тестировали
Участники видели медицинские изображения вместе с предсказанием ИИ о кожном заболевании. Тестировались несколько интерфейсов: предсказание с уровнем уверенности без объяснения; подбор похожих изображений; тепловые карты, подсвечивающие области интереса; и текстовые объяснения, сгенерированные языковой моделью. Неспециалисты оценивали, является ли родинка на изображении раковой; клиницисты решали более широкую задачу — дифференциальный диагноз дерматологического заболевания.
Каждый подход к объяснению улучшал точность неспециалистов, главным образом помогая распознавать нераковые родинки. Отдельно исследователи проверили модель с ограничением справедливости, нацеленным на устранение смещения в отношении более тёмных оттенков кожи: она повысила точность и сократила диагностические различия по тону кожи. Но у этого выигрыша есть риск: неспециалисты сильно полагались на рекомендацию модели, и ошибка модели вредила их результату сильнее, чем верный ответ его улучшал.
«Хорошие ИИ-системы могут повышать эффективность в некоторых медицинских контекстах, но это нужно тщательно балансировать с алгоритмическим делегированием, которое может вести к большему числу ошибок. Мы знаем, что и ИИ, и методы объяснимости способны вовлекать людей в автоматизационный уклон, и этот эффект якорения нужно учитывать при проектировании ИИ-систем», — говорит Marzyeh Ghassemi, доцент кафедры электротехники и информатики MIT.
Языковые объяснения усиливают доверие к ошибкам
Самое сильное делегирование вызвали объяснения от языковых моделей: участники доверяли им независимо от того, верен был ответ модели или нет, а расплывчатые и общие объяснения казались убедительнее. Пользователи, получавшие помощь языковой модели, сообщали о большей уверенности в неверных ответах. Это создаёт давление на проектирование потребительских диагностических систем: правдоподобное текстовое объяснение может выглядеть авторитетно даже при ошибке модели.
«Эти выводы важны, поскольку пациенты всё чаще обращаются к ИИ за помощью в лечении. Наши данные показывают, что больше всего рискуют уйти не туда те, у кого меньше всего медицинских знаний, когда объяснимая ИИ-модель выдаёт ошибочный результат», — комментирует Roxana Daneshjou, доцент биомедицинских данных и дерматологии в Stanford.
Клиницисты вели себя иначе: они не следовали неверным объяснениям, оставаясь устойчивыми при ошибочных рекомендациях, а лучшие результаты показывали при минималистичном интерфейсе — предсказание без объяснения. Языковые объяснения дали врачам наименьший прирост точности среди всех протестированных методов. Это не значит, что объяснениям нет места в клинике: формат, подходящий пациенту или новичку, может не подходить обученному специалисту, решающему задачу дифференциальной диагностики.
Ведущий автор Orson Xu, доцент кафедры биомедицинской информатики Columbia: «Всё сводится к тому, как каждая группа использует объяснение. Клиницист уже держит в голове диагноз и сверяет ИИ со своей подготовкой, поэтому плохое объяснение он замечает. А неспециалист может использовать ровно это же объяснение, чтобы впервые сформировать мнение, — и правдоподобная уверенная аргументация утянет его к неверному ответу. Один и тот же инструмент оказывается преимуществом для одного пользователя и обузой для другого».
Время тоже имеет значение
Исследователи проследили и за тем, когда пользователь видит помощь ИИ. Люди становились более податливыми, если объяснение показывалось до того, как они успели сформировать собственный диагноз. Отсюда практический вывод для дизайна: интерфейс может сначала запросить у пользователя первоначальную диагностическую гипотезу, а затем дать рекомендацию ИИ с альтернативными состояниями для рассмотрения. При этом те, кто сильнее всего делегировал ИИ, без поддержки модели работали хуже всех.
Работа выступает против трактовки объяснимости как стандартного компонента интерфейса, одинаково работающего для всех ролей: базовый уровень экспертизы пользователя определяет, станет ли объяснение проверкой модели или заменой самостоятельного суждения.
Источник: artificialintelligence-news.com