Стабильные ответы помогают медицинскому ИИ выявлять диагнозы, которым врачи могут доверять
Исследователи из центра EKFZ в Дрездене разработали локальную систему медицинского ИИ, которая правильно диагностирует заболевания в 84–90% случаев. Ключ к надежности — повторяемость результатов ИИ при анализе одного случая.
ИИ-агенты смогут надежно поддерживать диагностику и клиническое принятие решений в будущем — при условии защиты конфиденциальных медицинских данных и возможности врачей оценивать надежность отдельных результатов, генерируемых ИИ. Исследователи из Центра цифрового здоровья имени Эльзы Кёнер Фрезениуса (EKFZ) в Дрезденском технологическом университете и Дрезденской университетской клинике разработали медицинскую ИИ-систему для локального развертывания, которая решает обе проблемы. Их результаты опубликованы в журнале Nature Medicine.
Большие языковые модели все более способны справляться со сложными медицинскими задачами. Однако их использование в клинической практике сталкивается с двумя фундаментальными проблемами: конфиденциальные данные пациентов должны оставаться под контролем соответствующего учреждения, а не передаваться внешним сервисам, и врачи должны иметь возможность оценивать надежность диагнозов, сгенерированных ИИ.
Исследовательская группа во главе с Якобом Н. Катером в Дрездене разработала полностью локальную диагностическую ИИ-систему и оценила ее в среде моделирования, в которой два ИИ-агента взаимодействуют друг с другом: один берет на себя роль врача, другой — пациента. Используя эту установку, исследователи изучали, насколько надежно медицинские ИИ-системы могут принимать диагностические решения. Система построена на основе ИИ-агента MIRA, представленного в июне 2026 года.
ИИ-агент был протестирован с использованием стандартизированных клинических случаев, охватывающих ряд состояний, включая аппендицит, холецистит, пневмонию, легочную эмболию и инфекции мочевыводящих путей. Случаи были основаны на анонимизированных электронных медицинских записях, включая диагнозы, лабораторные значения, лекарства и данные физического обследования.
ИИ-агент врача мог задавать уточняющие вопросы и запрашивать клинические данные и результаты лабораторных исследований. На основе этой информации он выставлял диагноз с обоснованием. Лучшая локально работающая ИИ-модель выставила правильный диагноз примерно в 90% случаев по одному эталону и в 84% по другому. Для 181 случайно выбранного случая врачи также проверили диагнозы. Автоматизированная оценка и консенсус врачей совпали более чем в 90% случаев.
Одним из ключевых вопросов исследования было определение того, можно ли доверять решению, сгенерированному ИИ. Для решения этой проблемы исследователи изучили несколько показателей правильности диагностики. Наиболее информативным было то, выставляет ли ИИ одинаковый диагноз при повторной обработке одного и того же случая. Чем стабильнее диагноз оставался при повторных запусках, тем выше была вероятность его правильности.
Внутренние оценки вероятности модели были менее полезны для предсказания правильности диагноза. Это также было очевидно при стресс-тесте: когда исследователи удаляли надежную информацию из системы, точность диагностики значительно снижалась. Хотя диагнозы ИИ становились чаще неправильными, сигналы вероятности модели не отражали это.
На основе своих выводов исследователи предлагают возможную схему сотрудничества между врачами и ИИ. Вместо того чтобы полностью доверять системе ИИ или требовать проверки каждого решения, можно различать случаи с более сильными сигналами надежности от более неуверенных. Неуверенные случаи всегда передавались бы медицинским специалистам на рассмотрение.
Катер, старший автор исследования и профессор клинического искусственного интеллекта в Дрезденском технологическом университете, объясняет: «Наша цель — ИИ-агент с избирательной автономией. Эти системы должны поддерживать врачей в принятии решений, но никогда полностью не брать на себя эту функцию. Поэтому важно, чтобы результаты, генерируемые ИИ, были понятны врачам и чтобы системы четко указывали, когда их результаты неопределенны. Ответственность за диагностику и лечение всегда остается за людьми».
Второй фокус исследования — технический контроль над системой ИИ. ИИ-модели и вся обработка данных выполнялись полностью в локально развернутой инфраструктуре. Это дает медицинским учреждениям больше контроля над тем, где обрабатываются данные и какие модели ИИ используются. Локально развернутая инфраструктура обеспечивает техническую основу для управления защитой данных, версиями моделей, правами доступа и процессами мониторинга в учреждении.
Катер также видит в этом предпосылку для ответственного развития медицинского ИИ в Европе: «На мой взгляд, призывы замедлить развитие ИИ идут в неправильном направлении. В медицине мы еще в самом начале: ИИ-системы, такие как наши агенты, только начинают показывать, что возможно, и пациенты пока что получили очень мало пользы.
Нам нужно двигаться быстрее, а не медленнее. Важно то, что мы разрабатываем эти системы безопасным, прозрачным образом и сохраняем суверенитет данных — например, запуская их полностью внутри больницы. Но для этого Европе также необходимо сыграть роль в основных технологиях, включая языковые модели, а не просто строить на основе технологий, разработанных где-то еще».
Исследование также выявляет вопросы, которые необходимо решить перед любым потенциальным клиническим внедрением. Исследователи обнаружили признаки различий в точности диагностики между группами пациентов. Остается неясным, почему смоделированные случаи, включающие пожилых пациентов в частности, показали более плохие результаты, и это потребует дальнейшего расследования.
Кроме того, выводы основаны на ретроспективных моделированиях с использованием существующих клинических данных, а не на тестировании во время плановой клинической практики. «Наши результаты показывают, что мы сделали важный шаг к более надежным медицинским ИИ-агентам. Далее мы хотим изучить, насколько хорошо этот подход работает в реалистичных условиях, с участием врачей и по более широкому спектру заболеваний и клинических данных», — говорит Ли Чжан, первый автор публикации и исследователь в команде Катера.
Другой фокус — эффективность. Поскольку оценка надежности в настоящее время требует повторных запусков для каждого случая, команда работает над снижением вычислительных затрат без ущерба для качества результатов. Помимо дрезденских исследователей, в исследовании также принимали участие ученые из Национального центра исследования опухолей (NCT) Хайдельберга при Хайдельбергской университетской клинике.