Ко всем новостям
Фармакология

Точная настройка медицинского ИИ может улучшить диагностику, но также создает риски для конфиденциальности

Исследование показало, что адаптация языковых моделей ИИ для медицины улучшает диагностику, но одновременно повышает риск воспроизведения конфиденциальной информации пациентов. Ученые выделили три типа запоминания: полезное, неинформативное и вредоносное.

Кингю Чэнь, PhD, и его команда изучали, как адаптируются языковые модели искусственного интеллекта для медицины, и обнаружили, что то, что эти модели запоминают, может быть как полезным, так и рискованным. Модель может сохранять ценные медицинские знания, но в контролируемом исследовании с использованием реальных больничных записей то же самое тонкое обучение, которое улучшило диагностическую производительность, также сделало более вероятным воспроизведение материала, который модель видела во время обучения, включая конфиденциальную информацию пациентов.

Исследование, недавно опубликованное в Nature Communications, отражает вопрос, который находится в центре исследований Чэня: Как медицинский ИИ может стать не только более способным, но и более надежным и безопасным? Исследование возглавляла его первый автор Анран Ли, PhD, которая проводила исследование в качестве постдокторанта в отделении биомедицинской информатики и науки о данных Йельского университета.

Чэнь является доцентом биомедицинской информатики и науки о данных в Йельской школе медицины с дополнительной должностью в офтальмологии. Он руководит исследованиями точности и логики медицинских языковых моделей, а также мультимодального ИИ для диагностики заболеваний, который использует как текст, так и медицинские изображения.

Наша лаборатория делает две вещи, которые обычно рассматриваются отдельно: мы разрабатываем медицинский ИИ и изучаем, где он дает сбой.

На стороне разработки мы работаем с двумя основными типами информации, на которых функционирует медицина. Мы разрабатываем модели, которые читают клинические записи и медицинскую литературу, модели, которые анализируют медицинские изображения, чтобы помочь в диагностике заболевания и прогнозировании его течения, а также системы, которые комбинируют оба подхода, чтобы ИИ мог взвешивать письменную историю пациента наряду с его сканированиями, как это сделал бы врач.

Но модель, которая хорошо работает на тесте, - это не то же самое, что модель, которой можно доверить пациента. Поэтому мы также изучаем, где эти системы дают сбой. Они могут заявлять ложные сведения с полной уверенностью. Они могут прийти к правильному ответу через ошибочные рассуждения. И, как показывает наша недавняя работа, они могут запоминать конфиденциальную информацию из данных, на которых они были обучены.

Наша цель - разработать медицинский ИИ, который действительно полезен, понять, где он ломается, и выдать доказательства, необходимые для того, чтобы узнать, когда он может и не может быть надежным.

Потому что медицина по своей сути мультимодальна. Пациента нельзя понять через один параграф или одно изображение. Клинические решения часто требуют объединения истории пациента, результатов лабораторных тестов, медицинских записей и результатов визуализации.

Наша работа охватывает обе стороны этого. На стороне языка мы разрабатываем методы, чтобы помочь компьютерам понять клинические записи и биомедицинскую литературу. На стороне визуализации большая часть нашего исследования сосредоточена на медицинских изображениях и специальностях, которые в них сильно зависят, особенно на офтальмологии, где мы работаем над диагностикой глазных болезней и прогнозированием их прогрессирования. Это также причина, по которой я работаю на дополнительной должности в офтальмологии.

Мы больше всего воодушевлены объединением этих областей: системы, которые могут интегрировать текст, изображения и другую клиническую информацию для создания более полной картины пациента и лучшей поддержки принятия медицинских решений.

Прогресс здесь требует большего, чем просто разработка новых моделей. Одним из самых больших препятствий является ограниченная доступность медицинских данных, которые достаточно велики, достаточно надежны и свободны для обмена между исследователями.

Чтобы помочь решить эту проблему, мы недавно разработали MedPMC, систему, которая собрала 11 миллионов медицинских изображений вместе с их сопроводительным текстом, взятым из научной литературы, которая открыта для повторного использования и предназначена для постоянного роста по мере публикации новых исследований. Мы сделали данные, инструменты, используемые для их сборки, тесты для измерения производительности и полученные модели общедоступными, чтобы другие учреждения могли разрабатывать, оценивать, воспроизводить и адаптировать эти системы, а не начинать с нуля.

Запоминание означает, что модель может воспроизвести или вернуть содержимое, которое она видела во время обучения. Если модель была обучена на клинических рекомендациях, она может воспроизвести часть рекомендации, когда вы дадите ей начало этого отрывка. Если она прошла дополнительное обучение на наборе вопросов медицинского экзамена, она может выдать вариант ответа, который появился в этих данных обучения, даже после того, как мы удалили этот вариант из вопроса.

Это отличается от простого утверждения, что модель хорошо работает. Когда модель правильно отвечает на вопрос, возможны несколько объяснений. Она могла приобрести подлинные медицинские знания. Она могла изучить закономерность рассуждений, которую она может применить к проблемам, которые она раньше не видела. Или она может просто узнать вопрос и воспроизвести что-то, что она раньше видела во время обучения. Если мы проверяем только то, является ли окончательный ответ правильным, мы не можем различить эти случаи.

Поэтому наша цель была выйти за пределы точности и задать другой набор вопросов: Как часто происходит запоминание? Какие типы содержимого запоминаются? Сколько модель может воспроизвести? Сохраняется ли то, что она запомнила ранее, после дополнительного обучения? И что все это означает для использования этих систем в медицине?

Мы посмотрели на основные этапы, которые модель общего назначения проходит на пути к становлению медицинской.

Во-первых, мы изучили модели, которые уже прошли продолженное предварительное обучение, при котором модель общего назначения дополнительно обучается на больших коллекциях медицинского текста, включая биомедицинскую литературу, клинические рекомендации и клинические записи. Во-вторых, мы оценили модели, которые были тонко настроены на стандартных наборах вопросов и ответов, которые область использует для тестирования медицинских моделей. В-третьих, мы провели защищенное конфиденциальностью, соответствующее HIPAA исследование, используя более 13 000 медицинских записей для точной настройки моделей для диагностики заболеваний.

Это было сделано в изолированной и безопасной вычислительной среде. Эти записи были уже собраны в ходе оказания помощи; исследование не привлекало пациентов и не изменяло чьего-либо лечения.

Во всех этих условиях мы изучили как модели общего назначения, так и модели, обученные на медицинских данных, 10 различных наборов данных, содержащих сотни тысяч записей, и тысячи ответов модели, которые мы вручную проверили.

Узоры различались в зависимости от этапа обучения. Продолженное предварительное обучение было более вероятно для получения длинных совпадений слово в слово с исходными документами. Точная настройка дала меньше длительного копирования в некоторых условиях, но больше запоминания, связанного с конкретной задачей, для которой модель была обучена. Например, после точной настройки на наборах вопросов и ответов медицинского профиля модели воспроизвели примерно 14-21% вариантов ответов, которые были удалены из вопроса, который был показан модели.

Мы также обнаружили, что запоминание было постоянным. В зависимости от условий, до 87% того, что модель запомнила во время продолженного предварительного обучения, все еще присутствовало после того, как она была точно настроена на новую медицинскую задачу. Точная настройка не обязательно стирает то, что модель ранее запомнила. Она может сохранить это содержимое, добавляя новое запоминание, специфичное для только что обученной задачи.

Клинический пример показал как потенциальное преимущество, так и риск адаптации этих моделей к реальным медицинским данным. Точная настройка улучшила диагностическую производительность; для одной модели правильный диагноз появился как её первый выбор в 54,8% случаев, что на 6,2 процентных пункта выше, чем 48,6%. В некоторых специальностях выигрыши были больше, чем это - более 10 процентных пункта в таких областях, как кардиология и нефрология, которые занимаются сердцем и почками.

Вместе с этим исследование показало реальный риск приватности. В контролируемом тесте, проведенном в защищенной исследовательской среде, мы обнаружили, что модель иногда может воспроизводить конфиденциальную информацию из записей, использованных для ее обучения. Это не произойдет во время ухода за пациентом, но это показывает, что риски приватности должны быть оценены до того, как модели, обученные на клинических данных, будут переданы или развернуты.

Нет. Одно из центральных выводов нашего исследования заключается в том, что запоминание в медицине не является одним поведением.

Мы определили три широких типа. Первый - это полезное запоминание. Модель может точно сохранить биомедицинские концепции, клинические рекомендации, медицинскую литературу, которую она прочитала, или конкретные медицинские знания, связанные с ее задачей. Этот вид памяти может поддерживать фактическую точность и помочь модели более эффективно выполнять медицинские задачи.

Второй - это неинформативное запоминание. Модели иногда воспроизводят дисклеймеры документов, заголовки разделов, инструкции по форматированию или другой типовой язык. Это добавляет мало медицинской ценности и может указывать на то, что модель изучает поверхностные закономерности, а не более глубокое медицинское понимание.

Третий - это вредоносное запоминание. Это включает воспроизведение причуд, специфичных для конкретного набора данных, отрывки текста слово в слово из записей пациента, защищенную медицинскую информацию или другое конфиденциальное содержимое пациента. Эта форма запоминания может создать риски приватности и может также указывать на то, что модель слишком полагается на свои данные обучения, а не на обобщение к новым случаям.

Важный вопрос, тогда, не просто в том, запоминает ли модель; это то, что модель запоминает, почему она это запоминает и поддерживает ли эта память или подрывает медицинское использование, для которого она предназначена.

Одно, что выделялось: запоминание показывалось не только поздно, после того как модель была обучена слишком долго. Это началось рано.

Как мы обучали модели, мы отслеживали их прогресс и сравнивали три вещи: сколько они запоминали, как хорошо они учились по обычной мере и как точными были их диагнозы. Запоминание начало увеличиваться относительно рано, даже в то время как стандартные меры все еще показывали улучшение модели и до того, как ее диагнозы достигли своей пиковой точности.

Это означает, что традиционные показатели, за которыми исследователи следят во время обучения - такие как то, продолжает ли модель улучшаться на удержанных данных или точка, в которой они обычно остановили бы обучение - полезны, но могут быть недостаточными сами по себе. Модель может казаться эффективно обучающейся согласно стандартным показателям производительности, одновременно увеличивая сохранение специфичного для обучения содержимого.

Мы также обнаружили два других узора. Более крупные модели и более длинные входы были в целом связаны с большим запоминанием. И наоборот, изменение обычных параметров генерации, таких как температура - которая контролирует, насколько разнообразны ответы модели - имели относительно ограниченные эффекты. Это предполагает, что запоминание фундаментально связано с тем, как обучается модель и какие данные ей подвергаются, а не с чем-то, что можно просто решить путем корректировки того, как модель генерирует свои ответы после обучения.

Адаптация модели ИИ к медицине не просто делает её "более медицинской". Это меняет то, что модель знает, что она помнит и что она может воспроизвести.

Частью этой памяти является ценная. Мы хотим, чтобы модели сохраняли точные медицинские знания и клинические рекомендации. Но мы не хотим, чтобы они полагались на бессмысленное повторение, повторяли ответы на вопросы тестов или раскрывали конфиденциальную информацию из записей пациентов.

Надежный медицинский ИИ поэтому требует большего, чем просто измерение того, правильный ли ответ получила модель. Нам нужно понять, как она там оказалась, что она сохранила из обучения и будет ли она оставаться безопасной и надежной при использовании в новой среде.

Материал опубликован на medicalxpress.com
Перейти к оригиналу