ChatGPT обошёл Gemini и Copilot при проверке совместимости лекарств — но галлюцинирует лишние взаимодействия

Учёные из Венгрии впервые сравнили ChatGPT, Google Gemini и Microsoft Copilot с профессиональными базами данных Drugs.com, Lexicomp и Medscape на реальных списках назначений 80 пациентов с полипрагмазией. Исследование опубликовано в рецензируемом журнале Exploratory Research in Clinical and Social Pharmacy. Результат неоднозначный: ИИ проверка совместимости лекарств с помощью LLM работает — но только как вспомогательный инструмент, а не замена фармацевту.

Паттерн из капсул и таблеток — символ проверки взаимодействий лекарств ИИ
ИИ находит опасные пары препаратов — но генерирует и лишние предупреждения

Что проверяли и что получили

В исследовании из 80 ревматологических пациентов (средний список — 11,6 препарата, полипрагмазия у 89,5%) специалисты вручную составили эталон: 204 клинически значимых взаимодействия в 57 случаях по трём базам данных. Затем те же списки отправили ChatGPT, Gemini и Copilot с одинаковым промптом. ChatGPT нашёл 439 взаимодействий, Gemini — 1 556, Copilot — 1 813. Чувствительность Gemini оказалась выше (0,697), но ChatGPT показал лучшую специфичность (0,868) и наилучший F1-score (0,2520), опередив Gemini (0,1933) и Copilot (0,1153). По данным PubMed Central, ни одна из платформ не достигла баланса точности и чувствительности, необходимого для самостоятельного клинического применения: все три модели генерируют клинически неверную информацию из-за галлюцинаций.

Почему это важно

Обычные базы взаимодействий страдают от «alert fatigue» — избытка предупреждений низкой значимости, из-за которых врачи и фармацевты начинают игнорировать оповещения. LLM предлагают более гибкий и контекстный анализ, но платят за это другой ошибкой: выдают несуществующие взаимодействия. Авторы исследования считают LLM перспективным инструментом ПОДДЕРЖКИ клинического фармацевта при полипрагмазии — при условии обязательной верификации каждого результата специалистом.

Что это значит для пациентов

Пациенты, принимающие пять и более препаратов одновременно, сталкиваются с реальным риском: при семи и более лекарствах вероятность опасного взаимодействия превышает 80%. ИИ-инструменты уже сейчас помогают быстро выявить потенциально опасные пары — это лучше, чем ничего. Но финальное слово остаётся за врачом или фармацевтом, который знает полный контекст лечения.