Насколько точен ИИ-врач: что на самом деле говорят исследования

Заголовки обещают, что нейросети «ставят диагноз точнее врача», — но за громкими цифрами скрываются важные оговорки. В узких задачах по медицинским снимкам искусственный интеллект и правда достигает 85–97% точности, а систематический обзор в Lancet Digital Health30123-2/fulltext) показал сопоставимую с врачами диагностическую способность — но только на отобранных данных. Если вы хотите просто разобраться в своих симптомах или анализах, ИИ-врач онлайн поможет структурировать вопросы к специалисту, но окончательный диагноз всегда остаётся за живым доктором.

Врач изучает КТ-снимок с областью, подсвеченной ИИ
ИИ подсвечивает зону внимания на снимке, но окончательное решение принимает живой врач

Разберём по научным данным: где ИИ действительно достигает высокой точности, как её вообще измеряют и почему лабораторные проценты не стоит переносить на реальную клинику.

Важно. Эта статья носит информационный характер и не заменяет медицинскую консультацию. Искусственный интеллект не ставит диагноз и не заменяет очный приём у врача. При любых тревожных симптомах обратитесь к специалисту, а в неотложной ситуации звоните в скорую помощь — 103 или 112.

Что значит «точность» в медицинской диагностике

Слово «точность» в новостях и в научных статьях означает разные вещи. Когда сервис заявляет «точность 95%», без дополнительных метрик эта цифра почти ничего не говорит о реальной пользе. Чтобы понять, можно ли доверять нейросети-врачу, нужно разобраться с двумя ключевыми показателями.

Почему одна цифра «точность 90%» ничего не значит

Точность (accuracy) — это доля всех верных ответов, и она сильно зависит от того, насколько распространена болезнь в выборке. Если заболевание встречается у 1% людей, модель, которая всем подряд говорит «здоров», формально будет «точна» на 99% — и при этом бесполезна, потому что пропустит всех больных.

Сравнение чувствительности и специфичности на инфографике
Чувствительность — не пропустить больного, специфичность — не переполошить здорового: одну цифру «точность» без них понять нельзя

Поэтому исследователи опираются на две отдельные метрики:

  • Чувствительность — доля реально больных, которых ИИ правильно нашёл (чем выше, тем реже пропущенные болезни).
  • Специфичность — доля здоровых, которых алгоритм не переполошил ложной тревогой (чем выше, тем меньше лишних обследований).

При диагностике меланомы одна из работ зафиксировала чувствительность ИИ 92,2% против 73,4% у врачей: алгоритм реже пропускал опухоль, но взамен мог чаще давать ложноположительные срабатывания.

Сбалансированная точность и почему её считают

Чтобы честно сравнить ИИ и человека, когда больных и здоровых в выборке неравное количество, считают сбалансированную точность — среднее чувствительности и специфичности. В классической работе Esteva et al. (Nature, 2017) нейросеть показала 72,1% против 65,6–66,0% у 21 дерматолога при трёхклассовой классификации родинок.

Более свежие данные скромнее по разрыву: в исследовании меланомы 2024 года сбалансированная точность ИИ составила 0,798 против 0,781 у врачей — преимущество есть, но небольшое. Важнее другое: эти цифры валидны только на конкретном наборе данных, на котором модель тестировали, и не гарантируют такой же результат в вашей поликлинике.

Цифры точности по областям медицины

Точность ИИ-диагностики радикально различается в зависимости от того, что именно распознаёт нейросеть. Лучше всего искусственный интеллект в медицине справляется с анализом изображений, где задача узкая и хорошо формализованная. Ниже — сводка по основным направлениям с обязательными оговорками.

ОбластьЗаявленная точность ИИОговорка
Офтальмология (диабетическая ретинопатия)более 90%только по качественным снимкам глазного дна
Радиология (КТ, рентген, флюорография)высокая на тестахрезультат — черновик для врача-рентгенолога
Маммография (СберМедИИ)93% выявления опухоли (по данным разработчика)официальная специфичность не раскрыта; для таких систем типичен компромисс в сторону ложных тревог
Дерматология (меланома)72–92% в разных работаххуже работает на тёмной коже

Радиология и снимки

ИИ анализирует медицинскую визуализацию быстрее человека. Российский сервис «Цельс» расшифровывает флюорограммы и рентген за секунды, выделяя подозрительные изменения в лёгких. Во время пандемии COVID-19 алгоритмы помогали находить характерные поражения на КТ лёгких и сортировать поток пациентов.

Но у этой скорости есть чёткая граница ответственности. Результат работы нейронной сети — это черновик, предварительная разметка, которую обязательно проверяет и утверждает врач-рентгенолог. Алгоритм подсвечивает зону внимания, а клиническое решение принимает человек.

Офтальмология

Офтальмология — область, где медицинский ИИ показывает одни из лучших результатов. При диагностике диабетической ретинопатии по снимкам глазного дна точность нейросетей превышает 90%. В классической работе Gulshan et al. (JAMA, 2016) алгоритм показал чувствительность 90,3% и специфичность 98,1% в выявлении случаев, требующих направления к офтальмологу, — на уровне ведущих специалистов.

Проект DeepMind (подразделение Google) продемонстрировал систему, которая распознаёт более 50 болезней глаз на уровне ведущих офтальмологов и даёт рекомендацию по срочности направления к специалисту. При этом высокая точность держится ровно до тех пор, пока снимок качественный и соответствует данным, на которых модель обучали.

Онкология и маммография

На онкологии хорошо видно, почему одну цифру нельзя понимать буквально. Сервис «Маммография» от СберМедИИ, по данным разработчика, достоверно выявляет злокачественную опухоль в 93% случаев. Компания не публикует официальную специфичность алгоритма, но для систем с высокой чувствительностью типичен компромисс: часть здоровых женщин может получить ложную тревогу и направление на дополнительные обследования.

Именно поэтому заключение алгоритма — повод для уточняющей диагностики, а не готовый диагноз. Если формулировки в отчёте непонятны, нейросеть-врач может помочь разобрать их простым языком, но не отменяет очный приём у онколога или маммолога.

ИИ против врача: кто точнее

Самые громкие заголовки рождаются из экспериментов, где ИИ напрямую сравнивают с врачами. Цифры там впечатляющие, но их легко истолковать неверно, если не смотреть на условия эксперимента.

Громкие эксперименты

В 2025 году Microsoft представила систему MAI-DxO, которая на подборке сложных клинических случаев из журнала NEJM показала около 85% правильных решений против примерно 20% у врачей, работавших без доступа к справочникам и коллегам. Условие «без справочников» здесь принципиально: оно ставит человека в заведомо неравные условия.

Столбчатая диаграмма точности: ChatGPT 90%, врачи с ИИ 76%, врачи без ИИ 74%
В тесте на сложных случаях сам ChatGPT дал 90%, а связка «врач + ИИ» — лишь 76%: лабораторные цифры не переносятся напрямую на живой приём

Ещё один пример — исследование, опубликованное в JAMA Network Open: сам ChatGPT решил диагностические задачи на 90%, врачи без нейросети — на 74%, а врачи, которым дали ChatGPT в помощь, — на 76%. Большие языковые модели (LLM) в таких тестах действительно сильны, но тесты — это не живой приём с осмотром и анамнезом.

Кто ставил диагнозТочность на сложных случаяхУсловия теста
MAI-DxO (Microsoft)85,5%304 случая NEJM, последовательная диагностика
Врачи без ИИ (те же случаи)около 20%без справочников и коллег
ChatGPT отдельно90%6 клинических кейсов, исследование JAMA
Врачи + ChatGPT76%тот же набор кейсов
Врачи без ChatGPT74%тот же набор кейсов

Почему «ИИ + врач» — не всегда лучше «ИИ»

Самый неожиданный результат того же исследования — связка «врач + ИИ» почти не обошла врачей без ИИ и уступила самому ChatGPT. Причина оказалась не в модели: врачи часто игнорировали подсказки алгоритма, если те расходились с их собственным мнением.

Оказалось, что врачи не всегда прислушивались к искусственному интеллекту, когда он указывал на то, что они упустили.

Artificial intelligence in healthcare, Wikipedia

Вывод исследователей: проблема не в качестве ИИ, а в том, что врачей не научили с ним работать. Это аргумент не в пользу «ИИ вместо врача», а в пользу «врача, который умеет пользоваться ИИ».

Почему лабораторные цифры обманчивы

Между процентами из пресс-релиза и реальной клиникой лежит пропасть. Понимание этого разрыва — главное, что стоит вынести из научных обзоров.

Тест на «чистых» данных не равен реальной клинике

Систематический обзор Liu et al. в Lancet Digital Health проанализировал десятки исследований, сравнивавших ИИ и врачей по медицинским изображениям. Ключевой вывод: большинство громких работ тестируют алгоритмы на заранее отобранных и аккуратно размеченных наборах данных, а не на «грязных» реальных медкартах с артефактами, редкими случаями и плохими снимками.

Более того, лишь малая часть исследований проверяла модель на внешних данных — из другой больницы или другого аппарата. Из выборки, соответствовавшей строгим критериям, только небольшое число работ применяло одновременно и внутреннюю, и внешнюю валидацию. Без внешней проверки высокий процент может отражать всего лишь подгонку под конкретный датасет.

Сравнение аккуратных тестовых снимков и хаотичных реальных медкарт
На отобранных тестовых данных ИИ точнее, чем на «грязных» снимках реальной клиники — в этом и кроется разрыв между процентами и практикой

Смещение обучающих данных

ИИ точен ровно настолько, насколько репрезентативны данные, на которых его учили. Классический пример: алгоритмы хуже диагностируют болезни кожи у людей с тёмной кожей, потому что дерматологические датасеты в основном собраны на пациентах со светлой кожей. Всемирная организация здравоохранения в своих рекомендациях по этике ИИ в здравоохранении прямо указывает на риск того, что необъективные данные усиливают неравенство в доступе к качественной диагностике.

Смещение проявляется по нескольким направлениям сразу:

  • по типу кожи, полу и возрасту пациентов, если группы представлены в данных неравномерно;
  • по редким формам болезней, которых в обучающей выборке было слишком мало;
  • по типу оборудования: модель, обученная на снимках одного производителя томографов, может терять точность на снимках другого.

В реальной практике это не абстрактный, а измеримый риск ошибки, который врач обязан учитывать при трактовке ответа алгоритма.

Ограничения и риски ИИ-диагностики

Даже при высокой точности на снимках у ИИ-диагностики есть ограничения, которые не сводятся к процентам. Их важно понимать любому, кто пользуется цифровыми медицинскими сервисами.

Четыре ограничения ИИ-диагностики: эмпатия, стабильность, смещение данных, ответственность
Четыре ограничения, которые не измеряются процентом точности: нет эмпатии, нестабильность ответов, смещение данных и неопределённость ответственности
  • Нет эмпатии и учёта состояния. Алгоритм не считывает психоэмоциональный контекст, тревогу и жизненные обстоятельства пациента, которые влияют на решение о лечении.
  • Нестабильность ответов. Большие языковые модели при повторном запросе могут дать другой ответ — воспроизводимость ниже, чем ожидают от медицинского инструмента.
  • Зависимость от входных данных. Плохой снимок, неполное описание симптомов или ошибка в данных ведут к неверному выводу по принципу «мусор на входе — мусор на выходе».
  • Неопределённость ответственности. Юридически до сих пор не урегулировано, кто отвечает за врачебную ошибку, если её допустил алгоритм.

Как проверить вывод ИИ, прежде чем принимать его всерьёз:

  1. Уточните, что именно измеряет заявленная точность — чувствительность, специфичность или общую accuracy.
  2. Проверьте, тестировали ли модель на внешних, а не только «своих» данных.
  3. Соотнесите результат со своими симптомами и историей болезни — совпадает ли картина.
  4. Не меняйте назначенное лечение на основании ответа нейросети.
  5. Покажите заключение и снимки живому врачу и примите решение вместе с ним.

В России применение медицинского ИИ регулируется как программное обеспечение — медицинское изделие, которое проходит регистрацию в Росздравнадзоре. Даже зарегистрированный сервис остаётся вспомогательным инструментом: ИИ-доктор онлайн — это ассистент для подготовки к приёму и разъяснения формулировок, а клиническое решение принимает врач.

Ещё раз о главном. Не занимайтесь самодиагностикой и самолечением по ответам нейросети. При боли в груди, затруднённом дыхании, резкой слабости, нарушении речи или других тревожных симптомах немедленно обратитесь за медицинской помощью. Телефон экстренных служб — 103 (скорая) или 112 (единый номер).

FAQ