Насколько точен ИИ-врач: что на самом деле говорят исследования
Заголовки обещают, что нейросети «ставят диагноз точнее врача», — но за громкими цифрами скрываются важные оговорки. В узких задачах по медицинским снимкам искусственный интеллект и правда достигает 85–97% точности, а систематический обзор в Lancet Digital Health30123-2/fulltext) показал сопоставимую с врачами диагностическую способность — но только на отобранных данных. Если вы хотите просто разобраться в своих симптомах или анализах, ИИ-врач онлайн поможет структурировать вопросы к специалисту, но окончательный диагноз всегда остаётся за живым доктором.

Разберём по научным данным: где ИИ действительно достигает высокой точности, как её вообще измеряют и почему лабораторные проценты не стоит переносить на реальную клинику.
Важно. Эта статья носит информационный характер и не заменяет медицинскую консультацию. Искусственный интеллект не ставит диагноз и не заменяет очный приём у врача. При любых тревожных симптомах обратитесь к специалисту, а в неотложной ситуации звоните в скорую помощь — 103 или 112.
Что значит «точность» в медицинской диагностике
Слово «точность» в новостях и в научных статьях означает разные вещи. Когда сервис заявляет «точность 95%», без дополнительных метрик эта цифра почти ничего не говорит о реальной пользе. Чтобы понять, можно ли доверять нейросети-врачу, нужно разобраться с двумя ключевыми показателями.
Почему одна цифра «точность 90%» ничего не значит
Точность (accuracy) — это доля всех верных ответов, и она сильно зависит от того, насколько распространена болезнь в выборке. Если заболевание встречается у 1% людей, модель, которая всем подряд говорит «здоров», формально будет «точна» на 99% — и при этом бесполезна, потому что пропустит всех больных.

Поэтому исследователи опираются на две отдельные метрики:
- Чувствительность — доля реально больных, которых ИИ правильно нашёл (чем выше, тем реже пропущенные болезни).
- Специфичность — доля здоровых, которых алгоритм не переполошил ложной тревогой (чем выше, тем меньше лишних обследований).
При диагностике меланомы одна из работ зафиксировала чувствительность ИИ 92,2% против 73,4% у врачей: алгоритм реже пропускал опухоль, но взамен мог чаще давать ложноположительные срабатывания.
Сбалансированная точность и почему её считают
Чтобы честно сравнить ИИ и человека, когда больных и здоровых в выборке неравное количество, считают сбалансированную точность — среднее чувствительности и специфичности. В классической работе Esteva et al. (Nature, 2017) нейросеть показала 72,1% против 65,6–66,0% у 21 дерматолога при трёхклассовой классификации родинок.
Более свежие данные скромнее по разрыву: в исследовании меланомы 2024 года сбалансированная точность ИИ составила 0,798 против 0,781 у врачей — преимущество есть, но небольшое. Важнее другое: эти цифры валидны только на конкретном наборе данных, на котором модель тестировали, и не гарантируют такой же результат в вашей поликлинике.
Цифры точности по областям медицины
Точность ИИ-диагностики радикально различается в зависимости от того, что именно распознаёт нейросеть. Лучше всего искусственный интеллект в медицине справляется с анализом изображений, где задача узкая и хорошо формализованная. Ниже — сводка по основным направлениям с обязательными оговорками.
| Область | Заявленная точность ИИ | Оговорка |
|---|---|---|
| Офтальмология (диабетическая ретинопатия) | более 90% | только по качественным снимкам глазного дна |
| Радиология (КТ, рентген, флюорография) | высокая на тестах | результат — черновик для врача-рентгенолога |
| Маммография (СберМедИИ) | 93% выявления опухоли (по данным разработчика) | официальная специфичность не раскрыта; для таких систем типичен компромисс в сторону ложных тревог |
| Дерматология (меланома) | 72–92% в разных работах | хуже работает на тёмной коже |
Радиология и снимки
ИИ анализирует медицинскую визуализацию быстрее человека. Российский сервис «Цельс» расшифровывает флюорограммы и рентген за секунды, выделяя подозрительные изменения в лёгких. Во время пандемии COVID-19 алгоритмы помогали находить характерные поражения на КТ лёгких и сортировать поток пациентов.
Но у этой скорости есть чёткая граница ответственности. Результат работы нейронной сети — это черновик, предварительная разметка, которую обязательно проверяет и утверждает врач-рентгенолог. Алгоритм подсвечивает зону внимания, а клиническое решение принимает человек.
Офтальмология
Офтальмология — область, где медицинский ИИ показывает одни из лучших результатов. При диагностике диабетической ретинопатии по снимкам глазного дна точность нейросетей превышает 90%. В классической работе Gulshan et al. (JAMA, 2016) алгоритм показал чувствительность 90,3% и специфичность 98,1% в выявлении случаев, требующих направления к офтальмологу, — на уровне ведущих специалистов.
Проект DeepMind (подразделение Google) продемонстрировал систему, которая распознаёт более 50 болезней глаз на уровне ведущих офтальмологов и даёт рекомендацию по срочности направления к специалисту. При этом высокая точность держится ровно до тех пор, пока снимок качественный и соответствует данным, на которых модель обучали.
Онкология и маммография
На онкологии хорошо видно, почему одну цифру нельзя понимать буквально. Сервис «Маммография» от СберМедИИ, по данным разработчика, достоверно выявляет злокачественную опухоль в 93% случаев. Компания не публикует официальную специфичность алгоритма, но для систем с высокой чувствительностью типичен компромисс: часть здоровых женщин может получить ложную тревогу и направление на дополнительные обследования.
Именно поэтому заключение алгоритма — повод для уточняющей диагностики, а не готовый диагноз. Если формулировки в отчёте непонятны, нейросеть-врач может помочь разобрать их простым языком, но не отменяет очный приём у онколога или маммолога.
ИИ против врача: кто точнее
Самые громкие заголовки рождаются из экспериментов, где ИИ напрямую сравнивают с врачами. Цифры там впечатляющие, но их легко истолковать неверно, если не смотреть на условия эксперимента.
Громкие эксперименты
В 2025 году Microsoft представила систему MAI-DxO, которая на подборке сложных клинических случаев из журнала NEJM показала около 85% правильных решений против примерно 20% у врачей, работавших без доступа к справочникам и коллегам. Условие «без справочников» здесь принципиально: оно ставит человека в заведомо неравные условия.

Ещё один пример — исследование, опубликованное в JAMA Network Open: сам ChatGPT решил диагностические задачи на 90%, врачи без нейросети — на 74%, а врачи, которым дали ChatGPT в помощь, — на 76%. Большие языковые модели (LLM) в таких тестах действительно сильны, но тесты — это не живой приём с осмотром и анамнезом.
| Кто ставил диагноз | Точность на сложных случаях | Условия теста |
|---|---|---|
| MAI-DxO (Microsoft) | 85,5% | 304 случая NEJM, последовательная диагностика |
| Врачи без ИИ (те же случаи) | около 20% | без справочников и коллег |
| ChatGPT отдельно | 90% | 6 клинических кейсов, исследование JAMA |
| Врачи + ChatGPT | 76% | тот же набор кейсов |
| Врачи без ChatGPT | 74% | тот же набор кейсов |
Почему «ИИ + врач» — не всегда лучше «ИИ»
Самый неожиданный результат того же исследования — связка «врач + ИИ» почти не обошла врачей без ИИ и уступила самому ChatGPT. Причина оказалась не в модели: врачи часто игнорировали подсказки алгоритма, если те расходились с их собственным мнением.
Оказалось, что врачи не всегда прислушивались к искусственному интеллекту, когда он указывал на то, что они упустили.
Artificial intelligence in healthcare, Wikipedia
Вывод исследователей: проблема не в качестве ИИ, а в том, что врачей не научили с ним работать. Это аргумент не в пользу «ИИ вместо врача», а в пользу «врача, который умеет пользоваться ИИ».
Почему лабораторные цифры обманчивы
Между процентами из пресс-релиза и реальной клиникой лежит пропасть. Понимание этого разрыва — главное, что стоит вынести из научных обзоров.
Тест на «чистых» данных не равен реальной клинике
Систематический обзор Liu et al. в Lancet Digital Health проанализировал десятки исследований, сравнивавших ИИ и врачей по медицинским изображениям. Ключевой вывод: большинство громких работ тестируют алгоритмы на заранее отобранных и аккуратно размеченных наборах данных, а не на «грязных» реальных медкартах с артефактами, редкими случаями и плохими снимками.
Более того, лишь малая часть исследований проверяла модель на внешних данных — из другой больницы или другого аппарата. Из выборки, соответствовавшей строгим критериям, только небольшое число работ применяло одновременно и внутреннюю, и внешнюю валидацию. Без внешней проверки высокий процент может отражать всего лишь подгонку под конкретный датасет.

Смещение обучающих данных
ИИ точен ровно настолько, насколько репрезентативны данные, на которых его учили. Классический пример: алгоритмы хуже диагностируют болезни кожи у людей с тёмной кожей, потому что дерматологические датасеты в основном собраны на пациентах со светлой кожей. Всемирная организация здравоохранения в своих рекомендациях по этике ИИ в здравоохранении прямо указывает на риск того, что необъективные данные усиливают неравенство в доступе к качественной диагностике.
Смещение проявляется по нескольким направлениям сразу:
- по типу кожи, полу и возрасту пациентов, если группы представлены в данных неравномерно;
- по редким формам болезней, которых в обучающей выборке было слишком мало;
- по типу оборудования: модель, обученная на снимках одного производителя томографов, может терять точность на снимках другого.
В реальной практике это не абстрактный, а измеримый риск ошибки, который врач обязан учитывать при трактовке ответа алгоритма.
Ограничения и риски ИИ-диагностики
Даже при высокой точности на снимках у ИИ-диагностики есть ограничения, которые не сводятся к процентам. Их важно понимать любому, кто пользуется цифровыми медицинскими сервисами.

- Нет эмпатии и учёта состояния. Алгоритм не считывает психоэмоциональный контекст, тревогу и жизненные обстоятельства пациента, которые влияют на решение о лечении.
- Нестабильность ответов. Большие языковые модели при повторном запросе могут дать другой ответ — воспроизводимость ниже, чем ожидают от медицинского инструмента.
- Зависимость от входных данных. Плохой снимок, неполное описание симптомов или ошибка в данных ведут к неверному выводу по принципу «мусор на входе — мусор на выходе».
- Неопределённость ответственности. Юридически до сих пор не урегулировано, кто отвечает за врачебную ошибку, если её допустил алгоритм.
Как проверить вывод ИИ, прежде чем принимать его всерьёз:
- Уточните, что именно измеряет заявленная точность — чувствительность, специфичность или общую accuracy.
- Проверьте, тестировали ли модель на внешних, а не только «своих» данных.
- Соотнесите результат со своими симптомами и историей болезни — совпадает ли картина.
- Не меняйте назначенное лечение на основании ответа нейросети.
- Покажите заключение и снимки живому врачу и примите решение вместе с ним.
В России применение медицинского ИИ регулируется как программное обеспечение — медицинское изделие, которое проходит регистрацию в Росздравнадзоре. Даже зарегистрированный сервис остаётся вспомогательным инструментом: ИИ-доктор онлайн — это ассистент для подготовки к приёму и разъяснения формулировок, а клиническое решение принимает врач.
Ещё раз о главном. Не занимайтесь самодиагностикой и самолечением по ответам нейросети. При боли в груди, затруднённом дыхании, резкой слабости, нарушении речи или других тревожных симптомах немедленно обратитесь за медицинской помощью. Телефон экстренных служб — 103 (скорая) или 112 (единый номер).
