22.07.2026

DeepSeek приблизился к ChatGPT в медицинских задачах, но показал слабые места в отчетах врачей

DeepSeek-R1 проверили на нескольких медицинских задачах, чтобы понять, насколько новая языковая модель подходит для клинического мышления, экзаменационных вопросов, анализа онкологических данных и работы с радиологическими отчетами. Исследование показало неоднозначную картину: DeepSeek способен конкурировать с сильными закрытыми моделями в рассуждениях и отдельных клинических задачах, но не во всех сценариях оказался лучшим.

Авторы работы сравнили DeepSeek-R1 с ChatGPT-o1 и Llama 3.1-405B. Для проверки использовали четыре группы задач: вопросы экзамена USMLE, текстовые клинические случаи, классификацию ответа опухоли по критериям RECIST 1.1 и составление кратких выводов по диагностическим изображениям. Такой набор задач важен, потому что медицина не сводится к одному типу теста: врачу нужно отвечать на вопросы, рассуждать по сложным случаям, оценивать динамику болезни и точно формулировать результаты обследований.

USMLE — это американский экзамен для получения медицинской лицензии. Его часто используют для оценки медицинских знаний у языковых моделей, потому что он содержит сложные вопросы по разным разделам медицины. В этом тесте DeepSeek-R1 показал точность 0,92, то есть правильно справился примерно с 92% заданий. Это высокий результат, но он оказался немного ниже результата ChatGPT-o1, у которого точность составила 0,95. При этом DeepSeek-R1 заметно обошел Llama 3.1-405B, показавшую точность 0,83.

Такой результат говорит о том, что DeepSeek-R1 уже способен работать с медицинскими экзаменационными вопросами на очень высоком уровне. Однако небольшое отставание от ChatGPT-o1 показывает, что лидерство зависит от конкретной задачи и набора данных. Нельзя просто сказать, что одна модель «лучше в медицине» во всех случаях. Модель может быть сильнее в рассуждениях, но слабее в кратком медицинском изложении, или хорошо проходить тесты, но хуже работать с реальными клиническими документами.

В текстовых клинических случаях DeepSeek-R1 выступил примерно на уровне ChatGPT-o1. Исследователи использовали задания, основанные на диагностических и управленческих сценариях, включая материалы New England Journal of Medicine и Médicilline. В таких задачах модель должна не просто выбрать факт из памяти, а разобраться в описании пациента, симптомах, результатах обследований и возможной тактике. По точности DeepSeek-R1 оказался сопоставим с ChatGPT-o1, без статистически значимого отрыва.

Клиническое рассуждение — это особенно сложная часть медицинского ИИ. Оно требует связывать отдельные признаки в общую картину, учитывать вероятности, исключать похожие диагнозы и объяснять, почему выбран тот или иной вариант. Для врача важно не только назвать правильный диагноз, но и показать ход мысли. Если модель угадывает ответ без надежного объяснения, доверять ей опасно, потому что в другой похожей ситуации она может ошибиться.

Именно поэтому интересен отдельный результат исследования: шаги рассуждения, которые выдавал DeepSeek-R1, эксперты оценили выше, чем объяснения ChatGPT-o1 и Llama 3.1-405B. Средний балл DeepSeek составил 3,61 по шкале Лайкерта, тогда как ChatGPT-o1 получил 3,22, а Llama 3.1-405B — 3,13. Шкала Лайкерта в таких оценках используется для того, чтобы эксперты могли выставить качество ответа по нескольким уровням, а не просто отметить «правильно» или «неправильно».

Этот результат важен, потому что DeepSeek-R1 относится к моделям, ориентированным на рассуждение. Такие модели пытаются строить более подробную логическую цепочку, прежде чем дать итоговый ответ. В медицине это может быть полезно для обучения студентов, обсуждения сложных случаев и проверки альтернативных гипотез. Но подробное рассуждение само по себе не является гарантией правильности: оно может выглядеть убедительно даже при ошибочной логике.

Отдельно исследователи проверили задачу RECIST 1.1. RECIST — это набор критериев, которые используют в онкологии для оценки ответа солидных опухолей на лечение. Проще говоря, врачам нужно понять, уменьшилась ли опухоль, увеличилась ли, появились ли новые очаги или состояние осталось стабильным. Для этого анализируют размеры поражений и сравнивают данные обследований в динамике. Такая задача требует аккуратности, потому что от классификации может зависеть оценка эффективности терапии.

В задаче классификации по RECIST DeepSeek-R1 снова показал результат, близкий к ChatGPT-o1. Его точность составила 0,74 против 0,81 у ChatGPT-o1, и разница не была статистически значимой. Это означает, что в рамках данного исследования нельзя уверенно говорить о превосходстве одной из этих двух моделей в такой онкологической задаче. Оба инструмента могут быть полезны как помощники, но требуют проверки специалистом.

При этом работа с RECIST хорошо показывает, почему медицинский ИИ не должен использоваться без контроля. Даже небольшая ошибка в измерении, интерпретации динамики или понимании критериев может привести к неправильной классификации ответа на лечение. Для пациента это не абстрактная ошибка в тесте, а потенциально важная часть клинического решения. Поэтому такие модели могут помогать врачу, но не должны самостоятельно определять тактику лечения.

Самым слабым местом DeepSeek-R1 в исследовании стала задача краткого изложения радиологических отчетов. Радиологический отчет — это описание результатов визуального обследования, например КТ, МРТ или другого метода диагностики. Врач-рентгенолог описывает находки, а затем формулирует заключение. От качества краткого вывода зависит, насколько быстро и правильно лечащий врач поймет суть обследования.

В этой задаче ChatGPT-o1 показал более высокое качество, чем DeepSeek-R1. Средняя оценка глобального качества кратких отчетов составила 4,8 из 5 у ChatGPT-o1 и 4,5 из 5 у DeepSeek-R1. Разница была статистически значимой. Это не значит, что DeepSeek писал плохие отчеты, но показывает, что в задачах медицинского суммирования закрытая модель OpenAI в данном тесте оказалась сильнее.

Причина может быть связана с тем, что краткое изложение медицинского отчета требует не только рассуждения, но и точности формулировок, умения не потерять важные детали, не добавить лишнего и сохранить клинический смысл. Языковая модель может случайно опустить значимую находку, преувеличить вывод или сделать заключение слишком общим. В радиологии такие ошибки особенно чувствительны, потому что отчет часто становится основанием для дальнейших действий врача.

Исследование показывает, что DeepSeek-R1 нельзя оценивать только через громкие сравнения с ChatGPT. В одних задачах он почти не уступает, в других немного слабее, а в качестве объяснения медицинской логики может выглядеть даже сильнее. Это делает модель перспективной, но не универсальной. Для здравоохранения важно подбирать ИИ-инструмент под конкретную задачу, а не переносить результаты одного теста на всю медицину.

Для медицинского образования DeepSeek-R1 может быть особенно интересен. Его способность строить развернутые рассуждения помогает студентам видеть, как можно подходить к клинической задаче, какие признаки учитывать и почему один диагноз вероятнее другого. Такой ИИ может выступать как тренажер для разбора случаев, подготовки к экзаменам и обсуждения диагностических ошибок. Но студент должен понимать, что модель не является преподавателем и может ошибаться.

Для врачей DeepSeek-R1 может быть полезен как вспомогательный инструмент при работе с клиническими сценариями, предварительном анализе текста, поиске возможных направлений рассуждения и подготовке черновиков. Но итоговое решение должно оставаться за специалистом. Врач видит пациента, может задать дополнительные вопросы, провести осмотр, оценить анализы в контексте и несет профессиональную ответственность за решение.

Для больниц и медицинских организаций вывод еще шире. Перед внедрением ИИ нужно проверять модель именно на тех задачах, для которых ее собираются использовать. Нельзя ограничиться общими бенчмарками или рекламными заявлениями. Если модель нужна для радиологических отчетов, ее надо тестировать на радиологических отчетах. Если для онкологии — на онкологических сценариях. Если для приема пациентов — на реальных или тщательно смоделированных клинических случаях.

Особое значение имеет проверка ошибок. Средняя точность может выглядеть высокой, но в медицине важно знать, какие именно ошибки делает модель. Одно дело — перепутать редкий термин в учебном вопросе, другое — не заметить признак опасного состояния или предложить неподходящее лечение. Поэтому медицинский ИИ должен оцениваться не только по проценту правильных ответов, но и по тяжести потенциального вреда.

Также важно, как модель выражает неопределенность. Хороший медицинский помощник должен уметь сказать, что данных недостаточно, что нужны дополнительные обследования или что вопрос требует очной консультации врача. Модель, которая всегда отвечает уверенно, может создавать ложное ощущение надежности. В клинической практике признание неопределенности часто не слабость, а важная часть безопасного мышления.

DeepSeek-R1 интересен еще и как пример открытой или более доступной альтернативы закрытым моделям. Если такие системы можно разворачивать дешевле и гибче, они могут быть полезны для научных групп, университетов, медицинских организаций и стран с ограниченными ресурсами. Но доступность не отменяет требований к качеству, безопасности, защите данных и регулированию. В здравоохранении дешевый инструмент не должен становиться заменой проверенному и безопасному решению.

Отдельный вопрос — защита медицинских данных. Если модель работает через облачный сервис, запросы могут содержать персональные сведения, диагнозы, результаты анализов и другие чувствительные данные. Даже если в исследовании оценивалась техническая точность, реальное внедрение требует юридической и этической проверки. Больницы должны понимать, где обрабатываются данные, кто имеет к ним доступ, используются ли они для обучения и можно ли обеспечить соответствие местным законам.

Исследование также напоминает, что медицинский ИИ быстро развивается, но пока остается инструментом поддержки, а не самостоятельным врачом. Высокие результаты на экзаменах и клинических тестах впечатляют, но реальные пациенты сложнее любых наборов данных. У них бывают неполные сведения, необычные симптомы, сопутствующие болезни, лекарственные взаимодействия, социальные обстоятельства и индивидуальные риски.

Главный вывод состоит в том, что DeepSeek-R1 показал сильный потенциал в медицинских задачах, особенно там, где требуется рассуждение и анализ клинических случаев. Он приблизился к ChatGPT-o1 в нескольких тестах и превзошел конкурентов по оценке качества объяснений, но уступил в суммировании радиологических отчетов. Поэтому DeepSeek можно рассматривать как перспективного медицинского ИИ-помощника, но только при строгой проверке, врачебном контроле и ясном понимании ограничений.

Добавить комментарий