21.07.2026

DeepSeek обошел модели OpenAI на китайском медицинском экзамене

Китайские модели DeepSeek-R1 и DeepSeek-V3 показали более высокие результаты, чем несколько моделей OpenAI, на китайском национальном экзамене для получения медицинской лицензии. Исследование опубликовано в журнале JMIR Medical Education и посвящено тому, насколько большие языковые модели могут быть полезны в медицинском образовании, подготовке к экзаменам и проверке клинических знаний на китайском языке.

Авторы работы сравнили семь моделей: DeepSeek-R1, DeepSeek-V3, ChatGPT-o1 pro, ChatGPT-o3 mini, GPT-4o, ERNIE 4.5 Turbo от Baidu и Qwen 3 от Alibaba. Для проверки использовался китайский национальный медицинский лицензионный экзамен 2021 года. Это важный экзамен для врачей в Китае, который проверяет медицинские знания, клиническое мышление и способность решать задачи, похожие на реальные ситуации в практике.

Экзамен состоял из 600 вопросов с несколькими вариантами ответа. В каждом вопросе был только один правильный вариант. Такие тесты удобны для сравнения моделей, потому что результат можно оценить довольно объективно: модель либо выбрала правильный ответ, либо ошиблась. При этом медицинские экзамены сложнее обычных викторин, потому что требуют не только запоминания фактов, но и понимания симптомов, диагнозов, анализов, лечения и клинической логики.

DeepSeek-R1 показал лучший результат среди всех протестированных моделей. Он правильно ответил на 573 вопроса из 597 засчитанных, что соответствует точности 96%. Три вопроса модель не стала решать и ответила, что пока не умеет работать с такими типами задач, поэтому они были исключены из расчета точности. DeepSeek-V3 занял второе место с результатом 558 правильных ответов из 600, то есть 93%.

Модели OpenAI заметно уступили китайским конкурентам в этом тесте. ChatGPT-o1 pro правильно ответил на 450 вопросов из 600, что соответствует 75%. ChatGPT-o3 mini показал 455 правильных ответов из 600, или 75,8%. GPT-4o дал 452 правильных ответа из 600, то есть 75,3%. Все эти модели прошли экзамен, но разница с DeepSeek-R1 и DeepSeek-V3 оказалась значительной.

Высокие результаты показали и другие китайские модели. ERNIE 4.5 Turbo от Baidu правильно ответила на 572 вопроса из 600, достигнув точности 95,3%. Qwen 3 от Alibaba получила 555 правильных ответов из 600, или 92,5%. Это означает, что преимущество в данном исследовании было не только у DeepSeek, а в целом у нескольких китайских моделей, работающих с китайскоязычным медицинским экзаменом.

Такой результат не обязательно означает, что китайские модели сильнее моделей OpenAI во всех медицинских задачах. Исследование проверяло конкретный экзамен, конкретный язык, конкретный набор вопросов и конкретные версии моделей. Но оно хорошо показывает, насколько важны язык, обучающие данные и локальный контекст. Модель, которая чаще обучалась на китайских текстах, медицинских материалах и экзаменационных форматах, может лучше справляться именно с китайским медицинским тестом.

Это особенно важно для медицинского ИИ. Врачебная практика сильно зависит от языка, национальных клинических рекомендаций, структуры экзаменов, образовательной системы, терминологии и привычных формулировок. Модель, хорошо работающая на английском медицинском экзамене, не всегда автоматически покажет такой же результат на китайском, русском или любом другом языке. Поэтому локальная адаптация может быть не менее важна, чем общий размер модели.

Авторы исследования оценивали не только общую точность, но и результаты по разным типам вопросов. В китайском медицинском экзамене есть задания, проверяющие отдельные знания, клинические случаи, анализ последовательности симптомов и выбор правильного действия в конкретной ситуации. DeepSeek-R1 и DeepSeek-V3 сохраняли преимущество на разных форматах заданий, включая вопросы с разбором клинических случаев и вопросы без клинического контекста.

Клинические случаи особенно важны, потому что они ближе к реальной медицине. В таких заданиях модель должна учитывать жалобы пациента, возраст, анамнез, результаты обследований, возможные диагнозы и варианты лечения. Это требует не просто знания отдельных фактов, а умения связывать их в медицинскую картину. Высокие результаты DeepSeek на таких вопросах говорят о хорошем уровне работы с китайскими медицинскими формулировками.

Исследователи также анализировали совпадение правильных ответов между моделями. Интересно, что объединенный консенсус DeepSeek-R1 и DeepSeek-V3 достиг точности 97,7% на тех вопросах, где сравнение было возможно. Это означает, что две модели часто дополняли друг друга и в сумме могли дать еще более надежный результат, чем одна модель отдельно. Такой подход может быть полезен в будущем для систем, где несколько ИИ-моделей проверяют ответы друг друга.

Однако высокий результат на экзамене не означает, что модель готова самостоятельно работать врачом. Медицинский тест — это ограниченная среда с заранее известным форматом и одним правильным вариантом ответа. Реальная клиника намного сложнее. У пациента могут быть неполные данные, нетипичные симптомы, сопутствующие болезни, противоречивые анализы, лекарственные взаимодействия, социальные факторы и необходимость личного осмотра. Чат-бот не видит пациента и не несет медицинской ответственности.

Поэтому такие модели стоит рассматривать прежде всего как инструменты для обучения и подготовки. Они могут объяснять сложные темы, разбирать экзаменационные вопросы, показывать ход рассуждений, помогать студентам повторять материал и указывать на слабые места. Для медицинских вузов и образовательных платформ это может быть полезным направлением, особенно если модель работает на родном языке студентов и учитывает местную программу.

Для студентов-медиков ИИ может стать интерактивным репетитором. Вместо обычного чтения учебника студент может задать вопрос, попросить объяснить диагноз простыми словами, сравнить похожие болезни, разобрать ошибочный ответ или составить план повторения. Если модель хорошо справляется с национальным медицинским экзаменом, она может помочь готовиться к нему более адресно. Но ответы все равно нужно сверять с учебниками, клиническими рекомендациями и преподавателями.

Для преподавателей такие модели тоже могут быть полезны. Они могут помогать создавать тренировочные вопросы, объяснения к заданиям, варианты клинических сценариев и материалы для самопроверки. Но здесь возникает отдельная задача: проверять качество сгенерированных материалов. Если ИИ ошибется в формулировке вопроса или даст спорное объяснение, студент может запомнить неправильную информацию. Поэтому роль преподавателя не исчезает, а становится еще важнее.

Для медицинских организаций подобные результаты показывают, что ИИ быстро приближается к уровню, при котором он может помогать в справочных и образовательных задачах. Но внедрение в клиническую практику требует намного более строгой проверки. Нужно оценивать не только точность на тесте, но и безопасность ответов, способность признавать неопределенность, устойчивость к сложным случаям, качество ссылок на рекомендации, защиту данных и поведение при потенциально опасных запросах.

Отдельно стоит учитывать, что результаты OpenAI-моделей в этом исследовании могли зависеть от языковой и экзаменационной специфики. Если модель обучалась и тестировалась чаще на англоязычных медицинских материалах, она могла хуже понимать китайские формулировки, местные термины или структуру национального экзамена. Это не делает ее слабой во всех задачах, но показывает, что универсальность больших языковых моделей имеет пределы.

Исследование также усиливает более широкий тренд: китайские ИИ-модели становятся все конкурентоспособнее в специализированных задачах на китайском языке. DeepSeek, Qwen и ERNIE показывают, что локальные компании могут создавать модели, которые хорошо работают не только в общих диалогах, но и в сложных профессиональных областях. Для Китая это важный элемент технологической самостоятельности, особенно в медицине, образовании и корпоративных сервисах.

Для других стран вывод тоже важен. Если медицинский ИИ будет строиться только на англоязычных моделях и данных, он может хуже работать в национальных системах здравоохранения. России, странам Европы, Азии, Ближнего Востока и Латинской Америки нужны модели, которые понимают местные языки, медицинские стандарты, документы, историю болезни и юридические ограничения. Иначе ИИ будет формально мощным, но не всегда точным в реальной локальной практике.

При этом результаты экзамена нельзя воспринимать как разрешение использовать DeepSeek или любую другую модель для постановки диагнозов без врача. Даже 96% точности означает, что часть ответов была ошибочной. В тесте ошибка просто снижает балл, а в реальной медицине неправильный совет может привести к вреду. Поэтому безопасная роль таких систем — помощь в обучении, справочная поддержка, подготовка черновиков и вторичная проверка, но не замена клинического решения.

Важной проблемой остается и объяснимость. Если модель выбирает правильный ответ, нужно понимать, почему она его выбрала. В медицине недостаточно угадывать вариант. Нужно уметь объяснить диагноз, исключить альтернативы, учесть противопоказания и показать ход рассуждений. Если модель дает правильный ответ по неверной причине, это может быть опасно в других, чуть измененных случаях. Поэтому будущие исследования должны оценивать не только точность, но и качество объяснений.

Также важно проверять модели на новых экзаменах и реальных клинических задачах. Один набор вопросов 2021 года дает полезную картину, но не закрывает тему. Модели могут по-разному работать на вопросах других лет, на редких заболеваниях, на сложных многопрофильных случаях, на педиатрии, онкологии, психиатрии, неотложной помощи или профилактической медицине. Чем шире проверка, тем понятнее реальные возможности ИИ.

Главный вывод исследования состоит в том, что DeepSeek-R1 и DeepSeek-V3 показали очень сильные результаты на китайском национальном медицинском лицензионном экзамене и значительно обошли протестированные модели OpenAI в этой конкретной задаче. Это делает DeepSeek перспективным инструментом для медицинского образования на китайском языке. Но даже такие результаты не превращают нейросеть в врача: в здравоохранении ИИ должен оставаться помощником, а не самостоятельным источником медицинских решений.

Добавить комментарий