具身智能观察

通用模型竟然比医疗专用模型更懂医疗?一篇 ACL 论文的两个反直觉发现 | GAIR Paper 123

产业动态

来源:雷峰网发布时间待核实

Doubao 、DeepSeek 在三语数据集上的表现,普遍超过 GPT-4o 和 Gemini。 作者丨幸丽娟 编辑丨岑 峰 医疗,是大模型落地最特殊的场景之一。 特殊在哪里?特殊在一个很微小的错误,就可能导致致命的后果;也特殊在你不能用直觉去判断它"行"还是"不行"—— 你觉得医疗专用模型肯定比通用模型更懂医疗?直觉上是。但实验数据不支持。 你觉得英语训练出来的模型处理英语医疗数据肯定最好?直觉上是。但实验数据也不支持。 这两重"反直觉",正是纽约大学阿布扎比分校和阿布扎比克利夫兰诊所的研究团队在ACL 2026 Findings上发表的论文揭示的核心真相。 论文链接: https://aclanthology.org/2026.findings-acl.573.pdf 论文代码:https://github.com/congboma/MedErrBench 研究团队构建了首个面向医疗错误检测、错误定位和错误纠正的多语言评测基准MedErrBench,覆盖英语、中文和阿拉伯语三种语言,考验了 GPT-4o、Gemini、Llama、Qwen、DeepSeek等一系列主流模型,在多达…

通用模型竟然比医疗专用模型更懂医疗?一篇 ACL 论文的两个反直觉发现 | GAIR Paper 123 | 具身智能观察