9 月 18 日,阿里巴巴达摩院与浙江大学医学院附属第一医院等机构联合研发的通用医疗影像 AI 模型 DAMO RADAR 登上国际顶级学术期刊《科学》(Science)。它面向腹部增强 CT 诊断,可一次性识别超过 146 种病症,覆盖 18 个人体器官,诊断准确性首次达到影像科专家级水平,模型、核心代码与技术框架已全面开源。
这不是又一款"能聊两句医学"的大模型,而是直接在临床最难的阅片场景里,把多病种识别做到了专家水位。它的意义,值得拆开看。
为什么是腹部 CT,又为什么难
在影像科,腹部 CT 长期被认为是"最难读的 CT"。一份腹部报告要覆盖消化、泌尿等多个系统的数十个器官,即便是中高级医生,完成一份报告也要 20 分钟到半小时。难点在于:腹部器官大多是软组织,密度相近,病灶藏在里面很容易被漏掉;而且潜在病变有数百种,远不是单一问题。
传统医疗 AI 走的是"一病一模"路线——一个模型只针对一种疾病训练,比如肺结节、糖尿病视网膜病变各自一个模型。这种方式在特定病种上效果不错,但代价巨大:每个模型都要医生逐张标注数据,研发周期动辄两三年,通用性差,换个病情就无从下手。面对真实临床的复杂多变,单一病种模型很难"举一反三"。
DAMO RADAR 怎么做到的
达摩院没有走"堆标注"的老路,而是用视觉-语言学习(Vision-Language Learning)让模型直接学影像和诊断报告之间的内在关联——不是让医生框出病灶,而是让模型从海量"片子+报告"的配对里,自己领悟"某种影像表现对应什么病"。
关键在于他们首创的器官级细粒度对齐策略:把 CT 三维数据拆解成独立的器官级解剖单元,先在器官层面做精准对齐,再和报告文本匹配。这相当于复刻了放射科医生"按器官逐个排查"的阅片逻辑——先看肝、再看胰、再看胆道。这样做既摆脱了对人工标注的依赖,又让模型把注意力集中在具体器官及其异常上,不被大片正常组织干扰。
数据说话
论文给出的验证相当硬:
- 在近 4 万例连续临床病例、146 种病症的测试中,模型平均 AUC 达 0.913(AUC 衡量区分患者与健康人的能力,越接近 1 越好);即便面对训练之外的急腹症场景,AUC 仍高达 0.904,泛化能力出色。
- 在覆盖 14 家医院、26 名影像科医生的人机对比中,DAMO RADAR 的平均诊断准确率超过其中 23 名医生。
- 更重要的不是"取代医生",而是"放大医生":在 AI 提示下,放射科医生的诊断敏感性(防漏诊能力)提升约 10%,阅片耗时缩短 30% 以上,低年资医生的水平被拉到高年资附近。
浙大一院放射科主任肖文波(30 余年从业)的评价很到位:这是行业一直渴望却普遍认为难以达成的突破,希望它能尽快落地基层——基层医院阅片量有限、医生经验相对不足,恰恰是最需要"智能阅片导航"的地方。
开源与范式价值
DAMO RADAR 已全面开源模型、代码和框架。这有两个层面的价值:
一是可复现、可审计。医疗是容错极低的领域,开源意味着全球研究者能检验它、改进它,而不是只能相信厂商宣传。
二是范式可迁移。达摩院明确表示,这套"器官级对齐 + 视觉语言学习"的范式不只限于腹部 CT,有望拓展到其他医疗影像(如胸部、神经影像)。这意味着通用医疗 AI 的研发路径被打开了一条新缝。
事实上达摩院在医疗 AI 上已有多年积累:胰腺癌、胃癌、肠癌等消化系统肿瘤筛查,以及主动脉夹层预警,三年内发表了 1 篇 Science、5 篇《自然·医学》和十余篇其他顶刊论文。DAMO RADAR 是这条线上的集大成者。
一点冷静的判断
也要看到边界:DAMO RADAR 目前是"辅助诊断"定位,不是独立出报告的医生;它的强项在腹部增强 CT 的多病种筛查与提示,离覆盖全身、全流程的通用医疗 AGI 还有距离。而且"准确率超过 23/26 名医生"是在特定测试集上的结果,真实-world 表现仍要在大规模、多中心部署中持续验证。
但无论如何,一个开源的、达到专家水位的通用影像模型,对"AI 能不能真正进临床"这个老问题,给出了目前最实在的一份答卷。