清华大学医学院黄天荫团队合作提出医疗人工智能安全风险分级框架

TKPaper-你的智能选刊助手
查找参加最新学术会议,发表EI、SCI论文,上学术会议云
热门国际学术会议推荐 | 出版检索稳定,快至7天录用
2026年电子, 通信与计算机科学国际会议(ICECCS 2026)
2026年智能机器人与控制技术国际会议(CIRCT 2026)
2026年传感器技术、自动化与智能制造国际会议(STAIM 2026)
ICCC 2026
文章导读
医疗AI从试点走向临床,真正的风险并不只体现在准确率下降,数月甚至数年后出现的延迟伤害也可能难以追溯。黄天荫团队联合多机构提出S1-S4四级临床安全分类框架,强调等级不是模型固有属性,而取决于具体部署中的任务、工作流、患者群体、医生复核与后续随访,并对应不同的验证、监测和限制措施。医疗机构如何据此及时发现意外行为,在不可逆后果出现前完成干预与治理?
— 内容由好学术AI分析文章内容生成,仅供参考。

近日,清华大学副教务长、医学院院长黄天荫教授联合上海交通大学、斯坦福大学、伦敦国王学院和新加坡国家眼科中心等机构学者发表医疗人工智能安全风险分类观点文章。文章面向医疗AI从研发试点走向常规临床应用的安全治理需求,提出S1-S4四级临床安全分类框架。

评价医疗AI是否安全,不能只看准确率或短期表现。文章指出,一些由AI引发的伤害可能在诊断或干预数月乃至数年后才显现。这些伤害难以追溯到最初的AI输出,但可能已经造成严重或不可逆的后果。因此,暂未观察到伤害,并不足以证明系统安全。真正重要的问题是:当系统在新的患者群体、场景或工作流程中出现意外行为时,医疗机构能否及时发现、追溯并采取干预。

文章借鉴了基于可判定性理论的R1-R3风险分类思路,将其转化为面向临床工作流的S1-S4分级。四个等级并非简单的性能评分,而是分别对应不同的验证、复核、随访和限制措施。

清华大学医学院黄天荫团队合作提出医疗人工智能安全风险分级框架

医疗人工智能安全风险分类

该框架最关键的判断是:S等级不是AI模型本身的固定属性,而是具体部署方式的安全标签。等级取决于AI承担的临床任务、所嵌入的工作流程、服务的患者群体、能否持续跟踪患者的后续情况,以及医生能否在采取行动前进行有效复核与干预。

文章以此前发表的DeepDR-LLM研究作为真实临床工作流示例。DeepDR-LLM整合图像深度学习与大语言模型,用于基层糖尿病管理和糖尿病视网膜病变筛查。当系统仅提供经医生复核、编辑的决策支持时,可视为S2;当安全取决于患者是否完成眼科转诊及后续结局时,部署情境趋向S3;若AI输出绕过临床判断,被用于拒绝转诊、延迟专科诊疗或直接指导高风险治疗,则可能接近S4。该案例说明,同一项AI功能会因人类监督和后续照护条件不同而产生完全不同的安全要求。

针对延迟伤害,文章提出多时间窗部署后监测。首先,在数日至数周内快速捕捉事件、近似失误和高风险输出信号;其次,在随后数月按具体用途设置结局核查点,例如30天、90天和365天。必要时,再通过登记系统、医保或理赔数据链接以及实施后研究,开展超过12个月的长期监测。上述时间点应根据临床用途调整,并非适用于所有AI系统的统一固定周期。

在责任分工上,供应商可提出初始S等级,并提供预期用途、人工监督、审计日志、监测接口和模型更新证据。但部署医疗机构应承担最终治理责任,并通过本地AI治理委员会或同等监督机制,在上线前确认等级。

此后,应在试点结束、到达预定监测节点,或出现预设触发情形时重新评估S等级。这些情形包括适用人群或应用场景扩大,放宽医生复核要求,转诊、医嘱或出院等决策转为自动执行,数据分布或系统性能发生明显变化,患者随访或治疗结果追踪不到位,险情或不良事件集中发生,或供应商更新改变系统的预期用途或运行方式。

临床负责人和AI治理委员会应有权缩小系统的适用范围、暂停使用、撤销相关更新或恢复到此前的运行状态、重新分级,必要时禁止使用。

文章强调,S1-S4框架旨在补充而非替代欧盟《人工智能法案》、国际医疗器械监管机构论坛的软件医疗器械框架,以及美国食品药品监督管理局、美国国家标准与技术研究院和世界卫生组织的相关指南。其主要价值在于将伤害何时显现、医生何时必须复核、何时需要链接随访结局,以及谁有权暂停或回滚系统,纳入同一套临床治理逻辑。

论文最后指出,医疗AI不仅应以目前的表现或安全性来判断,还应看医疗系统能否发现、追溯并减轻它未来可能造成的伤害。S1-S4框架由此将医学“首先,不伤害”的原则延伸为:既关注当下,也守护未来。

8月17日,上述研究成果以“医疗人工智能安全风险分类”(A Classification of Safety Risks in Medical AI)为题,在线发表在新英格兰医学杂志出版集团‌(NEJM Group)旗下《新英格兰医学杂志·医学人工智能期刊》(NEJM AI)。

上海交通大学计算机学院教授盛斌与清华大学医学院博士生宋佳莹(Jiaying Song)为共同第一作者;黄天荫教授为通讯作者。清华大学自动化系吴嘉敏、斯坦福大学尼甘·H·沙阿(Nigam H. Shah、伦敦国王学院约瑟普·卡尔(Josip Car为共同作者。相关作者单位还包括北京市视觉科学与转化医学研究中心、北京清华长庚医院眼科中心、清华大学临床医学院、清华大学生物医学工程学院、新加坡眼科研究所和新加坡国家眼科中心等。

论文链接:

https://ai.nejm.org/doi/10.1056/AIp2600358

供稿:医学院

编辑:李华山

审核:王晓霞

© 版权声明
TKPaper-你的智能选刊助手
热门国际学术会议推荐 | 多学科征稿、征稿主题广 | 免费主题匹配
2026年IEEE第三届先进机器人, 自动化工程与机器学习国际会议(ARAEML 2026)
2026年智能机器人与控制技术国际会议(CIRCT 2026)
2026年传感器技术、自动化与智能制造国际会议(STAIM 2026)
IEEE ICCT 2026

相关文章

查找最新学术会议,发表EI、SCI论文,上学术会议云
热门国际学术会议推荐 | 立即查看超全会议列表

3 条评论

  • 聪明鹦鹉
    聪明鹦鹉 读者

    部署医疗机构要承担最终责任,这点很关键

    上海上海市
    回复
  • 内向风暴
    内向风暴 读者

    延迟伤害这个点确实容易被忽视

    广东省深圳市
    回复
  • 阴阳术士
    阴阳术士 游客

    这个分级思路挺清晰的

    广东省深圳市
    回复