布里斯托尔研究人员提议用药物标准检验医疗人工智能
The Decoder··作者 Manuel Uth
关键信息
“Learning Ensemble”要求开发者记录系统的适用边界和训练数据,评估其在不同患者群体中的可靠性,并确认系统是否适合目标临床流程。文章将其描述为概念性起点,实际应用仍需要专家审查、外部评估、反复试验和持续调整。
资讯摘要
布里斯托尔大学研究人员认为,医疗人工智能需要一种类似药物评估文件的结构化信息和测试方案。药物的作用机制有时并不完全清楚,但只要明确剂量、使用时间和适用患者群体,临床医生就能更可靠地使用它们。研究人员因此提出了名为“Learning Ensemble”的框架,将这一思路应用于医疗人工智能。框架的第一部分检查系统的运行边界,包括目标使用者、临床场景、硬件和训练数据。
2021年的一项研究说明了这一点的重要性:一个用于识别新冠感染的X射线人工智能系统,学到的可能是与诊断结果相关的图像细节,而不是肺部疾病迹象,因此换到另一家医院后便失效。第二部分评估系统在不同患者群体中的表现,因为总体准确率合格并不代表系统不会持续误判服务不足的群体。第三部分则考察系统是否真正适合预定的临床任务,例如某个系统将患有肺炎的哮喘患者评为低死亡风险,原因是训练数据中的急诊积极治疗提高了他们的生存率,但这一结果并不适合用于分诊。作者认为,该框架可以提供共同语言和结构,帮助更早发现问题,但可靠部署仍需要专业知识、独立审查和持续改进。

资讯正文
布里斯托尔研究人员称,医学界已经知道如何应对“黑箱”,人工智能可以从中学习
布里斯托尔大学的研究人员提出了一套框架,让开发者能够系统地测试人工智能系统在医疗应用中的可靠性。他们参照了医学界将新药推向市场时所采用的标准。
医疗人工智能系统在早期测试中往往表现良好,但一旦进入临床就会失效,因为它们可能会抓住训练数据中与实际诊断毫无关系的特征。
医学界在面对药物时也存在类似的不确定性:有些药物在人体内究竟如何发挥作用,并未得到完全理解。尽管如此,医学界已经建立了可靠使用这些化合物的方法。每种药物都有一套结构化的信息资料,明确说明其发挥作用的条件,包括剂量、使用时间以及适用的患者群体。正是这套资料让一种化学物质变成了可靠的治疗手段。
受此启发,布里斯托尔的研究人员提议,为医疗人工智能开发者制定一套类似的信息资料。
“Learning Ensemble”工具包包含三个部分
研究人员提出的“Learning Ensemble”涵盖三个方面,开发者必须在系统用于患者之前,对这些方面进行记录和检查。
第一部分关注系统的限制,包括系统面向哪些医生或诊所、运行所需的硬件,以及用于训练系统的患者数据。2021年的一项研究说明了这一点为何重要:一个人工智能系统原本应当通过X光图像识别COVID感染,但它没有识别肺部的疾病迹象,反而抓住了图像中的一些偶然细节——这些细节只是碰巧与诊断结果相关。系统一部署到另一家诊所就失效了。
第二部分是系统在不同患者群体中的可靠性。平均命中率并不够,因为一个系统总体表现良好,却可能经常错误判断某些群体。另一项2021年的研究发现,读取X光图像的人工智能系统在服务不足的人群中,检测出疾病的可能性要低得多。部署这样的系统,会伤害那些本来就已经接受较差医疗服务的患者。
在研究人员看来,第三个方面最为重要:系统是否真正适合其预定的临床用途。一个在技术上能够运行的系统,在诊所里仍然可能毫无用处。例如,某个人工智能系统将患有肺炎的哮喘患者评估为死亡风险较低。在训练数据中,这些患者确实更常存活下来,但这只是因为急诊室会对他们采取特别积极的治疗。对于分诊而言,分诊的目的在于评估新患者的风险,这一结果毫无价值。
作者们将这项工作视为一个起点。在实践中,构建可靠的医疗 AI 系统仍然是一个要求很高的试错过程,需要专业知识、外部审查以及持续调整。他们的框架旨在为开发者提供一套共同的语言和结构,以便更早发现问题。
来源与参考
收录于 2026-09-22