JAMA:若AI更强则不应强制人工监督

The Decoder··作者 Maximilian Schreiner

关键信息

作者引用了2024年以来的研究,称AI在病史采集、诊断、检查选择、按指南治疗以及慢病管理等五项核心推理任务上,已经能与医生持平甚至更好。他们也承认局限:大多数证据来自模拟场景,人与模型之间的信息交接仍是薄弱环节,而且由于机器人技术尚未成熟,手术、分娩和结肠镜等实体操作仍需由人类完成。

资讯摘要

《JAMA》的一篇观点文章认为,如果医疗AI在推理能力上已经强于“医生+AI”的组合,监管机构就不应再强制要求人类必须介入。作者认为,政策关注的重点不应只是保护医生角色,而应是避免把医疗锁定在一种未来可能明显落后的模式上。文章将这一立场与美国医学会、美国内科医师学会等医生团体的观点区分开来,这些团体主张AI应当辅助临床医生,而不是取代他们。作者还反驳了医生 Robert Wachter 所说的“AI-only care”只是医学中的“经济舱”版本这一说法,认为这种排序尚未被证明。文章的第一组论据来自研究证据:自2024年以来,很多研究都显示,AI在医学的五项核心推理任务上已经能与医生持平甚至更好,包括病史采集、诊断、检查选择、按指南治疗和慢病管理。文中举例称,Google 的 AMIE 在模拟患者对话中,几乎所有类别都比初级保健医生表现更好;ChatGPT o3 在377个复杂病例中有60%能先给出正确诊断,而20名内科医生只有15.9%;Microsoft 的诊断编排系统在预算约束下找到正确诊断的次数约为医生的四倍,而且成本更低。

作者认为,反向结果的研究大多已经过时,或者方法上存在缺陷,例如没有纳入最强模型。文章的第二组论据是对未来的判断:模型仍在快速进步,而医生可能因为频繁使用AI而逐渐丧失部分技能,论文提到一项关于结肠镜的《Lancet》研究支持这一担忧。作者引用一项包含106个实验的荟萃分析称,当人类更强时,人与AI协作会带来收益;但当AI更强时,人类反而会因为在错误的地方推翻系统而降低结果质量。文中还举出一个真实患者案例研究:GPT-4单独在诊断推理上得分92%,而医生在同一模型辅助下只有76%。不过,作者也承认这篇文章有明显限制,因为绝大多数证据来自模拟环境,而不是真实患者护理;人与模型之间的信息交接仍是弱点;此外,手术、分娩和结肠镜等物理操作仍然需要人类完成,因为机器人还不够成熟。文章还提醒,自主系统也有医生不会遇到的风险,比如幻觉、网络中断和网络攻击,因此其安全性和更高准确率之间必须权衡。

JAMA:若AI更强则不应强制人工监督

资讯正文

当 AI 超越医生时,监管机构不应强行让人类介入,JAMA 文章称

《医学期刊》JAMA 上的一篇评论文章预测,自治型 AI 在医学推理上将优于任何“医生-AI”组合。作者希望阻止监管机构把“人类介入”写进规则。

了解这篇 JAMA 文章的作者身份,有助于解释其立场:第一作者 Ezekiel Emanuel 是宾夕法尼亚大学的生物伦理学家,也是奥巴马医保改革的设计者之一,这使他成为美国卫生政策领域的重量级人物。合著者 Neal Khosla 是 AI 远程医疗公司 Curai Health 的 CEO,而他的父亲 Vinod Khosla 同时投资了 OpenAI 和 Curai Health。文中有两位作者将直接从这篇文章所倡导的未来中获益。

这一未来与美国医学会(American Medical Association)和美国内科医师学会(American College of Physicians)等医生组织所持立场相冲突,这些组织认为 AI 应该辅助医生,绝不能取代医生。医学教授 Robert Wachter 在其著作中更进一步,把仅由 AI 提供的护理称为医学中的“经济舱”。JAMA 的作者认为这种分级尚未得到证实,并提出两点反对意见。

第一点涉及研究本身。自 2024 年以来的大多数研究显示,单独使用 AI 在医学的五项核心推理任务上已经与医生持平,甚至更胜一筹,这五项任务分别是采集病史、作出诊断、选择检查、按照指南治疗,以及管理慢性疾病。

谷歌的对话系统 AMIE 在模拟患者对话中几乎所有类别上的得分都高于全科医生。在 377 个复杂病例中,ChatGPT o3 首先给出正确诊断的比例为 60%,而 20 名内科医生仅为 15.9%。微软的诊断编排系统在预算限制下找到正确诊断的概率约为医生的四倍,而且成本更低。作者认为,大多数得出相反结论的研究都已过时,或者方法上存在缺陷,例如没有纳入最好的模型。

第二点则是对未来走向的预测,也是这篇文章的核心。模型进步很快,而医生在使用 AI 的过程中自身技能却在退化,正如一项关于结肠镜检查的《柳叶刀》研究所暗示的那样。从现在起,这一差距只会越来越大。

一旦机器明显领先,负责把关的医生就会从安全网变成错误来源。作者称,一项涵盖 106 项实验的荟萃分析支持了这一点。当人类更强时,组合会带来帮助;当 AI 更强时,人类会在错误的地方推翻系统,反而让结果变差。在一项使用真实患者病例的研究中,单独使用 GPT-4 在诊断推理上的得分为 92%,而让医生接入同一模型后,得分却只有 76%。

作者把国际象棋作为历史类比:1997 年 Deep Blue 击败卡斯帕罗夫之后,人机组合曾在多年里占据主导地位,直到从 2017 年开始,AI 也开始击败这些组合。

给规则制定者的警告

从这一点来看,文章传达的核心信息其实很明确:如果把“必须由医生做最终决定”的指南固定下来,就可能把一种不久后会落后的医疗模式制度化。作者认为,到2030年,自主式AI应该已经能够胜任某些、甚至许多仅限认知任务的工作流程。现在就需要重新思考责任归属、支付方式、监管以及医学培训,他们写道。

不过,正如他们也承认的那样,这一观点仍有局限。几乎所有证据都来自单一任务的模拟,而非真实的患者护理;人与模型之间的信息交接也被视为一个薄弱环节。

手术、分娩和结肠镜检查等身体操作目前也仍将由人类负责,因为机器人还达不到要求。作者承认,自主系统也会以医生不会出现的方式失效,比如产生幻觉、互联网中断或遭受网络攻击。与更高准确性相比,这些风险都必须加以权衡。

来源与参考

  1. 原始链接
  2. As AI beats doctors, regulators shouldn't force a human into the loop, JAMA piece says

收录于 2026-08-19