AI助手提升巴基斯坦法院效率

The Decoder··作者 Matthias Bastian

关键信息

JudgeGPT 采用检索增强生成,检索了129,235份法律文档,其中包括128,292份法院判决和943部巴基斯坦法律,并从最相关的十段内容中生成带引文的答案。针对性培训非常关键:接受六次、每次90分钟讲座的法官,使用该工具的频率约为仅参加通用研讨会法官的四倍。

资讯摘要

苏黎世联邦理工学院、伦敦帝国理工学院和新经济学院的研究人员在巴基斯坦司法系统内部进行了一项大型随机实地实验,检验 AI 是否能够提升公共部门生产率。研究背景十分严峻:巴基斯坦每10万人中不足两名法官,而到2024年底,积压案件达到226万件,其中82%集中在初审法院。实验开始前,只有约25%的法官曾使用过 ChatGPT 这类大语言模型。该研究覆盖了118个法院的1,559名法官,约占巴基斯坦初审法官的一半。所用系统名为 JudgeGPT,基于 OpenAI 的 GPT-4,专门面向巴基斯坦初审法院,并采用检索增强生成技术。它会搜索一个包含129,235份法律文档的数据库,并根据最相关的内容生成带引文的答案。研究人员将法官分成三组:一组获得 JudgeGPT 和针对性培训,第二组获得 JudgeGPT 但只参加通用的法律与技术研讨会,控制组则只参加研讨会而没有 AI 权限。

结果显示,单纯提供 AI 的效果并不明显,但针对性培训大幅提高了使用率,并改变了法官的使用方式。40周后,接受针对性培训的法官平均登录近60次、提交超过200条提示词,而对比组平均只有约20次登录和不到50条提示词。使用培训后 AI 的地区处理案件更多,中等使用强度下,每个地区每年大约多结案1,848起,提升幅度约为6.3%。即便使用强度较低的地区,也大约多结案616起。研究还发现,裁判质量总体持平或有所提升,上诉率略有下降,并且没有发现 AI 使用增加性别或宗教偏见的证据。按雇佣足够多的新法官来达到同样产出来估算,这项干预每投入1美元可带来约38.50美元回报,即便采用更保守的算法,回报也至少有10美元。

AI助手提升巴基斯坦法院效率

资讯正文

一套 AI 系统帮助巴基斯坦法官清理了积压如山的案件,投资回报率达到每投入 1 美元带来 38.50 美元收益。

AI 能让政府机构更高效吗?来自苏黎世联邦理工学院、伦敦帝国理工学院和新经济学院的研究给出了迄今最有力的实验性证据。

据作者称,巴基斯坦每 10 万居民还不到 2 名法官;欧盟有 22 名,英格兰和威尔士有 30 名。到 2024 年底,仍有 226 万起案件待审,其中 82% 集中在初审法院。法官们使用的是非常基础的技术,且没有辅助工作人员。在这项实验开始之前,只有大约 25% 的法官曾使用过像 ChatGPT 这样的大型语言模型。

来自苏黎世联邦理工学院、新经济学院和伦敦帝国理工学院的研究人员与巴基斯坦司法系统开展了一项大规模田野实验。这项随机试验覆盖了 1,559 名法官、118 家法院,约占巴基斯坦初审法官总数的一半。

所用工具名为 JudgeGPT,是基于 OpenAI 的 GPT-4 构建、专为巴基斯坦初审法院设计的 AI 助手。它采用检索增强生成技术,在一个包含 129,235 份文档的数据库中检索,其中包括 128,292 份法院裁决和 943 部巴基斯坦法律。当法官输入查询后,JudgeGPT 会挑选最相关的 10 段内容,并生成带引用的答案。

受过培训的法官每个地区每年多结案 1,848 起

研究人员将法官分成三组。一组获得了 JudgeGPT 的使用权限以及针对性培训:在三周内接受 6 次、每次 90 分钟的讲座,由 ETH 的 Elliott Ash 教授在下班后授课。法官们学习了哪些任务适合使用该工具、它的不足之处,以及如何核查其输出。

第二组获得了同样的 AI 使用权限,但只参加了一个关于技术与法律的一般性研讨会。对照组也参加了该研讨会,但没有 JudgeGPT 使用权限。

仅有 AI 使用权限的效果并不大。接受针对性培训的法官使用 JudgeGPT 的频率是仅参加一般研讨会组的 4 倍。40 周后,接受培训的法官平均登录近 60 次,输入超过 200 条提示词;比较组平均约登录 20 次,提示词不到 50 条。

拥有更多受训法官的地区结案更多。在中等接触水平下,这意味着每个地区每年大约多结案 1,848 起,增幅为 6.3%。即便是在接触程度最低四分位的地区,也仍然多清理了约 616 起案件。

判决质量有所提升,且没有新增偏见

裁判质量保持稳定,甚至有所改善。每 1,000 起已结案件中的上诉率略有下降,而法官的工作时长保持不变,工作与生活平衡也没有变化。研究人员估计,按要雇用足够多额外法官以实现同样产出所需成本计算,节省约为每投入 1 美元带来 38.50 美元回报。即便是保守估计,回报也“至少”有每投入 1 美元带来 10 美元。

对约 4,000 份法院判决的审查发现,AI 标记的文本更多,这在预期之中。但可读性、篇幅以及法律论点数量都保持稳定。经过两名巴基斯坦律师验证的、基于 LLM 的质量检查显示,判决质量略有提升。与对照组相比,接受培训法官的裁决在成对比较中有 59% 被评为更好,而对照组这一比例为 42%。研究未发现 AI 使用会增加司法语言中的性别或宗教偏见。

动手培训影响法官如何使用 AI

研究人员审查了约 1,500 名法官的匿名聊天记录。法律研究、文本编辑和文本生成是最常见的任务。大约 60% 的查询是在寻求有关法律、程序或法律概念的信息。

接受过培训的法官更常使用 JudgeGPT 来编辑和总结文本,因为在这些任务上,语言模型更可靠。他们提出的大而泛的法律问题更少,而这类问题的幻觉风险更高。研究人员表示,这种培训将法官引导到有限的辅助任务上,同时把最终决定权留在他们手中。

只有大约五分之一的请求涉及研究人员所称的“实质性 AI 委派”,即法官让 JudgeGPT 独立评估裁决或起草推理。培训使法官更有可能自行裁决案件,并且只使用 AI 来整理他们的推理过程。

研究人员强调,他们的发现并不支持用 AI 取代法官。他们表示,这项实验表明,AI 可以提高公共部门的生产力,但前提是要配合培训,把用户引导到合适的任务上。没有这种培训,大部分收益都会消失。

这项研究中的生产率提升很可能只是下限,而不是上限。JudgeGPT 运行在 GPT-4 上,这是一种预推理模型,在当时最适合这个项目。如今的推理模型写得更好,幻觉更少,也能更可靠地处理复杂任务。

来源与参考

  1. 原始链接
  2. An AI system helped Pakistani judges clear massive backlogs at $38.50 return per dollar invested

收录于 2026-07-22