汤森路透自建法律AI模型

The Decoder··作者 Maximilian Schreiner

关键信息

公司表示,当模型能够访问汤森路透的内容和工具时,表现最强;但在推理和编程基准上则明显较弱。公司还称,目前用于训练的内容还不到可用内容的 10%,这意味着如果继续扩大训练流程,模型仍可能进一步提升。

资讯摘要

汤森路透推出了名为 Thomson 的首个内部语言模型,面向法律工作,并且是在阿里巴巴的 Qwen 基础模型之上构建的。公司称,过去两年多里在人员和算力上的总投入约为 4000 万美元,而外界常提到的 45 万美元只对应当前版本的最后一次训练。这个总投入还没有完全算上真正的资产——来自 Westlaw、Practical Law、Checkpoint 和 Reuters 等产品的数十年专有内容,以及数百名领域专家投入的工作时间。根据公司说法,模型最初基于开源 Qwen 版本,最近一次使用的是 Qwen3.5-397B;随后公司与帝国理工学院合作,先对其进行面向安全、伦理和政治中立性的再训练,这个中间版本被命名为 Snowdon。

之后,模型又经历了在公司自有内容上的预训练、由领域专家参与的后训练,以及在汤森路透自有工具环境中的 agentic reinforcement learning。到目前为止,用于训练的内容还不到可用内容的 10%。公司表示,当模型能够访问专有内容和工具时,它的表现会明显更强,但在公司自己的基准测试中,它在 Stanford LegalBench 和 Harvey Legal Agent Benchmark 上仍落后于更强的前沿模型。汤森路透认为,自己训练模型比对 OpenAI 或 Anthropic 的前沿模型做微调更合适,因为外部供应商仍会控制推理定价、产品路线图,以及对 Westlaw 等工具中高价值数据的访问。

汤森路透自建法律AI模型

资讯正文

汤姆森路透押注投入 4000 万美元自建 AI,而不是向 OpenAI 或 Anthropic“租用”

要点

- 汤姆森路透已经在阿里巴巴的 Qwen 基础上构建了自己的法律工作 AI 语言模型“Thomson”。

- 这款耗资 4000 万美元的模型是在公司自有数据和领域专家的共同参与下训练出来的。不过在测试中,只有当它能够访问公司独家内容时,才会超过 GPT-5.4 等竞争对手。

- 自建的目的在于降低成本并保持公司的独立性,而不是去适配外部模型。“Thomson”将首先用于文档审阅,同时还会发布一个更小的版本,采用非商业许可。

借助“Thomson”,这家专业信息公司推出了首个自研语言模型,基于阿里巴巴的 Qwen 构建。当它能够调用公司的自有内容和工具时,这款模型能取得顶尖成绩。

据公司称,汤姆森路透在两年多时间里为员工和算力投入了约 4000 万美元。外界更常提到的 45 万美元,只涵盖了当前版本最后一次训练运行的成本。即便是全部金额,也还没有算上真正的资本:来自 Westlaw、Practical Law、Checkpoint 和 Reuters 的数十年内容,以及数百名领域专家投入的工作时间。

公司表示,其基础是阿里巴巴的开源 Qwen,最近使用的是 Qwen3.5-397B。汤姆森路透与帝国理工学院合作,首先对这个中文模型进行了安全、伦理和政治中立方面的再训练。这个中间版本被称为“Snowdon”,名字取自威尔士的一座山。

随后,公司又基于自有内容进行预训练,在领域专家参与下进行后训练,并在公司自己的工具环境中开展 agentic 强化学习。到目前为止,用于训练的可用内容还不到 10%。

CTO Joel Hron 表示,公司“可能已经把开源起点改变了接近六次”。研究主管 Jonathan Schwartz 补充说,更重要的发现是“与其说是单个模型,不如说是我们搭建的模型工厂”。

基准测试建立在不对称比较之上

这篇博客文章声称,Thomson 位列全球最佳模型之列。公司的自有数据则呈现出更为克制的画面:在 Stanford LegalBench 上,Thomson(0.823)落后于 Gemini 3.1 Pro 和 GPT-5.5。在 Harvey Legal Agent Benchmark 上,它紧随 Opus 4.8 之后。在指令遵循和难度很高的 PrBench Legal 上,它处于领先地位。但在推理,尤其是编码方面,它的表现则大幅下滑。这样的比较在方法上也存在偏差,因为 Thomson 参与的是 test-time scaling,而 GPT-5.5 则是在没有 reasoning mode 的情况下运行。

Bean 表示,能够“基于自己的工具进行训练并使用这些工具练习”会带来“非常大的提升”,而外部供应商无法做到这一点。值得注意的是,GPT 5.4 在接触这些内容后也会同样显著提升。因此,数据访问几乎和专门训练一样重要。公司并未测试更新的模型。尽管如此,如果公司转向更强的版本,例如 Qwen3.8,并将可用内容的使用率大幅推高到 10% 以上,内部模型的微弱领先优势仍有可能进一步扩大。

而不是对最前沿模型进行微调的内部模型

那么,为什么要自己构建模型,而不是用 OpenAI 或 Anthropic 的前沿模型在法律数据上进行微调呢?汤森路透认为有三点理由反对这么做。首先是经济性:Schwartz 说,标准的微调技术“往往非常容易削弱通用能力”。而且你还会在推理成本和产品路线图上被供应商锁定。一个更小的、自主开发的模型,恰恰在文档审查这类高频工作上更划算。

第二是数据:在 Westlaw 这样的自有工具内部训练,正是性能跃升的来源。基准测试证明了这一点,而公司不会把这种访问权限交给任何人。第三是复利效应,Hron 将其描述为“租房和买房的区别”。每一次在产品更新过程中进行的专家复核,都会变成训练数据。Hron 说,借助内部模型,“你是在为一项你长期拥有的东西积累权益,而这种权益会随着时间复利增长。”而使用第三方模型时,这些价值会在供应商那里消失。

对汤森路透来说,这种做法之所以有效,是因为它能结合三种稀缺要素:独占数据资产、数百名全职领域专家,以及能够客观衡量质量的工作流程。对于拥有这种条件的公司而言,这个案例表明,开源社区与前沿实验室之间的差距可能只剩几个月,而 4000 万美元就足以打造一个有竞争力的专业模型。对于既没有专有数据、也没有大规模评估结果能力的公司来说,自建模型在很大程度上买到的只是持续的维护成本。

Hron 认为,AI 领域下一项竞争优势“将来自于知道如何编排它,以及知道哪些智能能力重要到值得自己拥有。”

在高频文档审查中的首次应用

在首发阶段,汤森路透接管了 CoCounsel Legal 中的 Tabular Analysis 功能,在这里,更小、成本更低的模型在经济上更合理。该产品仍然是多模型架构,管理员可以切换。Thomson 并不是要充当编排器,而是用于处理引文核对等子任务。公司表示,客户数据不会用于训练。

一个小版本即将以非商业许可的开放权重模型形式登陆 Hugging Face,随后还会发布技术报告和开发者门户。Hron 说,目前公司已与一些律所就直接授权展开早期、尚不具约束力的谈判。

没有炒作的 AI 新闻——由人类精心筛选

订阅 THE DECODER,享受无广告阅读、每周 AI 新闻简报、我们每年六次发布的独家“AI Radar”前沿报告、完整档案访问权限,以及评论区访问权限。

来源与参考

  1. 原始链接
  2. Thomson Reuters bets $40M on owning its AI instead of renting from OpenAI or Anthropic

收录于 2026-08-25