Mistral发布OCR 4用于多语言文档理解

The Decoder··作者 Maximilian Schreiner

关键信息

Mistral 表示,OCR 4 还会输出置信度分数,用来估计它对每个单词或页面的识别确定性。在一项包含 600 多份文档的盲测中,公司称独立评审者有 72% 的时间更偏好 OCR 4 的结果。

资讯摘要

Mistral AI 发布了 OCR 4,这是一款新的文档 OCR 模型,面向 PDF、Word 文件和 PowerPoint 演示文稿中的内容识别。与只返回原始文本的基础 OCR 不同,OCR 4 还能识别元素在页面上的位置,并对其角色进行分类。根据公司说法,它可以区分标题、表格、公式和签名等内容。这样的版面与区块分类,旨在把文档自动拆分成有意义的部分,从而更适合搜索系统和 AI 代理使用。

Mistral 还表示,该模型会提供置信度分数,帮助用户判断它对单词或页面识别结果的把握程度。该模型支持 170 种语言,并且据称对较少见的语言也表现良好。在一项包含 600 多份文档的盲测中,独立评审者有 72% 的时间更偏好 OCR 4 的结果。Mistral 表示,OCR 4 可通过 API、Mistral Studio 和 Microsoft Foundry 使用,价格为每 1,000 页 4 美元,批处理模式下为 2 美元。

Mistral发布OCR 4用于多语言文档理解

资讯正文

Mistral的新OCR模型在72%的盲测案例中击败竞争对手,公司称

Mistral AI发布了OCR 4,这是一款可读取PDF、Word文件和PowerPoint演示文稿等文档中文本的新模型。

与早期版本不同,OCR 4不只是提取原始文本。它还能识别每个元素在页面中的位置以及所扮演的角色——无论是标题、表格、公式还是签名。这种块级分类有助于自动将文档拆分为有意义的部分,这对于将文档输入搜索系统或让AI代理进行处理都很有用。该模型还会输出置信度分数,用于估计它对所读取的每个单词或页面有多确定。

Mistral表示,OCR 4支持170种语言,即使是较不常见的语言也表现良好。公司称,在一项涉及600多份文档的盲测中,独立评审者有72%的时间更偏好OCR 4的结果,而非竞争模型。该模型可通过API、Mistral Studio和Microsoft Foundry获取。其定价为每1,000页4美元,批量模式下为2美元。

来源与参考

  1. 原始链接
  2. Mistral's new OCR model beats competitors in 72 percent of blind test cases, company says

收录于 2026-06-25