Mistral推出区域推理和优先访问但有限制

The Decoder··作者 Maximilian Schreiner

关键信息

Mistral表示,只有推理步骤会限定在所选区域内;账户设置、API 密钥、计费和使用统计仍可能在区域外处理,而零数据保留是单独的设置。当前区域端点仅支持函数调用,不支持 agents、批处理或文件管理;优先级套餐还包含 99.5% 的正常运行时间 SLA 和按客户单独设定的优先速率限制。

资讯摘要

Mistral推出了两项面向企业的升级:区域推理端点和更快处理请求的优先级套餐。客户现在可以把 API 请求发送到欧洲端点或美国端点,Mistral 表示推理处理会留在所选区域内。公司将这一功能定位为适合银行、保险公司和政府机构等需要证明数据留在欧盟境内的客户,同时也强调更短的网络路径可以降低延迟。区域路由在标准价格基础上额外加收 10%。不过,这项能力并不完整:在 Mistral 的附加平台工具中,只有函数调用可以在区域端点上使用。agents、批处理和文件管理都不支持,且不同区域可用的模型也不同,但 Mistral 并未公布固定列表。

文章还指出,这种“主权”承诺比听上去更窄,因为账户设置、API 密钥、计费、使用统计以及部分与分包商的受限传输,仍可能在所选区域之外处理。请求和输出数据是否被保留,则取决于单独的 Zero Data Retention 设置。另一方面,Mistral 的优先级套餐目前处于公开测试阶段,目标是在流量高峰时给付费客户更快的服务。该套餐与普通客户共享同一批数据中心,但在拥塞时优先请求会先被处理,并附带 99.5% 的正常运行时间 SLA。客户可以通过 service_tier 这个 API 参数启用它,超过协商好的优先额度后,请求不会失败,而是自动回落到标准处理。Mistral表示,这一套餐适用于客服聊天机器人和工厂产线系统等对延迟敏感的场景。

Mistral推出区域推理和优先访问但有限制

资讯正文

Mistral 现在提供欧盟数据处理和优先访问,但两者都附带重要限制

Mistral 正在让客户选择将 AI 请求通过位于欧洲或美国的服务器路由处理,并在流量高峰时销售优先队列访问。这两项都要加收费用,而且区域路由并不覆盖所有功能或数据。

当企业将 Mistral 的 AI 集成到自己的产品中时,请求会发送到该提供商的一台服务器。对企业客户来说,有两个问题很重要:那台服务器实际位于何处,以及当所有人同时发送请求时会发生什么。Mistral 现在正把这两个问题的答案拿出来卖,并在一篇博客文章中将其定位为更广泛的欧洲 AI 主权战略的一部分。

区域推理现已全面可用。客户可以将请求发送到欧洲端点(api.eu.mistral.ai)或美国端点(api.us.mistral.ai),处理过程会停留在相应区域。这对银行、政府机构和保险公司很重要,因为它们需要证明客户数据从未离开欧盟。更短的网络路径也意味着更低的延迟。任何使用默认端点的人,都不会得到关于请求在何处处理的保证。区域路由在标准定价基础上加收 10%。

欧盟数据处理有明显限制

不过,在该平台的附加工具中,只有函数调用可以与区域端点一起使用,也就是模型触发外部 API 的能力。Agents、批处理和文件管理在区域地址上都不可用。模型选择也会因区域而异。Mistral 没有公布固定列表,客户必须查询每个端点才能知道可用内容。

最可能的原因在于,简单的模型查询与存储中间状态之间存在差异。标准模型调用不需要持久化存储。Agents、批处理作业和文件存储会保留单次调用之外的数据,例如中间步骤或上传的文档。Mistral 将这些功能称为“有状态”(stateful)。它们很可能需要额外的本地基础设施,不过公司尚未证实这一点。

其覆盖范围也比“主权”这个词所暗示的更窄。根据文档,账户设置、API 密钥、计费和使用统计仍可能在所选区域之外处理。博客文章还提到,向区域外承包商进行有限且受保护的数据传输。区域化的是计算步骤,而不是整个平台。请求之后是否会被存储或记录,则取决于另一项名为 Zero Data Retention 的单独设置。

这在实践中意味着什么:将合同文本直接发送给模型的客户,可以通过欧盟端点来运行。任何需要通过 Files API 使用 Agents 或文件管理的人,则不会得到同样的保证。

为什么公司愿意为更快的队列付费

第二项服务是 Priority Tier,目前处于公开测试阶段。所有客户共享同一批数据中心。当大量请求同时涌入时,响应时间就会变长。Priority Tier 相当于快速通道:在系统繁忙时,付费客户的请求会优先于普通流量被处理。Mistral 主要面向那些延迟会直接带来实际成本的场景,例如客户服务聊天机器人,或者工厂车间里的生产系统。

该档位包含 99.5% 的正常运行时间 SLA,即以合同形式保证每月约有三个半小时的停机时间。Mistral 的标准档位没有这样的保证。

客户通过一个名为 service_tier 的单一 API 参数来启用优先访问。将其设为“auto”时,请求会在容量允许的情况下走快车道。默认值是“standard_only”,它会走常规路径。每位客户还会就每分钟可获得优先处理的请求数量,单独协商速率限制。超出该限制不会导致请求失败,只会回退到标准处理。API 响应会显示实际处理该请求的是哪个档位,因此客户可以检查自己是否得到了所支付的服务。

Mistral 的收费是标准价格的 1.75 倍,即加收 75% 的附加费。来自提示缓存的折扣仍然适用;在提示缓存中,重复的文本片段会被存储,并按更低费率计费。根据文档,这些折扣最高可达 90%,并且会先计算,再在其后叠加优先级附加费。Priority Tier 不是自助开通的。客户必须与 Mistral 的销售团队签订合同。

第三方模型加入平台

Mistral 也在向来自其他提供商的开源模型开放其平台。首批上线的是中国 AI 公司 Z.ai 的 GLM-5.2,它在与 Mistral 自有模型相同的区域规则和保障下运行。为了筹集这项功能所需的算力,Mistral 正在向大型客户收取多年期采购承诺,并将其打包为 European Compute Units。其思路是:只有当足够多的公司做出长期承诺时,在欧洲建设新的数据中心才算经济上可行。Mistral 是 Open Secure AI Alliance 和 Nvidia Nemotron 联盟的成员。该公司认为,在其平台上托管第三方模型权重,是这一工作的自然延伸。

来源与参考

  1. 原始链接
  2. Mistral now offers EU data processing and priority access, but both come with important limits