Optima 将自定义 AI 基准带到真实用例

The Decoder··作者 Tomislav Bezmalinović

关键信息

Optima 可以导入上传的数据集、来自 Hugging Face 的数据、来自 Arize、Braintrust 或 Langfuse 等工具的 AI 代理轨迹,甚至可以根据书面的用例描述以及示例输入输出生成测试用例。它支持基于评分标准的评估和成对比较方法,Artificial Analysis 表示用户只需支付模型实际的 token 成本以及评估费用,其中按评分标准每模型每项为 0.125 美元,按成对比较每次为 0.375 美元。

资讯摘要

Artificial Analysis 推出了 Optima,这是一个围绕用户自身工作流构建 AI 基准的平台,而不是只依赖公共测试集。该公司认为,标准基准可以展示模型在预设任务上的表现,但往往无法说明哪个模型最适合某个具体业务场景。Optima 的目标就是弥补这一差距,让用户用自己的数据和场景去比较领先模型。用户既可以上传本地文件或 Hugging Face 上的数据集,也可以导入来自 Arize、Braintrust、Langfuse 等平台的代理轨迹。

对于还没有现成数据集的情况,用户可以用自然语言描述想要的工作流,并提供示例输入和输出,Optima 会据此生成建议的测试输入、评估标准和示例任务,供用户审核和修改后再正式运行。平台支持两种评估方式:一种是按照明确标准进行评分,另一种是成对比较,即用户先判断一组示例回答中更喜欢哪一个,再由 Optima 根据这些偏好推导出整个测试集的排名。除了质量之外,Optima 还把每个任务的成本和耗时作为独立指标,这对代理式系统尤其重要,因为一个更便宜的模型如果需要更多重试或额外清理工作,最终总成本反而可能更高。Artificial Analysis 表示该服务现已上线,并且模型使用只收取底层 token 成本,另加评估费用,不会对模型用量加价。

Optima 将自定义 AI 基准带到真实用例

资讯正文

Optima 通过让用户使用自己的数据测试模型,来解决 AI 基准测试最大的缺陷

人工分析(Artificial Analysis)推出了 Optima,这是一个平台,允许用户围绕特定用例构建自己的 AI 基准测试。

测试可以基于用户自己的数据源,或者基于对目标场景的描述,并配有样本输入和输出。随后,Optima 不仅会比较 AI 模型的质量,还会比较每个任务的成本和耗时。

该平台旨在解决通用基准测试对现实应用场景用途有限的问题。自定义基准是否在方法论上足够严谨、并且能否真实反映业务价值,仍然取决于其设计方式。

Optima 允许用户围绕自己的特定用例,构建自定义基准,并在质量、成本和速度方面比较 AI 模型。

Artificial Analysis 以其独立的 LLM 评测以及 GDPval-AA、AA-Briefcase 等基准实现而闻名,如今推出了名为 Optima 的新平台。其理念很简单:公开基准是在预定义任务和标准上比较模型,但它们未必能揭示哪一个模型最适合某个特定用例。Optima 试图通过针对个人工作流定制的比较,弥合这一差距。

根据 Artificial Analysis 的说法,用户可以利用自己的数据、工作流,或对某个用例的描述来构建自己的基准,然后在当前领先的模型上运行这些基准,并在质量、每个任务的成本以及每个任务的耗时方面比较结果。Optima 现已可用。

构建自定义基准的三种路径

Optima 接受多种来源材料。用户可以从自己的文件或 Hugging Face 上传现有评估数据集,也可以导入来自 Arize、Braintrust 或 Langfuse 等平台的 AI agent traces。Artificial Analysis 写道,开发者还可以安装一个 skill,用于收集其编码环境和历史会话中的信息。

如果用户没有这类数据,也可以改为描述自己设想的用例,并提供样本输入和输出。随后,Optima 会生成建议的测试输入、评估标准和示例任务。用户可以在实际运行基准测试之前,通过反馈进行审阅和优化。

平台提供两种评分方式:一种是依据客观标准进行 rubric-based evaluation,另一种是 Artificial Analysis 也用于 GDPval-AA 和 AA-Briefcase 等基准的成对比较方法。在成对比较方法中,用户首先对一组响应对进行评估,并指出自己更偏好哪一个答案。随后,Optima 会根据这些偏好推导出整个测试数据集的完整排序。

成本和速度成为一级比较指标

除了原始模型质量之外,Optima 还将每个任务的成本和每个任务的耗时作为独立的比较维度进行追踪。这使得人们可以判断,性能提升是否真的值得某个模型更高的成本或更长的处理时间。

对于 agentic 应用来说,单看 token 单价几乎说明不了什么。一个更便宜的模型,如果需要更多尝试、失败更多,或者需要额外的清理工作,最终总成本可能反而更高。完成一个任务的成本,往往才是更有意义的数字。

据 Artificial Analysis 介绍,早期测试者为金融和会计智能体构建了基准,以找出哪种模型能在不显著损失质量的情况下将成本削减到十分之一;还有人测试哪种模型最能匹配律师的写作风格,或最准确地识别专有图像数据集中的元素。

据 Artificial Analysis 介绍,在构建和运行基准时,Optima 只收取所用模型的实际 token 成本,不加任何溢价。基于评分标准的评估每个标准、每个模型收费 0.125 美元,成对评估每次比较收费 0.375 美元。在基准创建开始时、每次基准运行开始时以及每轮评估开始时,平台都会根据成本估算预留一笔余额。之后的计费则基于实际产生的使用和评估成本。

为什么通用基准并不适用

Optima 试图解决一个 AI 基准中众所周知的问题。Epoch AI 的一项分析显示,基准结果取决于很少披露的实现细节。不同的提示词措辞和 temperature 设置,会让同一模型因配置不同而得分出现明显差异。对于 SWE-bench 这类 agentic 基准来说,仅仅更换 scaffolding——也就是智能体的控制软件和工具环境——就足以造成最高 15 个百分点的差异。

另一项更大范围的研究审查了来自顶级 AI 会议的 445 篇基准论文,发现了更系统性的问题。几乎所有论文在至少一个方面都存在方法学缺陷,包括定义不清、样本不具代表性,以及缺少统计验证。被研究的基准中,只有大约 10% 使用了能反映真实应用场景的完整现实任务。诸如推理或对齐等关键概念往往定义模糊,这限制了据此得出的任何结论的可靠性。

Optima 可以解决通用基准无法捕捉特定用例的问题。但基准测试更深层的方法学挑战并不会因此消失。即便基准是为你的自身任务量身定制的,它是否有用,仍取决于目标能力定义得是否足够精确、测试用例是否具有代表性,以及评估是如何实施和记录的。

还有另一个值得牢记的限制。即便是每个任务的成本和耗时,也并不能告诉你输出对业务而言究竟值多少钱。即使某个 AI 工作流便宜又快,如果其结果需要大量返工,或者对其所处流程几乎没有增加价值,它仍然可能效率低下。

来源与参考

  1. 原始链接
  2. Optima tackles AI benchmarking's biggest flaw by letting users test models against their own data

收录于 2026-08-17