smevals 发布小型 LLM 评测工具
Simon Willison··作者 Simon Willison
关键信息
工作流从 `uvx smevals docs` 开始,它会输出 README,方便编码代理学习工具;然后用 `uvx smevals run` 执行评测套件,再用 `uvx smevals grade` 对结果打分。该项目还支持 `uvx smevals serve` 启动本地仪表盘,以及 `smevals build` 生成静态 HTML 报告,文中还提到评测定义保存在一个包含 YAML 文件的目录中。
资讯摘要
Simon Willison 介绍了 smevals,这是他与 Jesse Vincent 以及 Prime Radiant 一起开发的新评测套件,目的是帮助回答有关模型能力的实际问题。文中把它描述为一个小型评测框架,可用于在模型、提示词和 harness 之间进行比较,并对结果进行打分。Willison 给出的快速上手方式是先让编码代理运行 `uvx smevals docs` 来读取工具的 README,然后再让它构建一个评测套件。创建好的评测以一个目录的形式存在,里面包含一些 YAML 文件。随后可以用 `uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6` 在多个模型上执行评测。
运行和打分是分开的,所以可以之后再用 `uvx smevals grade path-to-eval/` 对结果进行评分。用户还可以用 `uvx smevals serve path-to-eval/` 在本地查看结果,或者用 `smevals build` 生成可部署的静态 HTML 报告。文中还给出了一个关于写俳句的评测示例,仪表盘里包含排行榜、最近运行记录、评分细节和通过率。Willison 表示这是他在评测方法上的第三次尝试,而 smevals 让他觉得终于找到了合适的方案。

来源与参考
收录于 2026-08-01