AI 见闻
精选· 重要性 3/5

smevals:一个用于评估模型、提示词和测试框架的小型评估套件

Simon Willison's Weblog··约 2 分钟阅读
中文导读

Simon Willison 发布了 smevals,一个用于跨不同模型配置运行小型评估套件并评分的工具,旨在帮助开发者更便捷地比较模型能力。

2026年7月31日 - 链接博客smevals - 一个用于评估模型、提示词和测试框架的小型评估套件。我一直在与 Jesse Vincent 的 Prime Radiant 应用人工智能研究实验室合作,构建这个评估框架,以帮助回答关于不同模型能力的问题。

成果就是 smevals,一个用于在不同模型配置中运行小型评估套件并对结果进行评分的新工具。这篇博客详细介绍了该工具。

以下是10秒速览:- 告诉你的编码智能体运行 uvx smevals docs 来了解该工具(这会输出 README)- 然后让它为你构建一个评估套件创建评估后(其形式为包含一些 YAML 文件的目录),你可以像这样对模型运行它:

uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6运行与评分操作分开处理 - 你可以使用以下命令根据你定义的检查集对运行进行评分:

uvx smevals grade path-to-eval/然后你可以运行一个本地主机 Web 服务器来探索结果:uvx smevals serve path-to-eval/或者运行 smevals build 命令将该报告构建为静态 HTML,

然后你可以将其托管在任何地方。这是一个示例,展示了我为评估模型编写俳句的能力而构建的评估套件。几年来,我一直在尝试找到一种我喜欢的评估方法。smevals 是我对这个想法的第三次迭代,我觉得它很合适。

我期待在未来进一步扩展这个工具,并将其应用于我自己的一些项目。

最近的文章- OpenAI 对 Hugging Face 的意外网络攻击是已经发生的科幻小说 - 2026年7月22日- 与 Claude Code 团队的 Cat 和 Thariq 进行炉边聊天 - 2026年7月21日- Kimi K3,

以及我们仍然可以从 pelican 基准测试中学到什么 - 2026年7月16日

原文出处
smevals - a small eval suite for evaluating models, prompts, and harnesses

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读