AI基准测试饱和的系统研究
该研究系统分析了60个语言模型基准测试的饱和现象,发现近半数基准已饱和,且专家策划比公共测试数据更能影响基准的抗饱和能力,为设计更持久的评估方法提供了依据。
计算机科学 > 人工智能[提交于2026年2月18日(v1),最后修订于2026年6月29日(本版本,v3)]标题:当AI基准测试达到平台期:基准饱和的系统研究查看PDF HTML(实验性)摘要:人工智能基准测试是衡量模型进展和指导部署决策的重要机制。
然而,基准测试会迅速“饱和”,使得难以区分不同模型,并削弱其长期价值。在本研究中,我们定义了基准饱和,并使用14个与饱和相关的属性对60个语言模型基准进行了分析。我们发现近一半的基准表现出饱和,且饱和率随基准年龄增长而增加。
此外,我们发现抗饱和能力受专家策划的影响,而非公共测试数据。我们的结果表明,设计选择可以延长基准寿命,并为更持久的评估方法提供参考。
提交历史记录发件人:Mubashara Akhtar [查看电子邮件][v1] 2026年2月18日星期三16:51:37 UTC(222 KB)[v2] 2026年5月30日星期六16:41:50 UTC(640 KB)[v3] 2026年6月29日星期一17:01:
58 UTC(636 KB)参考文献与引文加载中... 书目与引文工具书目探索器(什么是探索器?)关联论文(什么是关联论文?)Litmaps(什么是Litmaps?)scite智能引文(什么是智能引文?
)与本文相关的代码、数据与媒体alphaXiv(什么是alphaXiv?
)CatalyzeX论文代码查找器(什么是CatalyzeX?)DagsHub(什么是DagsHub?)Gotit.pub(什么是GotitPub?)Hugging Face(什么是Hugging Face?
)ScienceCast(什么是ScienceCast?)演示推荐与搜索工具Influence Flower(什么是Influence Flowers?)CORE推荐器(什么是CORE?
)arXivLabs:与社区合作者的实验项目arXivLabs是一个框架,允许合作者直接在我们的网站上开发和分享新的arXiv功能。与arXivLabs合作的个人和组织都接受并认可我们关于开放性、社区、卓越和用户数据隐私的价值观。
arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。有能为arXiv社区增加价值的项目想法吗?了解更多关于arXivLabs的信息。
本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。