Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results
本文介绍了“Every Eval Ever”,这是一个由社区治理的倡议,旨在通过建立统一的 JSON 架构、提供从多种来源进行的自动转换器,并在 Hugging Face 上托管一个目前聚合了来自 22,000 多个模型和 2,000 个基准测试数据的众包仓库,来解决 AI 评估结果碎片化的问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能(AI)的世界就像一个规模宏大、混乱不堪的体育联盟。每天,不同的队伍(研究人员和公司)都会让他们的选手(AI 模型)去跑各种障碍赛(基准测试),以看谁跑得最快或最强。
问题在于?每个人计分的方式都不一样。
有些队伍把结果写在笔记本上,有些写在白板上,有些用电子表格,还有些只是在推特上发一个数字。有的队伍可能会说选手得了“85分”,但他们并没告诉你他是用了秒表还是沙漏,或者选手是在跑步机上跑还是在跑道上跑。因为这种混乱,你根本无法真正将来自 X 队的选手 A 与来自 Y 队的选手 B 进行比较。
“Every Eval Ever” (EEE) 是试图解决这种混乱的项目。你可以把它看作是整个 AI 世界的通用翻译器和官方计分员。
以下是它的工作原理,通过简单的拆解来理解:
1. 通用记分卡 (Schema)
在 EEE 出现之前,如果你想比较两个 AI 模型,你必须像侦探一样,四处搜寻论文、博客文章和代码日志,以查明分数是如何计算出来的。
- EEE 的解决方案: 他们创建了一个单一的标准“记分卡”(一种特定的 JSON 格式)。
- 类比: 想象一下,如果每个体育联盟都同意使用完全相同的统计表。这张表不仅要写“85 分”,还必须包括:“谁运行了测试?他们遵循了什么规则?室温是多少?他们是用秒表还是计时器?”
- 为什么这很重要: 现在,当你看到一个分数时,你确切知道它的含义,并且可以将其与其他来源的分数进行公平比较,即使它们来自不同的地方。
2. 魔法翻译器 (Converters)
你可能会想:“但大家已经有了各自混乱的记分卡了,我们要如何修复它们呢?”
- EEE 的解决方案: 他们构建了“转换器”。这些就像是魔法翻译工具。
- 类比: 想象一个翻译员,可以将一份法语手写笔记、一份德语电子表格和一段西班牙语语音备忘录,瞬间转化为一份完美的、标准化的英语文档。
- 它是如何运作的: 该项目构建了工具,可以自动提取来自流行 AI 测试软件(如 HELM 或 lm-eval)以及排行榜的结果,并立即将它们重新格式化为新的标准记分卡。
3. 社区图书馆 (Repository)
一旦分数被翻译好,它们会被存放在哪里?
- EEE 的解决方案: 他们建立了一个托管在 Hugging Face 平台上的巨大公共图书馆。
- 类比: 把这看作是一个大型公共档案馆,任何人都可以把自己的标准化记分卡投递进去。这里不仅仅是冠军名单;它还深入挖掘了细节。
- 规模: 目前,这个图书馆保存了超过 22,000 个不同 AI 模型的测试结果,涵盖了 2,200 种不同的挑战。这是首次以计算机可读且可比较的方式,将如此大量的数据汇集在一起。
4. 为什么这改变了游戏规则 (案例研究)
论文展示了这一新系统帮助研究人员发现以前无法看到的事物的四种具体方式:
- 成本 vs. 准确度: 在“AI Agent”(执行任务的机器人)的世界里,EEE 显示某些设置虽然昂贵,但实际上并没有表现得更好。这就像是意识到一辆法拉利每天让你花费 500 美元,但一辆丰田也能把你送到目的地,而只需花费 50 美元。
- “困惑度”陷阱: 研究人员通常观察“困惑度”(perplexity)这一指标来查看模型预测文本的能力有多强。EEE 揭示了两个不同的计算机程序可以用略微不同的方式计算“困惑度”,使得这些数字看起来可以比较,但实际上却并不一致。EEE 标记了这些差异,以免人们被误导。
- 机器中的“幽灵”: 当研究人员尝试在本地重新运行旧测试时,他们发现有时官方结果会缺失数据(例如空回答),而他们的本地副本则包含这些数据。EEE 帮助发现了这些隐藏在视线之外的“幽灵”错误。
- 难度评级: 通过观察单个问题(而不只是最终得分),EEE 让研究人员能够使用统计方法(项目反应理论,Item Response Theory)来确定哪些问题太难或太容易,从而帮助他们设计更好的测试。
核心总结
“Every Eval Ever” 不是一个新的 AI 模型,它本身也不运行测试。相反,它是使现有的测试变得有意义的基础设施。
它将一堆混乱、不兼容的笔记变成了一个清晰、有序且公平的数据库。它让研究人员不再询问“他们测量的方式一样吗?”,而是开始询问“这究竟告诉了我们关于 AI 进步的什么信息?”
该项目由一群研究人员、公司和大学组成的联盟运营,他们相信,为了让 AI 得到改进,我们在讨论其表现优劣时,都需要使用同一种语言。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。