← 最新论文
🤖 AI

Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents

本文认为,当前的综合评分排行榜由于无法捕捉多样化的部署维度,导致其无法预测现实世界中大语言模型智能体的性能,并据此提出了一种预测有效性框架,该框架通过一种全新的十二层级测量装置,优先考虑在分布外设置中的排名稳定性。

原作者: Dhaval C. Patel, Kaoutar El Maghraoui, Shuxin Lin, Yusheng Li, Tianjun Feng, Chun-Yi Tsai, Yihan Sun, Wei Alexander Xin, Akshat Bhandari, Tanisha Rathod, Aaron Fan, Sanskruti Vijay Shejwal, Tomas Pasi
发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Dhaval C. Patel, Kaoutar El Maghraoui, Shuxin Lin, Yusheng Li, Tianjun Feng, Chun-Yi Tsai, Yihan Sun, Wei Alexander Xin, Akshat Bhandari, Tanisha Rathod, Aaron Fan, Sanskruti Vijay Shejwal, Tomas Pasiecznik, Sagar Chethan Kumar, Tanmay Agarwal, Rohith Kanathur, Sam Colman, Amaan Sheikh, Dev Bahl, Ann Li, Krish Veera, Alimurtaza Mustafa Merchant, Shambhawi Baswaraj Bhure, Sajal Kumar Goyla, Chengrui Li, Kirthana Natarajan, Rui Li, Thomas Ajai, Rujing Li, Vivek G. Iyer, Sanjaii Vijayakumar, Yitong Bai, Ayal Yakobe, Darief Maes, Yassine Jebbouri, Tianyang Xu, Thai Quoc On, Vera Mazeeva, Winston Li, Yuval Shemla, Yeshitha Bhuvanesh, Rushin Bhatt, Siddharth Chethan Gowda, Alisha Vinod, Caroline Cahill, Shriya Aishani Rachakonda, Yunfeng Chen, Aryaman Agrawal, Aman Upganlawar, Mao Le Jonathan Ang, Yubin Sally Go, Madhav Rajkondawar, Yang-Jung Chen, Trisha Maturi, Ananya Kapoor, Andrew Li, Shrey Arora, Mana Abbaszadeh, Shen Li, Charles Xu, Byeolah Kwon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图为一群复杂的工业机器(比如巨大的空调或电网变压器)招聘最优秀的机械师。目前,业界使用“排行榜”(Leaderboard)来决定雇佣谁。这个排行榜就像是一张成绩单,给每位机械师一个单一的分数,比如“85分(满分100)”。

这篇论文指出,这个单一的分数是一个陷阱。它告诉你谁在某项特定的测试中表现“优秀”,但它无法告诉你谁能在真正复杂、混乱且不可预测的实际工作中取得成功。

以下是利用简单的类比对该论文论点的拆解:

1. 问题所在:“单一数字”陷阱

目前,AI智能体(即“机械师”)是根据一个综合得分来排名的。

  • 类比: 想象两位机械师参加了一场测试。
    • 机械师 A 是个规划天才,但需要花费10小时才能完成,且消耗了大量的燃料成本。
    • 机械师 B 规划能力平平,但能在10分钟内完成任务,且消耗的燃料极少。
    • 如果测试只给出一个“通过/失败”的分数,他们可能都会得到“A”。
  • 现实情况: 在现实世界中,你承担不起那个耗时10小时且昂贵的机械师。单一的分数掩盖了成本速度工作风格。它将截然不同的处理方式视为同一种东西。

2. 证据:“隐藏考试”带来的惊喜

作者研究了一个包含149支队伍的大规模竞赛。

  • 设置: 各个团队构建了AI智能体来解决工业问题。他们的排名是基于一个“公开排行榜”(类似于练习考试)。
  • 转折: 当这些团队参加“隐藏考试”(即真实的部署测试)时,排名崩溃了。
    • 对于“规划”赛道,公开排名与隐藏排名基本吻合。
    • 对于“执行”赛道(即实际动手操作),相关性竟然是负相关。在公开排行榜上看起来表现最好的队伍,在现实世界中的表现反而最差。
  • 教训: 在静态测试上的高分并不能预测智能体在面对全新的、未见过的场景时会如何表现。这就像一个学生背熟了练习题的答案,但当题目中的数字稍作变化时,他就挂科了。

3. 缺陷:“自我评分”的裁判

大多数排行榜使用AI来为AI的工作进行评分(称为“LLM作为裁判”)。

  • 类比: 想象一位老师在为自己的学生作文打分,但这位老师也是一个每周都会改变主意的AI。如果老师的“情绪”(提示词/Prompt)发生了变化,即使学生的作业本身没变,分数也会随之改变。
  • 风险: 排行榜最终衡量的是裁判的偏见,而不是智能体真实的技能。论文建议我们需要一个“基于规则的裁判”(如严格的检查清单)来验证工作,而不是依靠另一个AI来猜测。

4. 解决方案:“12层”检测

作者提议停止使用“单一数字”排名,转而开始**“12层检测”
与其问“分数是多少?”,不如问“它在以下12个特定维度上的表现如何?”
你可以把它想象成一次
汽车安全检测**,而不仅仅是速度测试。你不仅想知道车跑得有多快,你还需要知道:

  1. 成功率: 它是否解决了问题?
  2. 卫生度(规范性): 它在使用工具时是否规范,有没有损坏工具?
  3. 规划能力: 它在行动前是否进行了思考?
  4. 成本: 它是否太贵了?
  5. 失效模式: 当情况出错时,它是如何崩溃的?
  6. 基础设施: 它在真实硬件上的运行速度如何?
  7. 多轮对话: 它能否处理持续5分钟的对话,而不只是5秒钟?
  8. 推理能力: 它是在需要时进行“深度思考”,还是仅仅在瞎猜?
  9. 知识储备: 它是查阅手册,还是仅凭记忆?
  10. 证据支持: 它能否用事实而非猜测来证明自己的答案?
    (以及其他维度,共计12个维度)

5. 新目标:“预测效度”

论文提出了一种新的智能体排名方式,称为**“预测效度”(Predictive Validity)**。

  • 旧方法: 根据刚刚参加的测试的平均分进行排名。
  • 新方法: 根据你的测试分数在多大程度上能预测你在“另一个测试”中的表现来进行排名。
  • 类比: 如果你想雇佣一名飞行员,不要只看他在天气晴朗时的模拟器得分。要看他的模拟器得分在多大程度上能预测他在暴风雨中的飞行能力。如果相关性很低,那么这个排行榜就是毫无意义的。

总结

这篇论文是对AI界的警告:不要迷信单一数字的排行榜。 它只是一个“静态快照”,在现实世界发生变化时就会失效。

相反,我们需要:

  1. 衡量更多维度(速度、成本、安全性、推理能力等)。
  2. 测试稳定性(当测试内容改变时,排名是否依然稳固?)。
  3. 使用独立的裁判(使用规则而非仅仅是另一个AI来评判工作)。

作者承认他们尚未进行最终的“证明性”实验,但他们已经通过14项不同的研究收集到了证据,证明现有的系统是破碎的,并且为了让AI在现实世界中发挥作用,一种多层次的新方法是必不可少的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →