🤖 AI
Proper Scoring Rules for Agentic Uncertainty Quantification
本文介绍了轨迹严格评分(TPS),这是一种严格评分规则,能够严谨地 eliciting 语言模型智能体的完整前缀条件成功概率轨迹,从而解决现有指标在智能体不确定性量化中无法区分排序性能与概率真实性这一局限。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在观察一个机器人代理尝试解决一个复杂的谜题,比如 navigating 迷宫或回答一个棘手的谜语。随着机器人工作,它不仅仅给出最终答案;它会自言自语,做出移动,检查自己的工作,并偶尔说:“我想我快要答对了,”或者“我不再确定了。”
长期以来,研究人员一直试图根据这些机器人表达不确定性的程度来给它们打分。但本文认为,当前的评分系统就像只根据是否点单正确来评判一位厨师,而不品尝食物以了解他们是否真正知道那道菜有多好。
以下是本文的核心思想,通过简单的类比分解说明:
1. 问题:评判“排名”而非“真相”
目前,大多数针对这些机器人的测试都关注排名。
- 类比:想象一位老师根据学生的学习习惯给学生打分。老师只看学生的期末考试成绩。如果学习最努力的学生取得了最高分,老师就会说:“太棒了!学习方法有效!”
- 缺陷:老师并不关心学生是否认为自己有 99% 的通过几率,而实际上只有 50% 的几率。学生可能极度自信,但只是运气好。
- 本文观点:现有的测试(如 AUROC 或 Trajectory ECE)就像那位老师。它们检查机器人的置信度是否将正确答案的排名置于错误答案之上。但它们并不检查机器人的具体数值(例如"80% 的几率”)是否真的与现实相符。一个机器人可以是一个出色的“排名者”,但却是一个糟糕的“真相陈述者”。
2. 解决方案:“轨迹严格评分”(TPS)
作者引入了一种新的评分系统,称为TPS。
- 类比:TPS 不像只看期末考试,而像一位教练,一步步观察机器人的表现。每当机器人做出一个动作,教练就会问:“你说从这一点开始有 70% 的成功几率。那是诚实的吗?”
- 工作原理:本文使用了一种名为“严格严格评分规则”的数学工具。你可以将其理解为一种只有在你说实话时才有效的惩罚系统。
- 如果你说"90%"却失败了,你会受到巨大的惩罚。
- 如果你说"50%"却失败了,你会受到轻微的惩罚。
- 获得最佳分数的唯一方法是准确说出真正的几率。
- 结果:TPS 迫使机器人在旅程的每一个步骤都诚实地评估其成功几率,而不仅仅是在最后。
3. “截断”问题:当游戏提前停止时
有时,机器人在完成任务之前时间耗尽或达到限制。在过去,研究人员会直接丢弃这些未完成的尝试。
- 类比:想象一位马拉松运动员在第 20 英里处崩溃。如果你只计算完成比赛的人,你就会错过那些挣扎的运动员的数据。
- 本文的修正:作者创造了一种公平评分这些“未完成”运行的方法。他们使用了一种称为“条件投影”的技术。
- 简化版:如果机器人提前停止,而我们不知道它本是否会成功,系统会假设最坏的情况(即失败)以确保安全。
- 进阶版:如果我们能估计它如果继续下去成功的几率,系统就会使用该估计值来公平地评分未完成的运行。
- 重要性:本文发现,在一个购物任务(WebShop)中,几乎有一半的尝试被中途打断。如果你忽略它们,你就会得到关于机器人表现的错误图景。当他们包含这些“被截断”的尝试时,机器人的评分实际上发生了显著变化。
4. 重大发现:重新校准改变了一切
作者进行了实验,将机器人的原始置信度数值进行“重新校准”(修正使其更诚实)。
- 类比:想象一位气象预报员总是说“降雨几率为 90%"。如果下雨的频率确实是 90%,那么他就是一个“好的排名者”(他正确预测了下雨的日子)。但如果他说"90%"时,实际几率只有"50%",那么他就是一个糟糕的“真相陈述者”。
- 结果:当他们修正机器人的数值使其更诚实后:
- 旧的测试(排名)几乎没有察觉到变化。机器人仍然将正确答案的排名置于最佳位置。
- 新的测试(TPS)看到了巨大的改进。机器人现在诚实地陈述了其成功几率。
- 为何这是大事:如果你使用机器人来决定是否呼叫人类协助(即“交接”),你需要知道真实的概率,而不仅仅是排名。如果机器人认为自己有 90% 的把握,但实际上只有 50% 的把握,你可能本应呼叫协助却没有呼叫。
总结
本文指出:停止仅仅根据机器人认为谁会赢来给它们打分。开始根据它们是否真正了解几率来给它们打分。
他们建立了一个新的记分牌(TPS),它:
- 检查机器人在每一个步骤的置信度。
- 奖励诚实,而不仅仅是“幸运”或“排名靠前”。
- 能够处理机器人时间耗尽的情况,而不会丢弃数据。
实验表明,使用这个新的记分牌揭示了机器人在表达不确定性方面的重大错误,而这些错误是旧的记分牌完全遗漏的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。