← 最新论文
🤖 machine learning

Offline Preference-Based Trajectory Evaluation

本文提出了一种基于偏好的轨迹评估方法,通过时间进度和返回时间剖面来比较智能体系统,与往往导致基准测试饱和的传统终端成功指标相比,该方法显著减少了比较平局并提高了统计效率。

原作者: Fernando Diaz

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Fernando Diaz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名教练,正试图决定两名运动员中谁更擅长跑马拉松。

旧方法(成功率)
目前,大多数 AI 系统都是这样被评判的:你观察他们跑完比赛,然后在最后时刻问:“他们跨过终点线了吗?”

  • 如果运动员 A 用 2 小时跨过终点线,而运动员 B 用 4 小时跨过终点线,旧方法会说:“两人都是赢家。他们打平了。”
  • 如果运动员 C 在半路摔倒了,而运动员 D 在最后一秒摔倒了,旧方法会说:“两人都是输家。他们打平了。”

这种“是否完成”的方法是存在缺陷的。它丢弃了大量有用的信息。这就像仅仅根据学生是否交了作业来评分,却忽略了他们是否真正理解了材料或付出了多少努力。因为许多系统最终都会得到相同的“胜”或“负”标签,导致无法分辨谁在进步。作者称之为“基准饱和”(benchmark saturation)——测试工具太钝了,以至于无法区分优与精。

新方法(基于偏好的轨迹评估)
作者提出了一种新的评判这些系统的方法。他们不再仅仅盯着终点线,而是观察整个旅程,并询问:“谁更快地接近了目标?”

他们使用三种创意方式来比较这些跑步者:

  1. “首个里程碑规则”(词典序回报): 想象比赛设有检查点。如果跑步者 A 用 1 小时到达 10 英里处,而跑步者 B 用 2 小时到达,那么即使两人最终都完成了,跑步者 A 也是更好的。这种方法寻找的是其中一人领先的第一个时刻。
  2. “累积速度规则”(回报配对偏好): 这观察整个比赛过程。它会问:“在比赛的每一个点上,谁处于领先地位?”如果跑步者 A 在前半段略微领先,而跑步者 B 在后半段略微领先,这种方法会计算总的时间优势。它将比赛视为一种持续不断的进度流,而非一个单一的“是/否”事件。
  3. “步进式规则”(区间配对偏好): 这侧重于检查点之间的努力。如果跑步者 A 从 1 到 2 英里用时很长,但随后从 2 到 3 英里飞速前进,而跑步者 B 全程虽然稳定但很慢,这种方法会奖励特定的爆发速度。它会问:“谁更快地完成了从一个微小目标到下一个目标的过渡?”

尝试后的结果如何?
研究人员在许多不同的 AI “游戏”和任务上测试了这种新方法。他们发现了以下结果:

  • 更少的平局: 在旧的“是否完成?”方法下,两种不同的 AI 系统有 75% 的概率出现平局。而在新的“观察整个旅程”方法下,平局降至约 35%。这意味着新方法能更频繁地分辨出系统之间的差异。
  • 更高的效率: 由于新方法能从每一次运行中获取更多信息,因此你只需要进行更少的测试就能知道哪个 AI 更好。这就像是用高分辨率照片代替模糊的照片;你需要更少的照片就能看清细节。
  • 稳定性: 新方法产生的排名更加稳定。如果从结果中移除一个测试,旧方法有时会改变胜者的排名,但新方法能保持一致。

核心结论
论文得出结论,AI 基准测试之所以看起来“停滞不前”或“饱和”(即没有任何系统表现出进步),可能并不是因为问题太难或数据太差,而是因为我们用来衡量它们的尺子太钝了

通过从简单的“胜/负”评分转向详细的“谁更快到达以及如何到达”的比较,我们无需收集更多数据或改变 AI 系统本身,就能再次看到真实的进步。我们只需要观察旅程,而不仅仅是目的地。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →