← 最新论文
🤖 AI

STABLEVAL: Disagreement-Aware and Stable Evaluation of AI Systems

本文介绍了 STABLEVAL,一种能够感知分歧的评估框架,该框架通过建模潜在的项目正确性和标注者特有的混淆模式,生成稳定且具备不确定性感知能力的系统排名,从而解决了传统多数投票聚合方法固有的脆弱性和偏差问题。

原作者: Akash Bonagiri, Gerard Janno Anderias, Saee Patil, Angelina Lai, Devang Borkar, Gezheng Kang, Ishant Gandhi, Setareh Rafatirad, Houman Homayoun

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Akash Bonagiri, Gerard Janno Anderias, Saee Patil, Angelina Lai, Devang Borkar, Gezheng Kang, Ishant Gandhi, Setareh Rafatirad, Houman Homayoun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在评判六位不同厨师中谁做的汤最好。你请了 65 位美食评论家来品尝并评分。

旧方法(多数投票):
过去,研究人员只是统计票数。如果有 33 位评论家说“厨师 A 的汤很好”,而 32 位说“厨师 A 的汤不好”,那么厨师 A 就会得到“好”的评级。那 32 张“不好”的票被忽略了。

  • 问题: 这种方法很脆弱。只要一位评论家改变主意,或者你在下一轮碰巧选了另一组 65 位评论家,获胜者就可能反转。它把所有评论家都视为同样完美,即使有些人以严厉著称,有些人过于友善,还有些人只是随机猜测。它抛弃了人们意见分歧背后的细微差别。

新方法(STABLEVAL):
这篇论文的作者,STABLEVAL,提出:“不要只统计票数;要理解投票者。”

他们提出了一种系统,其作用更像是一位聪明的侦探,而非简单的计票员。以下是其工作原理,通过几个类比来说明:

1. “混淆矩阵”(侦探的档案)

STABLEVAL 不再假设每位评论家都完美无缺,而是为每位评论家建立一份档案。

  • 严厉的评论家: 也许第 5 号评论家总是觉得汤太咸,即使汤其实没问题。STABLEVAL 会学到:“啊,第 5 号评论家是个严厉的评判者;我会降低其‘不好’票的权重。”
  • 懒惰的评论家: 也许第 10 号评论家只是对所有东西都猜“好”。STABLEVAL 会学到:“第 10 号评论家没在认真看;我会忽略其意见。”
  • 令人困惑的样本: 有时,一碗汤就是奇怪地模棱两可。STABLEVAL 会意识到:“这碗特定的汤很难评判”,因此不会强行贴上单一的“好”或“不好”标签。相反,它会说:“这碗汤有 60% 的概率是好的,40% 的概率是不好的。”

2. “软分数”与“硬标签”

  • 旧方法(硬标签): 汤要么是“好”(1),要么是“不好”(0)。这是一个二元开关。
  • STABLEVAL(软分数): 汤会得到一个 0.65 的“信用评分”。这承认了虽然汤可能倾向于“好”,但仍存在不确定性。它保留了不确定性,而不是将其粉碎成一个单一的数字。

3. “稳定性测试”(洗牌)

这篇论文引入了一种衡量成功的新方法,称为排序稳定性
想象你有一副代表评论家的扑克牌。

  • 多数投票: 如果你洗牌并移除几张牌(评论家),厨师的排名可能会完全改变。这种排名是不稳定的,就像纸牌屋。
  • STABLEVAL: 因为它理解每位评论家的可靠性,如果你洗牌并移除几张牌,厨师的排名保持不变。这种排名是稳定的,就像一座坚固的石像。

他们的发现

研究人员在真实世界数据(如评判 AI 聊天机器人和医疗摘要)以及包含“捣乱者”评论家的虚构场景中测试了这种方法。

  • “去噪”陷阱: 他们将 STABLEVAL 与一种名为"Dawid-Skene"的旧方法进行了比较。旧方法非常擅长猜测真实答案(就像侦探破案)。然而,论文发现,仅仅知道“真实答案”并不总是意味着你能获得厨师的稳定排名。你可以知道真相,但如果稍微改变评委群体,排名仍然可能翻转。
  • 获胜者: STABLEVAL 并不总是能完美猜出“真实”标签,但它产生了一致得多的排名。当评论家们意见分歧很大时(这在 AI 安全或医疗摘要等复杂任务中经常发生),STABLEVAL 保持了排行榜的稳定,而旧方法则让排名剧烈波动。

核心结论

这篇论文认为,在 AI 评估中,分歧不仅仅是需要删除的噪声;它是需要被理解信号。

如果你想知道哪个 AI 真正更好,你不应该只进行多数投票。你应该建立一个系统,该系统知道哪些评委可靠、哪些项目棘手,以及存在多少不确定性。这确保了当你说"AI 模型 A 优于 AI 模型 B"时,你不是因为碰巧在那天选了一组特定的评委才这么说。你之所以这么说,是因为无论问谁,结果都是稳定的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →