← 最新论文
📊 statistics

Heterogeneous Judge-Aware Ranking with Sensitivity, Disagreement, and Confidence

本文介绍了异构裁判感知(HJA)排序,这是一种结构化框架,它将多裁判成对比较分解为可识别的共识排序、裁判特异性敏感度以及残差分歧,以提升大语言模型评估中的恢复能力、鲁棒性及不确定性校准效果。

原作者: Shibo Yu, Yingzhou Wang, Yan Chen, Guodong Li, Jin-Hong Du

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Shibo Yu, Yingzhou Wang, Yan Chen, Guodong Li, Jin-Hong Du

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试为城市中的最佳餐厅排名。与其只询问一位美食评论家,不如请一个由 20 位不同人士组成的评审团。

在过去,如果你询问了 20 个人,你可能会直接汇总他们的答案,取平均值,然后生成一份单一的“前十名”榜单。你会假设,如果两个人意见不一致,那只是随机噪声或错误。

问题所在:
本文的作者认为,这种“取平均”的方法存在缺陷。并非所有评委都相同。

  • 评委 A 可能是一位“美食势利眼”,讨厌辛辣食物,却钟爱精致的摆盘。
  • 评委 B 可能是一位“嗜辣者”,认为精致的摆盘是浪费金钱。
  • 评委 C 可能非常严格,只认可前三名餐厅,而评委 D 则随和得多,几乎喜欢所有东西。

如果你只是简单地对他们的评分取平均,就会失去细微差别。你无法知道他们为何意见相左,最终可能会得出一份让无人满意的排名。

解决方案:HJA(异质性评委感知)排名
本文提出了一种名为HJA的新方法来处理这一问题。你可以将其想象为一位聪明的团队经理,他不仅统计票数,还能理解每位投票者的“个性”。

HJA 模型将最终排名分解为三个截然不同的部分,就像将食谱中的食材分开一样:

  1. 共识(“共同基础”):
    这是大家达成一致的部分。也许每个人都同意“新鲜食材”是好的。模型会找出这种共享的“真理”或基准排名,即大多数评委试图描述的内容。

  2. 敏感度(“音量旋钮”):
    这衡量了特定评委遵循该共同基础的强烈程度。

    • 类比: 想象共识是一个正在播放歌曲的广播电台。评委 A 将音量调到了 10(他们强烈认同)。评委 B 的音量在 2(他们有点模糊或不确定)。评委 C 的音量在 -5(他们实际上讨厌这首歌,更喜欢相反的内容!)。
    • HJA 为每位评委单独测量这种“音量”,而不是假设每个人听到的广播音量都一样。
  3. 分歧(“秘密配方”):
    这是最重要的部分。它捕捉了评委们达成一致的结构化原因。

    • 类比: 即使广播声音很大,评委 A 可能仍然更喜欢“辛辣”曲目,而评委 B 更喜欢“甜味”曲目。这并非随机噪声,而是一种特定且可预测的偏好。
    • HJA 将这些特定偏好隔离出来。它意识到评委 A 并非只是“错了”;他们只是拥有不同的“风味特征”,模型可以将其绘制出来。

为什么这更好?

  • 诚实地面对不确定性: 该模型不仅给你一份列表,还告诉你它有多大的把握。如果两家餐厅的质量非常接近,模型会说:“我们不确定哪一个是第一名,以下是可能性的范围。”
  • 处理“势均力敌”的情况: 在现实世界中,第一名和第二名餐厅之间的差异往往微乎其微。旧模型在这里会感到困惑。HJA 专为更好地处理这些“难分伯仲”的情况而设计。
  • 发现“不良行为者”: 该模型可以识别出评委是否行为怪异或存在偏见。例如,如果一位评委 consistently 将其自己公司的产品评分高于其他人(一种“自我偏好”偏见),HJA 可以在“分歧”部分检测到这种模式并加以调整,而不是让它毁掉整个榜单。

他们是如何测试的:
作者在伪造数据(他们知道“真实”答案)和来自互联网的实时数据(例如人们为 AI 聊天机器人排名)上测试了这种方法。

  • 结果: 与旧的“取所有平均值”方法相比,HJA 在发现真实排名方面表现更好,在加入嘈杂或有偏见的评委时更具鲁棒性,并且提供了更好的“置信区间”(告诉你你对排名的把握有多大)。

一言以蔽之:
HJA 不再将评审团视为一个模糊的声音,而是单独倾听每位评委的意见。它弄清了大家共识的内容、他们对此感受的强烈程度,以及他们意见相左的确切原因。这带来了一个更清晰、更可靠、更诚实的排名系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →