← 最新论文
🤖 AI

Users as Annotators: LLM Preference Learning from Comparison Mode

本文提出了一种方法,通过引入一种期望最大化算法,利用大语言模型比较模式中的用户生成成对偏好数据,基于非对称模型响应推断潜在的用户质量因子,从而实现有效的数据过滤并提升大语言模型的对齐效果。

原作者: Zhongze Cai, Xiaocheng Li

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhongze Cai, Xiaocheng Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人(即大型语言模型,或 LLM)如何变得乐于助人且彬彬有礼。为此,你需要向它展示“好”回答与“坏”回答的示例。通常,公司会聘请一支专业的人工编辑团队来阅读每一个回答,并投票选出更好的那个。这种方式既昂贵又缓慢。

本文提出了一种巧妙的捷径:让机器人的普通用户来投票。

这就像一家餐厅。餐厅不是聘请美食评论家品尝每一道菜,而是请顾客在两道菜中投票选出他们更喜欢的那一道。好处是什么?你能免费获得成千上万张选票。坏处呢?有些顾客可能饿了、心不在焉,或者只是随意选了一道菜,根本没有认真品尝。这些“嘈杂”的选票可能会让厨师感到困惑。

以下是作者如何利用一种统计魔法技巧来解决“心不在焉的顾客”这一问题。

核心理念:“非对称”测试

在普通的投票系统中,你可能会向用户展示由同一个机器人生成的两个回答。如果该机器人很出色,那么两个回答可能都很棒,这使得很难判断用户是否真的在认真关注。

作者的秘诀在于向用户展示由两个不同机器人(或同一机器人的两个不同版本)生成的两个回答。

  • 机器人 A 是“明星厨师”(非常聪明)。
  • 机器人 B 是“新手厨师”(不够聪明)。

由于机器人 A 在客观上更优秀,一个认真关注的用户几乎总是会选择机器人 A。而一个心不在焉的用户(只是随意猜测)选择机器人 A 或机器人 B 的概率各为 50%,就像抛硬币一样。

侦探工作:找出“抛硬币者”

本文引入了一套数学侦探系统(称为期望最大化算法),用来辨别谁是认真者,谁是猜测者。

  1. 假设:系统假设每位用户都有一个隐藏的“注意力分数”。

    • 分数 1.0:该用户是超级专注的专家,总是选择更优秀的机器人。
    • 分数 0.0:该用户是完全的抛硬币者,随机选择。
    • 分数 0.5:该用户处于中间状态。
  2. 调查:系统查看用户的历史投票记录。

    • 用户 X 在 95% 的情况下投票给了明星厨师。系统判断:“啊,用户 X 在认真关注!他的选票是黄金。”
    • 用户 Y 在 50% 的情况下投票给了明星厨师。系统判断:“用户 Y 只是在猜测。他的选票是噪音。”
  3. 清理:一旦系统识别出“抛硬币者”,就会丢弃他们的选票。它只保留那些“认真关注”用户的选票,用来训练机器人。

结果:更干净的厨房

作者使用真实数据测试了这一想法。他们模拟了一个场景,其中一些用户是专家,而另一些则心不在焉。

  • 未过滤时:当他们使用所有选票(包括抛硬币者的选票)来训练机器人时,机器人学会了一些坏习惯。
  • 过滤后:当他们使用其“侦探”系统剔除抛硬币者,仅基于专注用户的选票进行训练时,机器人的表现显著提升。它学得更快,犯错更少,尽管他们使用的总数据量反而更少。

为何这很重要

这篇论文不仅仅是在说“让我们使用用户数据”。它提供了一张数学安全网。它证明,即使你不知道谁在认真关注,只要观察他们在选项明显不同时如何投票,就可以通过数学推断出这一点。

简而言之:这篇论文表明,只要我们拥有一种聪明的方法来过滤掉那些只是随意猜测的人,就可以将数百万普通用户转化为高质量的训练团队。这就像通过简单地让他们在大师厨师和新手之间做出选择,将一群混乱的人群转变为一个专家评委团。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →