← 最新论文
💬 NLP

Aligning Large Language Model Behavior with Human Citation Preferences

本研究通过构建一个揭示模型过度引用显式来源标记、而对数字和命名实体引用不足的细粒度数据集,调查了大语言模型引用行为与人类偏好之间的不一致性,并证明了直接偏好优化可以有效地校准这种行为,使其更好地符合人类预期。

原作者: Kenichiro Ando, Tatsuya Harada

发布于 2026-02-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Kenichiro Ando, Tatsuya Harada

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位导游(AI),正带领着一群游客(用户)穿梭在一座浩瀚的知识图书馆中。你的职责是讲述一些有趣的事实。但这里有个限制条件:如果你提出了一个观点,你需要出示你的“凭证”(引用/来源)来证明你不是在胡编乱造。

这个核心问题是:导游是如何决定哪些事实需要出示凭证的?

目前,AI 模型就像是读过无数遍图书馆目录的导游,但它们并没有被明确教导何时该出示凭证。它们往往出于错误的理由出示凭证,却漏掉了那些真正重要的凭证。

以下是研究人员发现的详细内容,使用了简单的类比:

1. “凭证”问题

在现实世界中,如果导游说:“这种药可以治流感,”你会希望立即看到医生的证明。但如果他们说:“天空是蓝色的,”你可能并不需要证据。

研究人员想看看 AI 模型是否知道“我是否需要为这个观点出示凭证”以及“我是否不需要”之间的区别。他们利用来自维基百科(一个巨大的在线百科全书)的 6,000 个句子构建了一个特殊的测试。他们询问人类编辑:“如果你是这位导游,你会为这个句子出示凭证吗?”

然后,他们向 AI 模型提出了同样的问题,并将答案进行了对比。

2. AI 做对的地方(“医疗”直觉)

好消息是:AI 模型在某一个特定方面表现得非常出色。当句子涉及医学或健康话题时,AI 几乎总是与人类达成一致,认为需要出示凭证。

  • 类比: 这就像一位导游知道,如果他提到了危险的悬崖,他必须展示一份安全警告。他在这一部分做得很好。

3. AI 做错的地方(“训练数据”陷阱)

坏消息是,AI 从它的训练数据(它阅读的数百万本书籍)中习得了一些坏习惯。

  • “红旗”过度反应: 在维基百科上,编辑有时会在某个句子旁贴上一个“需要引用”的标签。AI 看到这个标签就会想:“噢,我必须出示凭证!”即使这个句子其实非常简单。

    • 结果: AI 出示凭证的可能性比人类高出 27%,仅仅是因为它看到了那个标签。这就像一位导游仅仅因为有人曾叮嘱过要检查笔记,就对所有事情都出示凭证。这会造成信息冗余并让游客感到厌烦。
  • “数字”盲点: 人类知道,如果一个句子包含一个具体的数字(例如“50% 的人”或“在 1999 年”),那么它需要凭证,因为数字很容易出错。

    • 结果: 对于包含数字的句子,AI 出示凭证的可能性比人类低 22%。这就像一位导游说:“我们距离出口还有 5 英里,”却忘了出示地图,尽管这个数字至关重要。
  • “姓名”盲点: 同样地,如果一个句子提到了某个特定的人物姓名,人类会要求证据。

    • 结果: 对于提到姓名的句子,AI 出示凭证的可能性比人类低 20%。这就像导游在提到一位著名的历史人物时,却没有出示其出生证明。

4. 解决方法:“重新训练”导游

研究人员意识到,AI 并不是天生就知道这些规则,它只是从混乱的训练数据中学到了这些规则。因此,他们尝试使用一种称为**直接偏好优化(DPO)**的方法来“重新训练”AI。

把这想象成一位教练坐下来对导游说:“不要再为了‘需要引用’的标签而展示凭证了。开始为数字和姓名出示凭证吧。这里是人类真正想要的结果。”

结果:

  • 经过重新训练的 AI 在匹配人类偏好方面做得更好。
  • 对于较小的 AI 模型,这种“教练指导”将其准确性提高了近 12%
  • 这证明了我们可以教会 AI 成为更好的导游,但我们必须显式地训练它们,它们不会自发学会。

总结

AI 模型正在变得越来越聪明,但它们目前并不擅长判断何时需要证明自己的事实。它们太急于为不需要的事情出示凭证(因为维基百科的标签),却又在需要出示凭证的事情(如数字和姓名)上过于懒散。

然而,这篇论文表明我们可以解决这个问题。通过专门教授 AI 什么是人类偏好的做法,我们可以让它们变得更可靠、更简洁,确保当它们出示凭证时,那份凭证确实是有意义的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →