On the Role of Citations in Preference Data
本文研究了人类评审员与开源大语言模型在科学问答场景下如何评估引用,揭示了人类偏好多样但数量较少的引用,而大语言模型则表现出随模型和数据而变化的引用相关偏好,从而为改进奖励模型中的偏好数据收集提供了关键见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界中,一种特定类型的任务已成为这些系统学习和改进的核心:要求计算机在两个答案中选择较优的一个。这个被称为“偏好学习”的过程,是现代人工智能训练背后的引擎。当一个系统针对一个问题生成两个不同的响应时,评判者——无论是人类专家还是另一个人工智能程序——会决定哪一个更优。这些选择随后被用于教导原始系统如何表现得更像一位值得信赖的专家。然而,拼图中的一个关键部分一直不明确:当这些评判者查看包含外部来源引用(即已知为引文)的答案时,他们究竟在寻找什么?他们看重的是来源的数量、来源的多样性,还是信息的时效性?理解这一点至关重要,因为引文旨在成为抵御虚假信息的盾牌,允许用户验证人工智能是否在陈述事实。如果训练人工智能的系统不理解如何正确权衡这些参考资料,由此产生的模型可能会学会优先考虑错误的目标,例如列出许多来源却不检查其质量,或者完全忽略信息的可靠性。
一个研究小组着手调查这个问题,通过检查人类专家和人工智能程序如何评估带有引文的科学性回答。他们专注于这样一个场景:人工智能被要求回答一个复杂的科学问题,并提供了一个由学术论文作为背景支撑的长篇详细响应。研究人员收集了数千对这样的响应,其中一个答案被人类专家选为优于另一个。随后,他们要求四个不同的大型语言模型做出同样的抉择。为了理解这些决策背后的隐藏规则,该团队使用了一种统计方法,使他们能够分离出答案中的特定特征,例如使用了多少次引文、来源是否多样,以及参考文献是否与正文匹配,同时控制了诸如答案长度等其他因素。
研究揭示了人类在评判这些响应时呈现出一种独特且略显令人惊讶的模式。当人们审查科学性回答时,他们更倾向于那些借鉴了广泛不同来源的响应,这表明他们看重广度和视角。然而,他们也更倾向于引文总数较少的答案。这表明,虽然人类希望看到一个答案经过了充分的研究,但他们会对那些感觉充斥着过度引用而显得杂乱的响应感到反感。此外,如果正文中的引用与末尾的来源列表不匹配,人类会迅速予以惩罚,而这是一种常见的错误,暗示人工智能可能在编造参考文献。有趣的是,来源的新旧程度对人类评判者而言几乎无关紧要;他们并没有表现出对新论文强于旧论文的明显偏好。
相比之下,人工智能评判者的表现则大相径庭,且其偏好取决于进行评判的具体模型。虽然人工智能模型也倾向于多样化的来源,但它们对引文数量的反应往往比人类强烈得多。一些人工智能评判者强烈不喜欢具有大量引文的答案,而另一些则表现得无所谓。更关键的是,人工智能模型未能察觉或惩罚人类认为如此严重的问题——即引用不匹配的情况。相反,人工智能评判者深受表面特征的影响,例如响应的长度。几个模型一致地偏好较长的答案,无论额外的长度是增加了价值还是仅仅在填充空间。这表明,如果没有特定的训练或获取实际源文档的权限,这些人工智能系统并不是在真正“阅读”引文以验证其准确性,而是在对文本的视觉或结构模式做出反应。
研究人员发现,这些差异不仅仅是微小的偏差,而是可能影响未来人工智能系统训练的重要分歧。由于人工智能模型经常被用于为其他模型标注数据,如果不对其特定的偏好进行理解而盲目依赖,可能会导致系统学习到优先考虑长度或引文数量,而非实际的准确性和来源多样性。这项研究强调,尽管人工智能在许多方面可以模仿人类的判断,但它缺乏对什么构成可靠或一致的参考文献的直觉理解。作者建议,为了构建更好的系统,开发者必须更加谨慎地收集偏好数据,确保人类指南对于引文质量有明确的规定,并且人工智能评判者要么被赋予验证来源的工具,要么基于对其特定偏见的深度理解而被选中。最终,这项工作提醒我们,在追求使人工智能更加可靠的过程中,我们如何要求它在答案之间进行选择,其细节与答案本身同样重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。