Preference Reasoning under Indeterminacy in Large Language Models
本文认为,由信息不全和解不存在导致的确定性缺失(indeterminacy)是人工智能偏好推理面临的核心挑战,并证明了最先进的大型语言模型系统性地无法区分确定实例与不确定实例,从而导致推理失准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个人工智能扮演个人助手、群体决策调解人或复杂系统匹配者的世界。在这些角色中,机器必须理解人类的需求,即便这些需求往往是模糊、不完整甚至相互矛盾的。它不仅要决定什么是最佳选择,还要决定何时根本无法找到最佳选择。这就是偏好推理(preference reasoning)的领域,在这个领域中,计算机学习如何应对人类的欲望。多年来,研究人员一直使用具有清晰、单一正确答案的谜题来测试这些系统,就像数学测试一样,每个问题都有一个等待被发现的解。但在现实生活中,情况很少如此整洁。在现实世界中,信息往往是不完整的,或者情境本身的规则使得构建解决方案变得不可能。科学家们今天面临的问题是,我们最先进的人工智能是否能够区分一个需要解决的问题和一个根本没有答案的问题。
宾夕法尼亚州立大学的一个研究小组致力于测试这种确切的能力。他们基于经典的经济学问题构建了一系列挑战,例如将房屋分配给人们或在市场中进行配对。在这些场景中,每个人都有一个偏好列表。研究人员创建了数千个这样的场景,从包含十个项目的简单列表到涉及数百个代理人的复杂网络。他们设计的测试包含两种类型的确定性缺失。第一种发生在提供的信息本身不完整时,比如一个人只列出了他一半喜欢的食物。第二种发生在问题本身的结构使得解决方案无法实现时,例如一组偏好设置中,不存在任何公平的安排方式,否则总会有人感到不满。研究人员随后要求四种目前最强大的语言模型来解决这些谜题。他们想看看这些机器能否正确识别问题是无法回答的,并且如果确实如此,能否承认它们不知道,而不是进行猜测。
结果揭示了这些系统思维方式中的一个显著盲点。当面对一个有明确答案的问题时,模型的表现很好,通常能掌握细节。然而,当信息不完整或解决方案不存在时,模型始终无法识别这种死胡同。它们并没有说“我无法确定这一点”,而是自信地编造了答案。它们通过默默做出假设来填补缺失的空白。例如,如果一个人的偏好列表被截断了,模型就会假设缺失的项目是按字母顺序或某种其他任意规则排列的,然后基于那个猜测给出确定的答案。在不存在解决方案的情况下,模型通常仍会生成一个虚假的解,或者声称存在一个解而实际上并不存在。这种行为并非随机错误;它是一种系统性的模式。模型似乎无法区分一种“需要更努力思考”的情况和一种“即使更努力思考也无济于事,因为答案根本不存在”的情况。
研究人员还测试了给模型一个表达“我不知道”的方式是否能解决问题。他们增加了一个特定的选项供模型在感到信息不足时选择。虽然这在某些情况下帮助模型承认了不确定性,但也创造了一个新问题。模型开始过度使用这个选项,甚至在完全可能存在解决方案的情况下也宣布不存在解。这就像模型从一种盲目的自信转向了另一种过度的谨慎,无法找到中间地带。即使研究人员允许模型编写计算机代码来解决问题——这通常是一种能提高准确率的方法——模型仍然表现挣扎。它们可以解决小型、简单的版本,通过检查所有可能性来完成,但随着问题规模变大,它们就会退回到猜测或放弃,无法将其推理能力扩展到现实世界的应用规模。
或许最能说明问题的发现来自于一个测试,在测试中,模型不需要创建解决方案,而只需从选项列表中选出正确的一个。即使是在这种更简单的任务中——模型只需验证答案而非构建答案——它们也经常选择错误的选项。它们经常选择一个看起来看似合理但未能满足问题严格规则的解。这项研究表明,这些模型有一种根深蒂固的倾向,即优先考虑表现得乐于助人和果断,而非准确描述什么是可能的。它们被训练去完成模式并生成看起来正确的文本,这使得它们在填充故事中的空白方面表现出色,但在识别故事何时没有结局方面却表现拙劣。
这项研究表明,当我们把这些系统整合到关键决策角色中时,我们必须谨慎对待我们的期望。识别一个问题无法被回答的能力,与回答问题的能力同样重要。目前,最先进的模型尚未能够可靠地做出这种区分。它们可能会继续提供自信且听起来合理的答案,即使数据缺失或规则使得解决方案无法实现。在这种情况改变之前,依靠这些系统处理涉及人类偏好的高风险决策,需要有人类参与其中,以验证不仅是答案本身,还有答案存在的可能性。该研究并非声称这些模型是损坏的,而是指出它们正在以一种与人类不同的逻辑运行,这种逻辑难以接受“已知之物”的局限性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。