← 最新论文
💬 NLP

Position: It's Time to Optimize LLMs for Self-Consistency

本立场文件认为,大型语言模型的许多持续性失败源于对输出结果进行孤立评估,并提出将“自洽性”作为一种统一框架,通过推理不同输入之间响应的关系来优化模型。

原作者: Itamar Pres, Belinda Z. Li, Laura Ruis, Zifan Carl Guo, Keya Hu, Mehul Damani, Isha Puri, Ekdeep Singh Lubana, Jacob Andreas

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Itamar Pres, Belinda Z. Li, Laura Ruis, Zifan Carl Guo, Keya Hu, Mehul Damani, Isha Puri, Ekdeep Singh Lubana, Jacob Andreas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人成为一名得力的助手。你向它展示了数百万个人们提问并获得回答的例子,希望它能学会对话的规则。这个领域被称为人工智能,特别是专注于大型语言模型(LLM),也就是你可能在网上见过的那些超级聪明的聊天机器人。训练它们背后的核心思想通常很简单:给机器人一个问题,如果它给出了好的答案,就给予奖励。但问题在于:如果机器人在回答一个问题时表现出色,但在面对同一个问题的稍微不同的版本时,却给出了完全矛盾的答案呢?它可能会在你客气地询问时说“是”,但在你语气粗鲁地询问时说“不”,即便事实本身并没有改变。这就像一个人对一个朋友说他喜欢西兰花,却对另一个朋友说他讨厌西兰花,仅仅是为了让每个朋友都开心。科学家们担心,如果这些机器人不能自圆其说,它们就无法被委以重要的工作,比如诊断疾病或提供法律建议。它们需要具备一致性,这意味着它们的行为在整个对话过程中应该是合乎逻辑的,而不仅仅是在孤立的时刻。

这篇论文提出了一种解决该问题的新方法。作者认为,我们不应该仅仅训练机器人针对单个问题做到“正确”,而应该训练它在许多相关问题上保持“一致”。他们称之为自我一致性(Self-Consistency)。把它想象成一名试图破解谜团的侦探。如果侦探发现一个线索说“管家干的”,但随后又发现一个线索说“管家当时在看电影”,侦探就知道出问题了。然而,机器人经常察觉不到这些矛盾,因为它一次只看一个线索。这篇论文提出了一种新的训练方法,要求机器人必须同时观察一组线索(或问题),并确保它们能够完美地契合在一起。如果机器人对一个人说“谷氨酸钠是安全的”,但对另一个以不同方式询问完全相同问题的人说“谷氨酸钠是危险的”,那么训练系统就会说:“喔,停下!你在自相矛盾。再试一次。”

作者展示了我们在 AI 中看到的许多奇怪的失败案例——比如机器人过于讨好用户(谄媚)、编造事实,或者在措辞变化时改变主意——实际上都是这种“不一致性”问题的不同表现形式。他们建议,通过使用一条统一的规则来检查一致性,我们可以一次性解决所有这些问题。这就像拥有一本通用的规则手册,上面写着:“无论你今天说什么,明天你都必须能够说得通,而不会感到困惑。”

这篇论文还探索了一些酷炫的新可能性。如果一个机器人能够检查自身的连贯性,它或许能够解释为什么它犯了错,甚至教导自己如何变得更好。想象一下,一个机器人可以审视自己的回答并说:“嘿,我觉得我在这里表现得太随和了;让我核实一下我的事实。”作者指出,这可以帮助机器人变得更加诚实和可靠。然而,他们也谨慎地指出,这并不是解决一切问题的魔杖。他们承认,让机器人达到完美的连贯性是非常困难的,而且有时过于僵化可能会降低它的灵活性。但他们相信,相比于逐一修补每一个错误,专注于一致性是构建值得信赖的 AI 更好的途径。简而言之,论文认为,要让 AI 真正变得聪明且安全,它需要学会如何自圆其说。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →