← 最新论文
💬 NLP

Learning When to Trust via Selective Context Preference Optimization

本文介绍了用于选择性信任的基准测试 MIST,并提出了 SCOPE,这是一种旨在优化模型以抵抗误导性上下文,同时保留其正确利用有益或无关信息的能力的训练方法,从而解决了仅仅忽略所有外部信号的局限性。

原作者: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位天才侦探,只需通过观察桌上的线索就能破解任何谜题。你的逻辑极其出色,甚至能在脑海中瞬间解开谜语。但随后,有人在你耳边低语了一个提示。有时,这个提示很有帮助,能引导你走向正确的答案;而有时,它是一个陷阱——一个听起来非常合理、极具说服力的谎言,旨在让你改变主意并选择错误的答案。

这就是现代“大语言模型”(LLMs)的世界——那些能与我们聊天、编写代码、解决数学问题的超强大人工智能大脑。这些模型就像我们的侦探一样:它们极其强大,但也有一个棘手的习惯。如果你给它们一个问题,然后加上一句看起来像是 helpful 提示、实则是错误信息的句子,它们往往会感到困惑,即便它们原本知道正确答案,也会给出错误的回答。科学家们称之为“易感性”(susceptibility)。一个巨大的问题是:我们如何教这些 AI 侦探去忽略骗子,同时又依然倾听诚实的人?如果我们只是告诉它们忽略“所有人”,它们就会变得毫无用处,因为它们连好的提示也不听了。

这篇论文介绍了一种测试和训练这些 AI 大脑的新方法,它不将这个问题视为“如何变得固执”,而是视为“如何变得有选择性”。研究人员创建了一个特殊的游乐场,叫做 MIST(误导性信号测试平台)。把 MIST 想象成一个大型游戏秀,每个参赛者(AI)都要面对同一个谜题四次。在第一轮中,没有额外的提示。在第二轮中,一个狡猾的骗子低语了一个错误的答案。在第三轮中,一个友好的朋友低声说出了正确的答案。在第四轮中,一个话痨在谈论一些完全无关的事情。通过观察 AI 在这四种场景下的反应,研究人员可以清楚地看到,谁足够聪明,能够识别出骗子而不忽略朋友。

他们发现了一些令人惊讶的事实:他们测试的几乎每一个 AI 模型,无论是最大的超智能模型还是较小的开源模型,都掉进了陷阱。当加入一个看似合理但错误的提示时,它们的准确率显著下降。即使是“最聪明”的模型也被骗了。这证明了该问题是普遍存在的;AI 并非仅仅是在粗心大意,而是真的在努力区分有用的信号和误导性的信号。

论文指出,修复这一问题的旧方法——训练 AI 具有“抵抗力”或让它忽略所有外部提示——是一个坏主意。这就像是教一名侦探去忽略“所有”证人,甚至包括那些诚实的证人,仅仅为了避免被骗子误导。结果就是,这位侦探虽然免受谎言侵害,却变得毫无用处。

相反,作者提出了一种新的训练方法,叫做 SCOPE(选择性上下文偏好优化)。想象一下你在训练一只狗。如果你只在它听从了错误的指令时惩罚它,它可能会停止听从任何人的指令。但如果你奖励它听从正确的指令、忽略错误的指令,并在有人谈论天气时保持冷静,它就会学会如何聪明地判断“该听谁的”。SCOPE 对 AI 也是如此。它提取 AI 的错误(即被骗子误导的时刻),并将其与它做对的时刻(即忽略了骗子或听从了助手时的时刻)进行配对。然后,它教导 AI 在所有四种情况下都倾向于做出“聪明”的选择。

结果是令人振奋的。当他们使用 SCOPE 来训练一些流行的 AI 模型时,这些模型在识别骗子方面变得更出色了。它们不再被错误的提示所迷惑,同时也并未失去利用正确提示或忽略无聊闲聊的能力。事实上,这些模型解决原始谜题的能力也得到了提升。研究人员在 AI 从未见过的其他谜题上测试了它们,这种“选择性信任”的技能得以保留。AI 学会了“何时信任”,而不仅仅是学会了“不信任一切”。

简而言之,这篇论文表明,可靠 AI 的未来不在于建立围墙来阻挡所有信息,而在于教导 AI 成为一名批判性思考者:倾听真相,忽略谎言,并在噪音喧嚣时保持专注。他们并没有完美地解决问题(一些狡猾的谎言仍然会骗过 AI),但他们展示了一条清晰的前进路径:不要试图让 AI 变得固执,而要开始教导它变得睿智。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →