← 最新论文
💻 computer science

When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences

本文引入了一种基于对称性的实验框架,用以系统地衡量大语言模型如何解决相互竞争的规范之间的冲突,揭示了在不同领域中存在着一致的偏好层级,即形式化语言和自然化形式语言优于纯自然语言和输入输出示例。

原作者: Tairan Wang, Liang Zhou, Zikang Zhan, Pingchuan Yan

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Tairan Wang, Liang Zhou, Zikang Zhan, Pingchuan Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在向一位非常聪明、博学多才的朋友寻求解决一个棘手谜题的帮助。但这里有个陷阱:你的这位朋友收到了两份针对同一个谜题的不同说明书,而这两份说明书相互矛盾。一份说:“向左转红色旋钮,”而另一份则坚持说:“向右转红色旋钮。”在人工智能的世界里,这些“朋友”就是大型语言模型(LLMs)——它们是经过几乎整个互联网文本训练的庞大计算机程序。它们擅长写故事、解数学题甚至编写代码,但当接收到的信息混乱或冲突时,它们经常会感到困惑。

这篇论文深入探讨了人工智能科学的一个特定领域:冲突解决(Conflict Resolution)。它提出了一个简单而深刻的问题:当人工智能收到两条相互冲突的指令时,它究竟听哪一个?它更倾向于严格的数学公式?一句普通的英文句子?一个例句列表?还是一个正式的代码片段?理解这一点至关重要,因为随着我们开始将人工智能用于重要的任务——比如编写计算机代码、诊断医疗问题或做出法律决策——我们需要知道人工智能是在遵循“硬性规则”,还是仅仅根据词汇听起来的感觉在进行猜测。如果我们不知道人工智能优先考虑哪条指令,我们就无法信任它的答案。

伟大的指令对决

伦敦大学学院的研究人员决定将这个问题当作一场科学竞赛实验来对待。他们并没有只是问人工智能一些随机问题,而是构建了一个受控的竞技场,让他们能够迫使人工智能在两个特定的、冲突的规则之间做出选择。他们称之为“基于对称性的框架”,这是一种高级说法,意思是通过完美设置游戏,使得唯一发生变化的是规则的“写法”,而不是规则本身。

为此,他们创建了一个庞大的“数学战斗竞技场”,其中包含 550 个不同的冲突场景。在每个场景中,人工智能都必须解决一个数学问题(例如计算一个序列或寻找图中的路径),但同时被给予了两种不同的方式来描述解决方案。他们测试了四种截然不同的“语言”形式的指令:

  1. 纯自然语言: 仅使用普通的英文句子(例如,“把数字加在一起。”)。
  2. 形式语言: 严格的数学符号和方程(例如,f(x)=x+1f(x) = x + 1)。
  3. 自然化形式语言: 一种混合形式,使用数学符号但包裹在英文句子中(例如,“该函数的定义为 f(x)=x+1f(x) = x + 1。”)。
  4. 输入-输出示例: 一个展示输入及其结果的示例列表(例如,“如果输入 2,输出 3。如果输入 5,输出 6。”)。

人工智能必须选择其中一种描述来解决特定的测试问题。研究人员随后观察人工智能足够“信任”哪种描述并据此执行。

结果:信任的等级制度

研究结果出人意料地一致。人工智能并非随机选择;它有一个非常明确的偏好。事实证明,人工智能热爱结构,厌恶歧义

研究人员发现了一个严格的“等级制度”:

  1. 顶层: 形式语言自然化形式语言是明显的赢家。当这些语言与纯英文或示例进行竞争时,人工智能遵循这些规则的频率高达 87% 到 93%。似乎当人工智能看到一个清晰的数学公式时,它会将其视为“法律”。
  2. 中层: 纯自然语言位居第二。它比示例更可靠,但不如数学可靠。在与示例竞争时,人工智能遵循这些指令的频率约为 78%
  3. 底层: 输入-输出示例是最不被信任的。当人工智能必须在一条清晰的规则和一组示例之间做出选择时,它几乎总是忽略示例。

可以这样理解:如果你告诉一个机器人,“这是我吃午饭的时间表:12:00, 12:15, 12:30,”它可能会猜你会在 12:45 吃午饭。但如果你告诉它,“我每天中午 12:00 吃午饭,”它就会坚持 12:00。人工智能更倾向于显性的规则,而非它必须通过猜测得出的模式。

不仅仅是数学:现实世界测试

团队并未止步于数学。他们想看看这种“信任等级制度”在更复杂的现实世界情况中是否依然成立。他们在其他三个领域测试了人工智能:

  • 布尔代数(逻辑门): 他们让一个紧凑的数学公式与一个巨大的“真值表”(列出所有可能结果的庞大列表)进行对决。尽管真值表是详尽且不可能出错的,但人工智能仍然在 88% 的情况下更倾向于选择紧凑的公式。看来人工智能比起“暴力”列表,更喜欢“聪明”的捷径。
  • 代码生成: 他们给人工智能提供了一个关于计算机程序应该做什么的文字描述,以及一套自动化测试(检查程序是否工作的代码)之间的冲突。在这里,结果取决于人工智能的“脑力”。规模较小、能力较弱的模型倾向于遵循文字描述,而最强大的模型则强烈偏好自动化测试,遵循率高达 97%。这表明,随着人工智能变得越来越聪明,它学会了信任代码测试这种“硬证据”,而非人类的描述。
  • 临床规则(医疗建议): 他们用关于药物剂量的真实医疗规则测试了人工智能。有趣的是,人工智能并不关心“格式”(英文还是示例),它更关心的是“内容”。在这个领域,人工智能始终选择更严格的规则(即那个说“不要这样做”的规则),无论该规则是如何编写的。这表明,在涉及高风险的领域,人工智能具有内置的安全偏好。

这对我们意味着什么

论文总结道,人工智能不仅仅是一个随机的猜测者;它有一套系统化的方法来决定遵循哪些指令。它通常更喜欢显性的、结构化的规则(如数学公式),而不是隐含的模式(如示例)。

然而,研究人员也发现,这并不是一个完美、不可改变的定律。人工智能的偏好会根据模型的智能程度以及所处理的任务类型而发生变化。例如,在医疗测试中,人工智能完全忽略了格式,而直接寻找“更安全”的答案。

这项研究为我们衡量人工智能如何思考提供了一个新工具。通过了解人工智能有一个“偏爱的”指令类型,我们可以设计出更好的系统。如果我们希望人工智能遵循特定规则,我们应该将其写成清晰、正式的陈述,而不是寄希望于它能从一份示例列表中自行领悟。这提醒我们,虽然人工智能正在变得越来越聪明,但它仍然需要我们用清晰的方式与其交流——尤其是在指令发生冲突的时候。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →