← 最新论文
🤖 AI

Bridging Auxiliary Constraints to Resolve Instruction Following in Large Reasoning Models

本文引入了约束关系图补全(Constraint Relationship Graph Completion, CRGC),这是一种通过构建指令知识图谱来识别并生成用于调和竞争性需求的“桥接约束”,从而在不损害推理能力的情况下将约束违背减少 39% 的新颖框架,旨在解决大型推理模型中的约束遵循问题。

原作者: Zhengyi Zhao, Shubo Zhang, Huimin Wang, Zezhong Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Yulan He, Kam-Fai Wong, Xian Wu

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengyi Zhao, Shubo Zhang, Huimin Wang, Zezhong Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Yulan He, Kam-Fai Wong, Xian Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在要求一位非常聪明、有创意的助手为你写一个故事。你给它列出了一系列规则:“要幽默”、“字数控制在200字以内”、“不要使用字母‘e’”、“包含一只猫”。

在过去,即使是最聪明的助手(被称为大型推理模型)也经常在这些任务上栽跟头。它们可能会写出一个极其搞笑但长达500字的故事,或者写出一个短小却极其严肃的故事,又或者完全忘记了那只猫。它们会被试图同时处理这么多规则所压垮,尤其是当这些规则看起来相互冲突时(比如既要“幽默”又要“短小”)。

这篇论文将这种挣扎称为约束遵循问题(Constraint Adherence Problem)。这就像是要求一位厨师同时完成“辛辣”、“甜味”、“盛在碗里”以及“盛在盘子里”这些要求。厨师会感到困惑,最后端上来一堆乱七八糟的东西。

解决方案:构建“桥梁”地图

作者提出了一种与这些 AI 模型沟通的新方法,称为 CRGC(约束关系图补全)。与其只是把一堆规则丢给 AI,这种方法更像是在工作开始前扮演一名交通指挥员施工经理

以下是它的工作原理,我们用一个简单的类比来说明:

1. 蓝图(图谱)

首先,系统将你的请求分解为单个规则(约束)。然后,它绘制一张展示这些规则如何相互关联的地图(图谱)。

  • 它们是否互相促进?(例如:“使用项目符号”有助于实现“保持简短”)。
  • 它们是否相互冲突?(例如:“非常详细”对比“控制在200字以内”)。
  • 它们是否被忽略了?(例如:AI 忘记了“将答案放在引号内”)。

2. 寻找交通拥堵点

系统查看这张地图并找出问题所在。它会识别出规则发生冲突的地方,或者 AI 容易因分心而忘记规则的地方。

3. 构建桥梁

这是神奇的部分。当系统看到两个相互冲突的规则(如“详细”与“短小”)时,它不会只是告诉 AI“再努力一点”。相反,它会发明一个桥梁约束(Bridge Constraint)

把桥梁约束想象成一个翻译官调解员

  • 冲突: “写一段详细的解释”对比“控制在200字以内”。
  • 桥梁: 系统增加了一条有用的指令:“使用项目符号和加粗文本,以便在最小的空间内装入尽可能多的信息。”

这条新指令充当了一座桥梁。它为 AI 提供了一个具体的策略,使其能够在不破坏任何一个原始规则的前提下,同时满足这两个规则。它将冲突转化为了一个可解的谜题。

为什么这与众不同

以往的方法尝试通过以下方式解决问题:

  • 更严格地训练 AI: 就像雇佣一位新厨师并教他好几个月。这既昂贵,又可能让厨师忘记如何烹饪其他菜肴。
  • 要求 AI 事后检查自己的工作: 就像要求厨师做完菜、尝一下味道、意识到太长了,然后再重做一遍。这非常耗时,而且往往会导致“打地鼠”的问题——修复一个错误往往会产生另一个错误。

CRGC 的不同之处在于:

  • 它不改变 AI 的大脑(无需重新训练)。
  • 它不会等错误发生后再去处理,而是提前规划。
  • 它利用 AI 自身的知识来自动创建这些“桥梁”。

结果

作者在三组不同的困难指令上测试了该方法。

  • 结果: 与仅提供标准指令相比,AI 遵循规则的能力提升了 39%
  • 平衡性: 至关重要的是,AI 在处理其他任务时并没有变得“变笨”。通常情况下,当你教 AI 严格遵守规则时,它的通用推理能力会下降。但由于这种方法只是在指令中添加了有用的“桥梁”,而没有改变 AI 的核心训练,因此它在变得更擅长遵循规则的同时,依然保持了在数学和逻辑方面的聪明才智。

总结

想象一下你正在导演一部戏。

  • 旧方法: 你告诉演员:“要幽默、要短小、不要绊倒。”他们会感到困惑、绊倒或者滔滔不绝。你不得不对着他们大喊让他们重来。
  • CRGC 方法: 在戏开演前,你审视剧本并意识到“幽默”和“短小”很难兼得。于是,你给演员一个具体的技巧:“讲一些带有笑点的短笑话。”这个“桥梁”帮助他们在第一次尝试时就能完美达成两个目标,而不需要重写整个剧本,也不需要开除演员。

论文表明,通过帮助 AI 模型理解其指令之间的联系与冲突,我们可以让它们变得更加可靠,而无需从头开始重建它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →