Repair, Not Improvement: Decomposing Constrained Decoding in Tool-Call Abstention
本文表明,在工具调用场景中的约束解码往往无法修复弃权错误,因为强制执行停止标记带来的负面影响通常超过了限制标记选择所带来的益处,这最终揭示了先前关于语言特定性能差异的说法是缺乏依据的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
背景设定:AI、规则与说“不”的艺术
想象一下,你正在教一个非常勤奋、反应极快的机器人成为一名得力的助手。这个机器人擅长写故事、解数学题,甚至能假装成一名巫师。但有一个问题:有时,机器人能做的最好的事情就是承认自己不知道答案,或者承认自己不应该做任何事。在 AI 世界中,这被称为“弃权”(abstention)。如果你问机器人天气预报,但实际上你想知道的是法律机密,机器人应该说“我无法处理此请求”,而不是自信满满地编造一个虚假的法律意见。
为了防止这些机器人编造荒诞的故事或违反规则,工程师们使用了一种叫做“约束解码”(constrained decoding)的小技巧。把这想象成给机器人一本严格的涂色书。与其让机器人在页面上随处涂鸦,不如规定它只能在特定的轮廓内(比如 JSON 格式或允许使用的工具列表)进行涂色。如果机器人试图画到轮廓之外,计算机就会立即阻止它。长期以来,科学家们认为这个技巧几乎是“免费”的:它能让机器人的回答看起来完美且整洁,而不会损害其本身的脑力。但有一个疑问始终悬在头顶:当机器人需要说“我不能做这件事”时,会发生什么?那本严格的涂色书是否会强迫机器人即使在不该行动时也必须选择一个工具?这篇论文正是针对这一问题展开研究,测试了那些让回答看起来完美的规则,是否真的破坏了机器人识别何时停止的能力。
故事内容:当规则破坏了“拒绝按钮”
研究人员决定通过一个聪明的实验来验证这个想法。他们选取了几个 AI 模型(从拥有 6 亿个“脑细胞”的小型模型到稍大的 40 亿参数模型),并问了它们一个简单的问题:“我应该使用工具,还是直接说‘无’(None)?”他们使用了英语和韩语两种语言进行测试,以观察语言是否会改变结果。
为了准确理解问题出在哪里,他们并没有仅仅对比“自由回答”与“受限回答”,而是增加了一个中间步骤,就像一部三幕剧:
- 自由幕(The Free Act): 机器人可以随心所欲地回答,并有充足的空间进行解释。
- 短促幕(The Short Act): 机器人只用一行回答,但它仍然可以自由表达。这测试了仅仅切断机器人的解释是否会损害其准确性。
- 受限幕(The Restricted Act): 机器人用一行回答,但被迫必须从一个严格的工具列表中进行选择(或选择“无”)。这是标准的“约束解码”方法。
通过对比这三幕,科学家们可以将两个不同的问题区分开来:一是缩短机器人言论所带来的代价,二是强迫其从列表中做出选择所带来的代价。
重大发现:是修复,而非提升
结果令人惊讶,甚至有些反直觉。论文发现,当你强迫机器人从一个严格的工具列表中进行选择时,它并不会变得更聪明于决定何时说“不”。事实上,对于最小的模型来说,严格的规则显著降低了它们弃权的能力。在一种特定情况下(即在韩语环境下使用 0.6B 的微型模型),与让机器人自由表达相比,严格的规则导致准确率下降了 29.5 个百分点。
然而,当你观察规则在某些情况下为何能起到作用时,故事变得更有趣了。研究人员发现,严格的规则更像是一个“修理包”,而不是“大脑升级包”。当机器人被迫从列表中选择时,它不再产生乱码或无法阅读的文本。它将“胡言乱语”转化成了“看起来正确的答案”。但它并没有将“错误的决策”转化为“正确的决策”。
这里是关键所在:研究人员查看了 698 个规则将错误答案转变为正确答案的实例。他们发现,其中 545 个案例是机器人原本完全无法生成可读的答案。而在机器人已经做出了正确决策但被格式限制住的情况下,这类案例的数量为零。这意味着规则并没有修复机器人的判断力,它们只是修复了机器人的“笔迹”。
隐藏陷阱:“停止”标记 vs. “枚举”
论文还将严格规则拆解为两个部分,以找出谁才是“罪魁祸首”:
- 停止标记(The Stop Token): 这是规定“在写完一行后停止”的规则。
- 枚举(The Enum): 这是规定“你只能从这个特定的工具列表中进行选择”的规则。
他们发现这两个部分正在互相冲突。“停止标记”(缩短回答长度)实际上是主要原因,它在某些情况下降低了机器人说“无”的能力,降幅约为 20.0 点。而“枚举”(工具列表)则试图通过补回约 19.5 点 的准确率来修复这一问题。当两者结合在一起时,它们几乎相互抵消,最终只留下了 0.5 点 的微小净损失。
这解释了为什么之前的研究可能会忽略这个问题。如果你只看最终的数字,看起来规则似乎没造成什么伤害。但如果你深入了解其内部机制,你会看到一个巨大的损失被一个巨大的修复所掩盖。规则并没有改善机器人的决策能力,它们只是修补了因缩短机器人言论而造成的损伤。
结论:不要期待大脑升级
论文最后向所有构建 AI 系统的人发出了明确的警告。如果你使用严格的格式化规则来让你的 AI 看起来更专业,不要指望它会变得更擅长知道何时“不作为”。这些规则会让输出看起来整洁易读,但它们无法修复一个对“是否应该行动”感到困惑的机器人。
事实上,这项研究表明,这些规则可能会促使机器人比预期更频繁地采取行动。当机器人被迫从列表中做出选择时,它往往会将自己的“决策线”向“选择工具”的方向移动,即使正确答案应该是“不做任何事”。这对安全性来说是危险的:一个被迫选择工具的机器人,在你询问法律问题时,可能会自信地调用天气 API,仅仅是因为规则没有给它一个清晰的表达“我无法处理”的方式。
研究人员在不同模型和语言(英语和韩语)中进行了测试,发现这一模式依然成立。严格的规则对于修复混乱的文本非常有效,但它们并不是提升判断力的魔杖。正如论文所言,这些规则“让不可读的输出变得可读,这虽然值得拥有,但它们仅仅是将判断力维持在了原样”。因此,如果你希望你的 AI 知道何时说“不”,你不能仅仅依靠一份严格的清单;你必须教会机器人本身如何停下来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。