← 最新论文
💬 NLP

Decoupling Task-Solving and Output Formatting in LLM Generation

本文介绍了 Deco-G,这是一个通过专门的格式估计模块将问题解决过程与僵化的格式要求解耦,从而在不阻碍推理的情况下确保合规性,进而提升大语言模型在复杂任务上表现的解码框架。

原作者: Haikang Deng, Po-Nien Kung, Nanyun Peng

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Haikang Deng, Po-Nien Kung, Nanyun Peng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正要求一个超级聪明的机器人去解决一个棘手的数学难题,但你还要求它必须以一种非常特定、僵化的格式来写出答案,比如“最终答案是 42。” 通常情况下,当你把“深度思考”的部分和“完美写作”的部分混合在一个庞大的指令中时,机器人会感到困惑。这就像是在走钢丝的同时还要玩杂耍:它要么会丢掉球(数学题),要么会被绳子绊倒(格式要求)。

Haikang Deng 及其同事发表的一篇论文介绍了一种名为 DECO-G 的新系统来解决这个问题。你可以把 DECO-G 想象成两个专家之间的精妙协作:一位是问题解决者(Problem Solver),另一位是格式警察(Format Police Officer)

问题所在:“纠缠”的混乱

在旧的方法中,你会给机器人一个巨大的提示词:“解决这个数学问题,并且确保你把答案写在一个 JSON 框里。” 这篇论文认为这种“纠缠”会损害机器人的大脑。他们指出,当机器人试图同时完成这两件事时,它为了满足格式规则而开始在数学上出错。

作者明确反对仅仅告诉机器人“要小心”,或者使用僵化的预设模板(比如强迫它按部就班地遵循严格的 JSON 模式)是最好的解决方案。他们发现,这些僵化的方法往往会在机器人思考的中途切断它的思路,导致即使格式看起来很完美,答案也会变得不连贯或数学错误。

解决方案:双团队策略

DECO-G 将工作进行了拆分:

  1. 问题解决者(LLM): 这是主机器人。它只接收数学问题。它完全不需要担心格式问题。它只需自由地思考、推理并解决问题。
  2. 格式警察(FEM): 这是一个独立的、较小的辅助模块。它不解决数学问题。它的唯一任务是观察机器人的输出,并轻声提醒:“嘿,你快接近结尾了,但在给出数字之前,你需要说‘最终答案是’。”

奇迹发生在它们交流的方式上。格式警察使用一种特殊的“概率前瞻”(一种窥探未来的高级方式)来猜测:“如果机器人现在说‘最终’,它能正确完成句子的概率是多少?” 如果概率很低,警察就会轻轻地引导机器人的下一个词,将其重新引回正轨,而不会强行中断它的思考过程。

秘密武器

为了让这种协作既快速又不会拖慢计算机的速度,作者引入了三个酷炫的技巧:

  • 指令感知蒸馏(Instruction-Aware Distillation): 他们没有在随机、枯燥的聊天数据上训练格式警察,而是专门针对机器人解决实际问题时的行为进行训练。这使得警察更聪明,能更好地预判机器人下一步可能做什么。
  • 灵活的 Trie 树构建(Flexible Trie Building): 想象一张关于答案可能呈现形式的所有路径的地图。通常,如果答案长度不一,这些地图会变得巨大且混乱。作者构建了一张“灵活”的地图,通过合并路径,使得计算机不会因为尝试检查每一个可能性而过载。
  • HMM 状态剪枝(HMM State Pruning): 格式警察拥有一个拥有数千个隐藏状态的庞大大脑。作者意识到,大多数时候,机器人其实只关心极少数的状态。因此,他们让警察忽略其余部分,这使得每一步的计算工作量减少了约 13 倍(从大约 1.08 GFLOPs 降至 0.08 GFLOPs),同时保持了几乎相同的准确度。

数据说明

团队在三个不同的挑战中测试了该系统:

  1. 数学问题 (GSM8k): 在解决小学数学问题时,DECO-G 始终优于其他方法。例如,在 Llama-3.1-8B 模型上,它在保持 100% 格式合规性的同时,拿到了 85.2% 的正确率。相比之下,一种被称为“Outlines”的僵化方法仅获得了 81.3% 的正确率,而标准的“仅提示词(Prompt-Only)”方法虽然达到了 82.3% 的正确率,但大多数时候都无法通过格式校验。
  2. 事件抽取(Event Extraction): 当被要求从新闻故事中提取特定细节时,DECO-G 提高了识别谁做了什么(Argument Id 指标上升至 Llama 的 39.4)。
  3. LLM 作为评委(LLM-as-a-Judge): 当机器人需要对摘要进行评分时,DECO-G 帮助它更好地与人类评委保持一致,实现了最高的平均相关性得分(例如 Coherence 指标在 Llama 上达到了 0.418)。

结论

论文表明,通过将“思考”与“格式化”分离,我们可以获得两全其美的结果:既有数学上的正确性,又有完美的格式。作者通过真实数据集衡量了这一点,发现 DECO-G 始终优于试图一次性完成所有任务或使用强制约束的方法。

然而,他们也提到了一些注意事项。这个系统并不是一个能立即应用在任何机器人身上的魔杖;你必须为使用的每个特定机器人模型训练一个新的“格式警察”。此外,对于某些模型(如 Qwen 系列),机器人的大脑过于专注,因此你必须加大对格式警察的控制力度(使用控制因子 γ=2)才能让它听从指挥。

简而言之,DECO-G 建议,如果你想让一个机器人既是数学天才又是格式完美主义者,就不要让它同时做这两件事。给它一个处理规则的搭档,然后看它大放异彩。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →