← 最新论文
💬 NLP

LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints

本文介绍了用于评估大语言模型在真实世界多约束指令下表现的基准测试 RealInstruct,并提出了 DeCRIM,这是一个通过分解指令、批判响应及优化输出,使开源模型能够超越 GPT-4 的自我修正流水线。

原作者: Thomas Palmeira Ferraz, Kartik Mehta, Yu-Hsiang Lin, Haw-Shiuan Chang, Shereen Oraby, Sijia Liu, Vivek Subramanian, Tagyoung Chung, Mohit Bansal, Nanyun Peng

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Thomas Palmeira Ferraz, Kartik Mehta, Yu-Hsiang Lin, Haw-Shiuan Chang, Shereen Oraby, Sijia Liu, Vivek Subramanian, Tagyoung Chung, Mohit Bansal, Nanyun Peng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:基于 DECRIM 的 LLM 自我修正

问题陈述

尽管大语言模型(LLMs)在指令遵循方面展现出了令人印象深刻的能力,但近期的研究表明,它们在处理包含多个同时存在的约束(例如特定的语气、长度以及像“不要使用标签”这样的负向约束)的指令时,表现得非常吃力。现有的评估这些能力的基准测试主要依赖于合成数据,这可能无法捕捉到现实世界用户请求中的复杂性、细微差别和人工设计的难度。此外,目前的自我修正方法通常假设约束之间是相互独立的,或者仅关注特定类型的约束,这限制了它们在开放式、多约束场景下的适用性。同时,在可靠且具有成本效益的复杂指令评估方法方面也存在空白,因为对于开放式任务,基于规则的评估往往是不可行的。

研究方法

1. REALINSTRUCT 基准测试

为了解决对合成数据的依赖,作者引入了 REALINSTUCT,这是首个旨在评估 LLM 在真实世界多约束指令下表现的基准测试。

  • 数据来源: 源自 AI 助手真实的查询语句(取自 ShareGPT),经过筛选以保留仅包含约束条件的英文指令。
  • 结构: 每条指令被分解为任务(主要目标)、上下文(Context)以及一系列细粒度的约束(Constraints)。
  • 规模: 测试集包含 302 条指令及 1,055 个约束;验证集包含 842 条指令及 2,500 个约束。
  • 评估协议: 由于数据的开放性质,该基准测试采用了 LLM-as-a-Judge(以 LLM 作为评判者)的方法。约束被逐一进行评估,结果汇总为指令级的准确率指标。

2. LLM-as-a-Judge 验证

作者研究了使用 LLM 来评估约束满足情况的可靠性,将商业模型(GPT-4, GPT-4-Turbo, GPT-3.5-Turbo)和开源模型(Mistral, Vicuna, Zephyr)与人类标注进行了对比。

  • EvalJudge 数据集: 一个包含 1,000 个“指令-约束-响应”三元组的测试集,其标签经过人类验证。
  • 策略: 测试了多种适配策略,包括结合思维链(CoT)提示词的上下文学习(ICL),以及针对开源模型的弱监督微调。
  • 发现: 采用 CoT 提示词的 GPT-4-Turbo 脱颖而出,成为最具成本效益且最可靠的评估器,在检测未满足的约束方面显著优于开源模型。

3. DECRIM 流水线(分解、批判与精炼)

为了弥合开源模型与商业模型之间的性能差距,作者提出了基于 System 2 方法的自我修正流水线 DECRIM。它不假设约束之间相互独立,由四个迭代步骤组成:

  1. 初始响应: LLM 生成对原始指令的响应。
  2. 分解(Decompose): 分解模型将原始指令拆解为一系列需要遵循的细粒度约束列表。
  3. 批判(Critique): 批判模型根据每个约束对响应进行评估。如果所有约束均已满足,则过程结束。如果未满足,批判模型会提供自然语言反馈,明确指出哪些约束被违反了。
  4. 精炼(Refine): 底层 LLM 利用反馈、原始指令和之前的响应来生成改进后的输出。

该循环会重复进行,直到满足约束或达到最大迭代次数 (NmaxN_{max})。

核心贡献

  1. REALINSTRUCT: 一个全新的基准测试,包含真实的 AI 助手用户请求,与合成数据集相比,能更真实地评估多约束指令遵循能力。
  2. DECRIM 流水线: 一个通过分解指令、利用专门的批判模型进行响应批判并精炼输出的自我修正框架。它是第一个在不假设约束独立性的前提下处理约束指令的 System 2 方法。
  3. 对 LLM-as-a-Judge 的系统性分析: 首次对作为约束满足度评判者的开源模型和商业模型进行了系统性评估,确定了带有 CoT 提示的 GPT-4-Turbo 是替代人工标注的可靠且具成本效益的选择。

结果

基准测试表现 (REALINSTRUCT & IFEval)

  • 基准局限性: 即使是顶尖的 GPT-4 模型,在 REALINSTRUCT 上仍有超过 21% 的指令未能满足至少一个约束。开源模型(如 Mistral 7B)的表现通常逊于 GPT-4,但优于 GPT-3.5。
  • DECRIM 的效能:
    • 弱反馈: 使用弱监督的 Mistral 作为批判模型(未使用外部数据),与“确保(Make sure)”基准相比,DECRIM 将 Mistral 在 REALINSTRUCT 上的指令级表现提升了 7.3%,在 IFEval 上提升了 8.0%
    • 强反馈: 当提供强反馈(Oracle Critic 或 GPT-4)时,配备 DECRIM 的开源 LLM 在两个基准测试上都超越了 GPT-4。具体而言,在使用 Oracle Critic 时,Mistral 在 REALINSTRUCT 上达到了 93.7% 的指令准确率(相比之下 GPT-4 为 78.8%),在 IFEval 上达到了 80.4%(相比之下 GPT-4 为 79.3%)。
  • 自我修正的局限: 标准的自我精炼(使用模型自身作为其批判者)带来的收益极小,甚至会导致性能下降,这凸显了使用外部或独立批判模型的必要性。

评估可靠性

  • GPT-4-Turbo: 通过 CoT 提示,它比 GPT-4 降低了 57% 的评估成本,同时将 Macro F1 提升了 7.0%,将 F1 Negative(检测违规情况)提升了 19.0%。
  • 开源评判者: 原生的开源模型作为评判者并不可靠,经常表现出宽松或随机的行为。然而,通过在 GPT-4 的推理轨迹上进行弱监督微调,可以显著提高它们检测未满足约束的能力。

意义与主张

本文指出,遵循现实世界的复杂多约束指令仍然是顶尖模型的重大挑战,即使是 GPT-4 也会频繁失败。作者认为,DECRIM 流水线通过将响应的生成与评估及精炼过程解耦,有效地解决了这一问题。

这项工作证明了:

  1. 现实世界的数据具有独特性: 合成基准测试无法完全捕捉真实用户约束的挑战,因此需要像 REALINSTRUCT 这样的基准测试。
  2. 反馈质量至关重要: 自我修正的成功高度依赖于批判者(Critic)反馈的质量。虽然开源模型在自我修正方面表现挣扎,但如果获得高质量的外部反馈,它们可以达到超越商业模型的性能。
  3. System 2 的可行性: DECRIM 方法验证了 System 2 技术(分解与迭代精炼)在复杂指令遵循中的效用,表明如果配备强大的修正流水线,开源模型可以与商业模型竞争。

作者总结道,虽然 DECRIM 增加了计算开销,但它提供了一条增强指令遵循能力的有效路径,尤其是在具备强大反馈机制的情况下。未来的工作建议进一步完善流水线组件,并将 DECRIM 与其他 System 2 方法(如自我一致性)相结合。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →