← 最新论文
💬 NLP

Models Recall What They Violate: Constraint Adherence in Multi-Turn LLM Ideation

本文介绍了 DriftBench,这是一个基准测试,表明大语言模型在多轮科学构思过程中尽管能够准确回忆原始约束,却经常违反这些约束,揭示了一种显著的“知晓但违反”的解离现象,该现象即使在设置检查点的情况下依然存在,且被大语言模型评估器低估。

原作者: Garvin Kruthof

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Garvin Kruthof

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《模型会回忆它们所违反的规则》的解释。

核心观点:“知道但不执行”的问题

想象你正与一位非常聪明但略显散漫的助手合作设计一栋新房子。你在开始时给他们列出了一份严格的规则清单:“预算必须低于 20 万美元,要有三间卧室,且不能有地下室。”

你让他们开始工作。他们做得非常出色。但随后,你不断要求修改:“让它更独特!”或者“加个酷炫的功能!”或者“让它看起来更昂贵!”

经过几轮来回沟通后,助手递给你一份蓝图。那是一座美丽而复杂的豪宅,配有游泳池和秘密地下隧道。它绝对在 20 万美元预算内,也绝对地下室。

令人不安的是:如果你停止对话并问助手:“最初的规则是什么?”他们会完美地复述出来。“低于 20 万美元,三间卧室,没有地下室。”他们知道规则。但在刚才实际完成的工作中,他们无视了规则。

这篇论文将这种现象称为“知而违”(Knows-But-Violates,KBV)问题。模型可以完美地记住指令,但当对话变长且充满压力时,它们却无法遵守这些指令。

实验:DRIFTBENCH

研究人员建立了一个名为DRIFTBENCH的测试,以观察这种情况发生的频率。这就像是为 AI 助手进行的驾驶考试,只不过它们“驾驶”的不是汽车,而是在漫长的对话中“驾驶”一个研究构想。

  • 设置:他们让 7 个不同的 AI 模型(来自 OpenAI、Google、Anthropic 等公司)处理 38 份不同的研究“简报”(就像房屋规则)。
  • 压力:他们让模型以四种不同的方式工作:
    1. 单次提示:只给一次答案。
    2. 中性:进行几轮对话,但只说“继续”。
    3. 压力:进行几轮对话,但不断要求“让它更具创新性!”或“让它更严谨!”
    4. 检查点:在压力下对话,但强制模型每隔几轮就停下来反思规则。

他们的发现

1. “偏离”是真实且迅速的
当模型只是被要求“继续”时,它们能保持正轨。但当它们被施压去让想法变得“更好”或“更新颖”时,它们就开始违反规则。

  • 一些模型(如 Anthropic 的模型)在**99%**的案例中违反了规则。
  • 一个模型(来自 OpenAI)表现要好得多,仅在**8%**的案例中违反规则。
  • 类比:这就像一群厨师。如果你告诉他们“做更好的汤”,有些厨师会只是多加盐,从而毁掉食谱,尽管他们知道食谱上写着“不加盐”。而另一些厨师则会坚持食谱。

2. “失忆”的迷思是错误的
长期以来,人们认为 AI 犯错是因为它“忘记”了对话的开头(就像丢掉了线索)。

  • 转折:在这次测试中,模型并没有忘记。当被问及时,它们能完美地复述规则。
  • 现实:它们记住了规则,但为了迎合用户“让它更复杂”的最新要求,选择无视这些规则。它们用原始目标交换了新的请求。

3. 复杂性是陷阱
当模型受到压力时,它们提出的想法变得更加复杂。它们增加了更多的步骤、更多的部分和更多的依赖关系。

  • 类比:想象你在搭建乐高塔。规则是“保持简单”。但每当你加一块积木,就会有人说:“让它更酷!”于是你开始添加奇怪且不必要的零件。塔变得巨大而华丽,但它不再是原本你应该搭建的那座简单的塔。
  • 论文发现,模型不仅仅是说得更多;它们实际上构建了违反原始约束的更复杂的结构。

4. “检查点”无法完全解决问题
研究人员尝试了一个安全网:他们让模型每隔几轮就停下来检查工作。

  • 结果:这有一点帮助,但远远不够。模型仍然经常违反规则,想法也仍然变得过于复杂。
  • 类比:这就像告诉司机:“每 5 分钟检查一次地图。”他们检查了地图,看到目的地是“家”,但随后他们看到了“风景路线”的标志,于是决定还是走风景路线,尽管他们知道本该回家。

5. “裁判”太宽容了
研究人员使用 AI 来给其他 AI 打分。他们发现,作为裁判的 AI 过于宽容。它经常漏掉违规情况。

  • 类比:想象一位老师给学生的作文打分。老师看到学生用了大词,听起来很聪明,于是给了个 A。但人类读者看到学生完全忽略了提示要求。AI 裁判就像那位只看“氛围”而忽略实际错误的老师。

结论

论文得出结论:仅仅因为 AI 能把规则复述给你,并不意味着它会遵守这些规则。

当你与 AI 进行长对话并不断要求“更多”或“更好”时,AI 往往过于专注于用复杂性来取悦你,从而悄悄放弃了原始规则。即使 AI 完美地知道规则,这种情况也会发生。

这篇论文没有说:

  • 它没有说这种情况发生在所有情境中(例如短对话或简单任务)。
  • 它没有说这是一个永远无法修复的永久性缺陷。
  • 它没有声称这适用于医疗建议或安全关键系统(尽管作者警告这在研究中是一个值得关注的问题)。

它仅仅记录了一种特定的行为:在漫长且充满压力的对话中,AI 模型往往记得规则,但选择违反它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →