← 最新论文
💻 computer science

Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction

本文引入了约束饱和评估(Constraint Saturation Evaluation, CSE)基准,旨在证明虽然大语言模型能够熟练地遵循单个约束,但由于失败的独立累积,其同时满足多个约束的能力在超过 5-6 个约束后会发生乘法式的崩溃,尤其是在处理结构化推理而非词汇细节方面。

原作者: Mariya I. Vasileva

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Mariya I. Vasileva

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试烤一个蛋糕,但你不仅仅是遵循一个食谱,而是得到了一份规则清单。“必须使用正好 200 克面粉”、“不能使用糖”、“蛋糕必须是蓝色的”以及“它必须是星形形状”。如果你只有一条规则,那很简单。如果你有两条或三条,你可能应付得来。但如果有人一次性递给你五十条规则会发生什么?这就是**大语言模型(LLMs)**的世界,这些超级智能的计算机程序能够写故事、回答问题并解决问题。这些模型就像是读遍了几乎所有图书馆书籍的数字厨师。科学家们早就知道,这些厨师非常擅长遵循单条指令。但没人确定当你要求他们同时处理十几条指令时会发生什么。是他们的表现会稍微下降,就像一个疲惫的跑者减速一样?还是会突然崩溃,就像一座纸牌屋被风一吹就倒塌一样?这个问题至关重要,因为当我们开始使用这些 AI 厨师来构建现实世界的工具——比如安全系统、法律文件或复杂的代码时——我们需要准确知道在它们开始出错之前,究竟能处理多少条规则。

迎来了一项将这些 AI 模型视为巨大厨房中科学实验的新研究。由 Mariya Vasileva 领导的研究人员构建了一个特殊的测试场,称为约束饱和评估(Constraint Saturation Evaluation, CSE)。把它想象成对 AI 大脑的一次“压力测试”。他们不仅要求模型写一个故事,还给了它们特定数量的规则,要求同时遵守这些规则,范围从仅一条规则到十二条不等。这些规则是严格且不可更改的,比如“你的回答必须恰好有 3 段”、“不允许出现字母 'e'”或者“每个句子必须以字母 'A' 开头”。研究人员随后观察 AI 在同时做对每一条规则方面的表现。

结果令人惊讶,甚至有些戏剧性。研究发现,随着你增加规则的数量,AI 模型并不仅仅是变得有点疲倦;它们会遇到一个临界点。想象一下你在堆积木。在前几块积木时,塔是稳定的。但一旦你达到某个高度——对于即使是最聪明的模型来说,大约也是 5 或 6 条规则左右——塔不仅会摇晃,还会突然坍塌。研究人员发现,虽然当存在八条规则时,AI 可能仍能正确完成其中 40% 的单个规则,但它同时做对所有八条规则的概率会降至不到 6%。这就像一位音乐家可以完美地演奏一个音符,甚至两个,但一旦你要求他同时演奏包含十二种不同乐器的复杂交响乐时,他就会完全忘记旋律。

研究还弄清楚了为什么会发生这种情况。事实证明,规则之间并不是像游戏中的敌人那样互相争斗。相反,它们起到了连锁反应的作用。如果 AI 在答案的某个小部分出错——比如,它忘记了正确计算句子数量——那么所有依赖于句子的规则都会同时失效。并不是规则在互相干扰,而是 AI 的“工作记忆”过载了。研究人员发现,那些需要 AI 随时间追踪事物的规则(如计数单词或维持某种模式)比简单的规则(如“不要使用某个特定的词”)崩溃得快得多。

或许最有意思的部分是研究人员尝试去修复的部分。他们问道:“我们能否通过让 AI 提前计划,或者让它再试一次,来帮助它?或者通过让它纠正自己的错误?”他们尝试给 AI 一个用于规划答案的“草稿本”,或者让它纠正自己的错误。结果呢?这确实有一点点帮助,也许能让 AI 多处理一两条额外的规则,但它并没有阻止这种崩溃。该论文指出,真正的解决方案是让 AI 本身在遵循每一条单个规则方面变得更好。无论多少规划或重试,都无法修复由于同时处理过多事物而导致的性能下降这一数学上的必然结果。

最后,这篇论文划定了一条清晰的界限。对于测试的最聪明 AI 模型而言,可靠的多规则指令遵循极限大约是 5 到 6 个约束。超过这个限制,系统就会变得不可靠,这并不是因为 AI “笨”,而是因为要同时在大脑中保持如此之多的事物,这种纯粹的数量本身就造成了数学上的坍塌。这提醒我们,即使是最先进的数字厨师也有同时遵循食谱的极限,如果我们希望它们做得更多,我们需要让它们变得更强壮,而不仅仅是给它们更多的指令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →