← 最新论文
💻 computer science

Instruction fragility under hidden operational requirements

本文证明了自然语言指令在隐藏的操作需求面前是脆弱的,揭示了虽然通用提示词无法满足被遗漏的约束条件,但当这些约束条件被明确引导并执行时,性能会显著提升。

原作者: Chanho Park, Jinbae Gong, Minsu Kim, Gyeongho Gong, Woochan Lee, Yeachan Kwak, Seongim Choi

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Chanho Park, Jinbae Gong, Minsu Kim, Gyeongho Gong, Woochan Lee, Yeachan Kwak, Seongim Choi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对该论文进行的解释。

核心问题:弄错事情的“精灵”

想象你拥有一个能实现愿望的神奇精灵(AI)。你说:“让我变得富有。”

精灵可能会有千种不同的理解方式:

  • 它可能给你一份正当的工作。
  • 它可能印制假钞。
  • 它可能黑进一家银行。
  • 它可能改变“财富”的定义,让你在“幸福感”上很富有,但在现金上很贫穷。

论文指出,当你给 AI 一个简短的指令时,你实际上是给了一份缺失项目的愿望清单。你可能认为你想要的是“合法的财富”,但你并没有说“不要非法活动”或“不要银行错误”。因为你没说,所以 AI 可以自由选择任何符合你所用词汇的“财富”版本。

作者称之为**“指令脆弱性”(Instruction Fragility)**。指令之所以脆弱,是因为当 AI 猜错了你隐藏的规则时,指令就会失效。

实验:“秘密规则”游戏

为了测试这一点,研究人员创建了一个包含 100 个不同任务的游戏(例如写邮件、总结报告或规划旅行)。

  • 可见提示词(The Visible Prompt): 这是用户看到并输入的(例如“总结这篇文章”)。
  • 隐藏要求(The Hidden Requirements): 这些是只有研究人员(评估者)知道的秘密规则。例如:“必须在 50 字以内”、“必须包含风险提示”、“必须是 JSON 格式”或“不得使用‘肯定’这个词”。

AI 必须既遵循可见提示词,又要完美猜中隐藏规则。如果它漏掉哪怕一个隐藏规则,该任务就算彻底失败。

结果:猜测 vs. 询问

研究人员测试了 AI 在不同条件下的表现,以观察它处理这些缺失规则的能力。

1. “单次尝试”猜测(成功率 2.7%)

  • 类比: 你告诉厨师“给我做个三明治”,然后就走开了。你没说“不要洋葱”、“用酸面包”或“切成两半”。
  • 结果: AI 仅在 2.7% 的情况下做对了。它几乎总是会漏掉隐藏规则。

2. “通用模板”(成功率 7.3%)

  • 类比: 你给了厨师一份标准的“三明治订单表”,上面有“面包”和“肉类”的空格,但你仍然没有填写具体的“不要洋葱”这一项。
  • 结果: 有所改善,但仍然大多是错的。通用的表格无法解决缺失具体细节的问题。

3. “虚假对话”(成功率 1.7%)

  • 类比: 你问厨师:“你有特殊的规则吗?”厨师回答:“没有,做个三明治就行。”
  • 结果: 这完全没有帮助。在没有获得正确信息的情况下进行交谈是毫无意义的。

4. “诚实的澄清”(成功率 8.0%)

  • 类比: 你强迫厨师根据菜单提出具体问题(例如“您需要 JSON 格式吗?”),然后你回答“是的”。
  • 结果: 依然很低。AI 很难搞清楚应该问哪些问题。它问了错误的问题,或者漏掉了关键问题。

5. “先知”(作弊条)(成功率 64.7%)

  • 类比: 你在厨师开始烹饪之前,递给他一张列出了所有隐藏规则的作弊条。
  • 结果: 成功率跃升至 64.7%。这证明了如果 AI 知道规则,它就能更好地遵循规则。

核心启示:
问题不在于 AI 很笨;问题在于它无法读懂你的心。当你隐藏规则时,AI 就会失败。当你明确告诉 AI 规则时,它就会成功。然而,即使有了作弊条,它仍然有大约 35% 的时间失败,这意味着即使在它知道规则的情况下,它有时也会忘记完美地执行。

为什么这很重要(“集合”理论)

论文使用了一个高级数学概念来简单解释这一点:

  • 把你的指令看作是一个
  • 这个网捕捉到了许多可能的结局(执行结果)。
  • 你只想要 AI 捕捉到“好的”结局(即你真正想要的那些)。
  • 如果你的网太宽(因为你没有指定规则),它也会捕捉到“坏的”结局(比如非法的转账或错误的格式)。
  • 安全性(Safety) 意味着缩小这个网,直到它捕捉到好的东西。除非你明确告诉 AI 要排除什么,否则你无法做到这一点。

失败模式总结

论文分析了 AI 失败的原因:

  1. 信息缺失: AI 不知道规则(这是最大的问题)。
  2. 提问错误: AI 问了错误的问题来寻找规则。
  3. 执行错误: 即使 AI 知道了规则,它有时也会忘记正确地写下来。

底线

如果你想让 AI 安全且正确地完成一项工作,你不能仅仅给它一个模糊的命令并寄希望于它能“领悟”。你必须明确说明隐藏的约束条件(如字数限制、格式和安全界限)。通用的提示词和通用的对话是不够的;你需要专门引导并确认缺失的规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →