← 最新论文
💬 NLP

Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits

本文介绍了一种黑盒可解释性框架,该框架通过系统地对提示词应用原子概念编辑,来学习可验证的自然语言“宪法”,从而实现对模型在文本生成图像和数学推理等任务中行为的深度洞察与有效控制。

原作者: Neha Kalibhat, Zi Wang, Prasoon Bajpai, Drew Proud, Wenjun Zeng, Been Kim, Mani Malek

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Neha Kalibhat, Zi Wang, Prasoon Bajpai, Drew Proud, Wenjun Zeng, Been Kim, Mani Malek

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常强大但又带点神秘感的机器人艺术家,或者是一个超级聪明的计算器。你给它一个提示词(一组指令),它就会给你一个答案或一张图像。有时,你会想知道:“为什么它弄错了?”或者“我该如何诱导它做对?”

这篇论文介绍了一种与这些“黑盒”模型进行交流的新方法,而无需看到它们的内部代码。他们将这种方法称为宪法引导的原子概念编辑(Constitution-guided Atomic Concept Edits,简称 ACEs)

以下是使用简单类比进行的详细拆解:

1. 问题所在:“黑盒”之谜

想象一下,你正试图修理一辆汽车,但发动机被隐藏在一个实心的钢块内部。你看不见里面的齿轮。你只能转动钥匙(提示词),然后观察车是否发动了(输出)。

  • 挑战: 如果车没发动,你怎么知道是燃料、火花塞还是电池的问题?在人工智能中,如果模型给出了错误的答案,很难知道你的提示词中具体是哪个词导致了失败。

2. 工具:“原子概念编辑”(ACEs)

研究人员将提示词视为一个 乐高结构

  • 原子概念: 一个单一且独特的乐高积木(例如,“猫”这个词、“红色”这个颜色,或“奔跑”这个动作)。
  • 编辑(ACE): 你不是在重建整辆车,而只是更换掉 其中一块 积木。
    • 移除: 把“猫”这块积木拿走。
    • 添加: 放进一个“狗”的积木。
    • 替换: 把“红色”换成“蓝色”。

他们系统地尝试更换这些单块积木,看看会发生什么。车现在发动了吗?图像发生了变化吗?这有助于他们精确地绘制出哪些“积木”控制着特定的行为。

3. 解决方案:“宪法”

在测试了数千次这些单块积木的更换后,研究人员并不仅仅是保留数据;他们编写了一本 规则手册(或称为“宪法”)。

把这本“宪法”想象成 厨师改变菜肴风味的秘密食谱

  • 没有宪法时: 你在随机猜测。“也许加点盐?也许去掉胡椒?”这需要很长时间才能摸索出窍门。
  • 有了宪法: 你有一份书面指南,上面写着:“如果要让汤变辣,请务必加入辣椒。如果要让它味道平淡,请移除食盐。绝不要加糖。”

这份“宪法”是一份用纯英文编写的 好策略坏策略 的列表。它总结了研究人员发现的模式。

  • 示例: “如果你想让图像看起来出错,可以添加一个‘冲突的环境’(比如把鱼放在沙漠里)。”
  • 示例: “如果你想让数学题的答案出错,可以添加一个‘干扰变量’(一个看起来很重要但其实没用的数字)。”

4. 实际运作方式

研究人员在三种不同的“游戏”上测试了这种方法:

  • 游戏 1:字数挑战

    • 目标: 让 AI 写出一个非常短的答案(少于 50 个单词)。
    • 宪法的洞察: AI 会忽略像“简洁”这样模糊的词。它只听从 硬性数字(例如,“正好写 10 个单词”)或 结构限制(例如,“仅写一句话”)。
    • 结果: 使用宪法后,AI 遵循字数规则的效果比不使用时要好得多。
  • 游戏 2:数学陷阱

    • 目标: 让 AI 在一道简单的数学题上失败。
    • 宪法的洞察: 一些 AI 模型(如 GPT-5)如果加入“干扰变量”(一个看起来像是属于题目一部分的假数字)就会感到困惑。而其他模型(如 Gemini)足够聪明,能够忽略假数字并得出正确答案。
    • 结果: 宪法揭示了不同的模型拥有不同的“盲点”。
  • 游戏 3:图像不匹配

    • 目标: 让 AI 画出一张与描述不符的图像。
    • 宪法的洞察:
      • 一个模型(GPT-Image)如果移除物体之间的 关系(例如,说“一个男人和他的儿子”,但移除了“儿子”),就会出错。它依赖严格的语法。
      • 另一个模型(Imagen)如果添加 冲突的场景(例如,一个带有“工业废料”的“公园”),就会出错。它更在意整体的“氛围”或环境。

5. 重大胜利

论文声称,通过使用这种 宪法(规则手册)来引导 原子编辑(单块积木更换),他们控制 AI 行为的能力比随机猜测要高出 1.86 倍

总结一下:
与其盲目猜测如何改变 AI 的想法,这种方法让我们能够将 AI 的指令拆解为逐个单词,学习其运行的规则,并编写一份简单的“宪法”,从而准确地告诉您如何引导它实现您的目标。它将一个神秘的黑盒变成了一台拥有清晰、易懂说明书的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →