Decomposing how prompting steers behavior
本文引入了一种嵌套几何分解框架,揭示了提示词如何通过改变大型语言模型和视觉语言模型的内部表示来引导模型,并证明了仿射变换——特别是跨维度的线性混合——是重新组织表示以匹配指令任务结构并恢复目标行为的关键机制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将大型语言模型(LLM)或视觉语言模型(VLM)视为一座巨大且复杂的工厂。在这座工厂内部,原材料(比如一张猫的照片或一段关于悲伤故事的文字)在通过一系列传送带(模型的层)时不断流动。随着它们的移动,材料被进行处理、重塑和组织。
通常情况下,为了改变工厂的产出,你必须重建机器(重新训练模型)。但**提示词(Prompting)*就像是一位经理走进工厂车间,大声下达新的指令:“停止按颜色分类,现在改为按大小分类!”* 机器本身没有改变,但输出结果突然发生了变化。
这篇论文提出了一个简单而深刻的问题:经理的一声呐喊,究竟是如何在后台重新排列传送带上的物品,从而实现不同的分类方式的?
以下是他们发现的详细拆解,使用了日常类比:
1. 实验:“神奇地图”
研究人员选取了一组物品(例如 1,000 张不同的图像),并向模型展示了两种不同的指令:
- 提示词 A: “这张图片里有人吗?”(回答“是/否”)。
- 提示词 B: “这张图片里有多少人?”(回答一个数字)。
他们观察了模型在不同深度下的“内部状态”(即传送带上物品的排列方式)。他们发现,对于提示词 A,物品的排列形状与提示词 B 是不同的。
随后他们问道:“我们能否绘制一张简单的地图,将‘是/否’的排列方式转化为‘计数’的排列方式?”
2. 五个层级的“地图”(嵌套分解)
为了找到答案,他们尝试了五种不同类型的数学“地图”(变换),从最简单的开始,逐渐变得复杂。你可以把这些想象成重新排列一堆书的不同方法:
- 平移 (Translation/滑动): 仅仅是将整堆书从桌上的一个位置滑动到另一个位置,而不触碰书本身。
- 刚性 + 等比例缩放 (Rigid + Uniform Scaling/刚性移动): 移动这堆书,并可能让整个物体稍微变大或变小,但保持书与书之间的相对形状完全不变。
- 刚性 + 轴向缩放 (Rigid + Axis Scaling/拉伸): 移动这堆书,并在特定方向上进行拉伸(比如水平拉伸一层橡胶膜,但垂直方向不动)。
- 仿射 (Affine/混合): 移动、拉伸并混合这些书。这就像是将“顶层”的书与“侧边”的书进行融合,从而创造出一个新的位置。
- 非线性 (Nonlinear/扭曲): 弯曲桌子本身,以复杂且不可预测的方式扭曲书籍。
3. 重大发现:本质上是一种“混合”
研究人员发现:
- “滑动”(平移)承担了大量的工作。 仅仅是将内部状态移动到一个新位置,就能解释很大一部分的变化。
- 但“混合”(仿射)才是秘密武器。 虽然滑动很有帮助,但模型真正需要通过混合其内部特征(跨维度的线性混合)来充分理解新任务。
- “扭曲”(非线性)并非必要。 令研究人员惊讶的是,他们并不需要复杂的、扭曲的数学逻辑来解释这种变化。一旦加入了“混合”(仿射变换),模型行为几乎可以被完美还原。复杂的非线性部分并没有增加多少价值。
类比: 想象你有一个由乐高积木搭建成的城堡(提示词 A)。你想把它变成一艘宇宙飞船(提示词 B)。
- 你不需要熔化塑料(非线性)。
- 你不需要仅仅把盒子在房间里挪个位置(平移)。
- 你需要把城堡拆开,拉伸一些部件,然后将积木重新排列/混合成一个新的结构。论文发现,这种“重新排列与混合”正是提示词发挥作用的核心机制。
4. “因果”测试:地图真的有效吗?
为了证明这不仅仅是巧合,他们对模型进行了“手术”:
- 他们给模型输入一张带有“是/否”提示词的图像。
- 在特定的某一层,他们停止了处理过程。
- 他们对内部状态应用了他们的“混合地图”。
- 他们让模型完成后续的处理。
结果: 模型突然开始给出“计数”类的答案,尽管它在技术上仍是在回答“是/否”的问题!这证明了这种几何变换(地图)导致了行为的变化。
5. 不同的模型,不同的策略
就像不同的工厂有不同的经理一样,不同的 AI 模型也使用不同的策略:
- OPT-2.7B 似乎在早期阶段高度依赖“拉伸”和“混合”(复杂的变换)。
- Llama3 和 Qwen3 则似乎在早期更多地依赖简单的“滑动”(平移),或许是使用了一种特定的“指令代码”,只需将数据移动到正确的位置即可。
总结
论文得出结论:当你给 AI 一个新指令时,它并不需要从根本上重写大脑,也不需要进行复杂的、扭曲的数学运算。相反,它主要通过将其内部理解滑动到一个新位置,并以一种直线方式(仿射变换)混合其特征,从而适应新任务。
这为我们提供了一个清晰的、几何化的视角,去观察 AI 模型是如何“听从”指令的:它们本质上是在对其内部数据进行一种精密的、多步骤的重新排列,而我们现在可以精确测量出这种重新排列中有多少是简单的滑动,又有多少是复杂的混合。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。