← 最新论文
🤖 machine learning

Transmuting prompts into weights

基于提示词与隐式权重更新之间的理论联系,本文提出了一种原则性算法,旨在将瞬态提示信息压缩为可重用的、与标记无关的思想向量与矩阵,从而为将文本输入转化为用于模型编辑与知识注入的有效权重更新提供理论基础与直接方法。

原作者: Hanna Mazzawi, Benoit Dherin, Michael Munn, Adrian Goldwaser, Michael Wunder, Javier Gonzalvo

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Hanna Mazzawi, Benoit Dherin, Michael Munn, Adrian Goldwaser, Michael Wunder, Javier Gonzalvo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明但有点健忘的机器人助手(一个大语言模型)。通常,为了让这个机器人完成一项特定的工作——比如“翻译这个法语单词”或“让这个句子变得优雅”——你必须在每次提问时都重复一遍指令。这就像是在每次向机器人下达任务前,都要对着它的耳朵大声朗读一遍规则手册。

这篇论文介绍了一个聪明的技巧,旨在停止这种“大声叫喊”。研究人员不再通过重复指令来工作,而是想出了如何根据这些指令永久性地重写机器人的内部规则手册(即它的“权重”)。他们将这个过程称为“将提示词转化为权重”(Transmuting Prompts into Weights)。

以下是他们实现这一目标的简单分解,使用了日常生活的类比:

1. 问题所在:“幽灵”指令

通常情况下,当你给机器人一个指令(例如“要有礼貌”)时,它只是在当前的对话中暂时改变其行为。一旦对话结束,机器人就会忘记。

  • 旧方法: 研究人员曾尝试通过在每次对话中向机器人的大脑添加一个“魔术数字”(向量)来修复这个问题。这虽然有效,但更像是一种试错游戏。
  • 新方法: 这篇论文提出:“我们不要再靠猜了。让我们从数学上证明一条指令究竟是如何改变机器人的大脑的,然后将这种改变‘烘焙’进机器人的永久记忆中。”

2. 核心思想:“思维补丁”(The Thought Patch)

研究人员发现,当你给机器人一个提示词(指令)时,它会在大脑中产生一种暂时的变化“阴影”。

  • 类比: 想象机器人是一位厨师。当你说“加盐”时,厨师撒盐的手部动作会发生特定的变化。
    • 依赖标记的补丁(Token-Dependent Patches): 起初,研究人员发现,对于厨师说的每一个单词,其“撒盐”的动作都会有细微的不同。这就像厨师必须为句子中的每一个单词都学习一种新的、微小的手部动作。这对于永久保存来说太复杂了。
    • “思维补丁”: 研究人员意识到,我们可以将所有这些微小且不同的手部动作取平均值,合并成一个单一的、完美的、适用于整个句子的手部动作。他们将这种简单的偏移称为“思维向量”(Thought Vector),将更复杂的改变称为“思维矩阵”(Thought Matrix)。

3. 过程:“缝合”指令

论文描述了一种算法(一套分步食谱),将临时指令转化为永久性的改变:

  1. 观察厨师: 他们让机器人阅读指令和任务(例如,“翻译:Hello” \rightarrow “Bonjour”)。他们记录下机器人大脑是如何被激活的。
  2. 观察没有指令的厨师: 他们让机器人在没有指令的情况下尝试任务(例如,仅输入“Hello”)。他们观察大脑是如何以不同方式激活的。
  3. 寻找差异: 他们计算两种大脑状态之间的差距。
  4. 数学魔法: 利用一种称为“最小二乘法”(可以理解为在点云中寻找最符合的直线)的方法,他们计算出需要填补该差距的精确数学公式。
  5. 永久修复: 他们将该公式直接添加到机器人的永久权重中

4. 结果:机器人记住了

一旦完成了这个过程,机器人就不再需要重复说出“翻译”这个指令。这条指令现在已经硬编码进了它的脑中。

  • 类比: 这就像训练一只狗坐下。
    • 之前: 你每次都要说“坐!”,狗之所以听话是因为你在场。
    • 之后: 你已经通过训练,让狗的肌肉形成了记忆。当你在指点时,它会自动坐下。命令现在是狗身体的一部分,而不仅仅是你发出的声音。

5. 他们测试了什么

研究人员在 Google 模型(Gemma)的一个小型版本上进行了测试,并发现:

  • 数学与逻辑: 他们教会了机器人进行数字乘法或对有毒句子进行“脱毒”(净化)。一旦应用了“思维补丁”,即使没有指令,机器人也能完美地执行这些任务。
  • 翻译: 他们教会了它将法语翻译成英语。应用补丁后,即使从未提到“翻译成英文”的指令,它也会自动进行法英翻译。
  • 新知识: 他们教会了它一些虚构事实的小型词典(例如,“Zog 的首都是 X”)。机器人学会了这些事实,并且可以在词典不在场的情况下随时调用这些知识。

局限性(注意事项)

论文指出,这种“硬编码”在提问方式与训练时高度一致的情况下效果最好。如果你使用与训练时非常不同的措辞来提问,机器人可能会感到困惑。这就像是一个被训练成回答“首都是哪里?”的机器人,如果被问到“告诉我那个首都城市”,它可能会卡住,因为“思维补丁”是针对第一个问题的特定措辞进行调优的。

总结

简而言之,这篇论文提供了一个数学证明:指令本质上只是临时的权重更新。通过对这些临时更新取平均值,他们创造了一种方法,可以将指令和知识永久安装到语言模型的脑中,使其无需每次重复指令即可执行复杂任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →