From Noise to Diversity: Random Embedding Injection in LLM Reasoning
本文证明,向大型语言模型输入中注入无需训练的随机嵌入向量,能够通过增加早期阶段的令牌多样性并扩大 Pass@N,有效提升推理性能,这一机制在无需学习软提示的情况下同时改善了推理准确性和训练结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位才华横溢但极其僵化的图书管理员(即大型语言模型),他擅长解决数学问题,但有时会陷入死胡同。他总是沿着同一条路径寻找答案,如果那条路通向死胡同,他就会放弃。
长期以来,研究人员试图通过用特殊、定制编写的笔记(称为软提示)来“训练”这位图书管理员,以引导他找到更好的解决方案。他们曾认为,魔力在于这些笔记的内容。
这篇论文提出了一个不同的问题:如果魔力不在于笔记本身,而在于在图书管理员开始工作前递给他一张新的、随机的纸片呢?
以下是他们关于**随机软提示(RSP)**这一发现的解析,使用日常类比进行说明:
1. “随机噪声”实验
研究人员没有训练一张特殊的笔记,而是随手抓了一把完全随机、毫无意义的涂鸦(随机数字),并将它们附加在数学问题的前面或后面。
- 令人惊讶的是:尽管这些涂鸦不包含任何有用的信息,图书管理员解决问题的表现却突然变好了。在某些情况下,他的表现与收到经过精心训练的完美笔记时一样出色。
- 启示:这种改进并非来自学习任何新东西,而是源于注入新事物的行为本身。
2. 它是如何工作的:“分叉路径”类比
将图书管理员的思维过程想象成走在一条有许多门的走廊里。
- 没有随机纸片时:图书管理员径直穿过主走廊,打开他看到的第一扇门,并沿着那条路继续走。如果那条路是死胡同,他就会失败。
- 有了随机纸片后:那些随机涂鸦就像走廊起点处突然刮起的一阵令人困惑的狂风。
- 早期阶段(分叉):由于这阵“风”,图书管理员会停下来,查看他通常不会考虑的那些不同的门。他可能会打开一扇他从未考虑过的门。这在他的思维中创造了一个“分叉”,通向一条完全不同的解决路径。
- 后期阶段(稳定):随着图书管理员在这条新路径上走得更远,这阵“风”(随机纸片)会逐渐消散,因为走廊变长了,图书管理员对起点的记忆也被稀释了。他在这条新路径上建立起自信的步调。
3. “掷骰子”效应(Pass@N)
论文发现,如果你让图书管理员尝试同一个问题 10 次,但每次给他一张不同的随机涂鸦,你就会得到 10 条不同的路径。
- 结果:即使这 10 条路径中有 9 条是错的,但你强迫图书管理员尝试了 10 个不同的起点,这意味着你更有可能在其中找到那条正确的路径。
- 关键点:如果你在所有 10 次尝试中都使用相同的随机涂鸦,他们都会走上同一条错误的路径。只有当“风”每次都在变化时,魔力才会生效。
4. 为什么这很重要
- 它是免费的:你不需要花费数周时间训练模型或教它新事实。你只需添加随机噪声。
- 它是结构性的:论文证明,这些高级 AI 技巧的“魔力”往往来自于添加额外标记(tokens)的结构,而非这些标记的具体内容。这就像摇晃一盒拼图碎片可能会帮你更快地找到正确的角块,尽管摇晃本身并不能解开拼图。
- 它有助于训练:他们还表明,在模型的训练(教学)阶段使用这种随机的“风”,能帮助模型学得更快、更好,这就像教练可能会变换训练项目,以防止运动员感到厌倦或陷入固定套路。
总结
该论文声称,随机性是一种强大的工具。通过在 AI 的输入中注入随机的、无意义的向量,你迫使它在早期探索通往答案的不同“道路”。一旦它选定了一条路,它就会一直走下去,但由于你从一条不同的路开始,你最终到达目的地的概率,往往比只坚持通常路线时要高。事实证明,有时搅动局面与教授新事物同样有效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。