← 最新论文
🤖 machine learning

A Coin Flip Per Token: Bernoulli Sparse Steering of Large Language Models

本文介绍了随机标记与块引导(Stochastic Token and Block Steering)方法,该方法证明了仅对部分标记进行稀疏、概率性的干预即可有效控制大语言模型的行为并保持流畅度,从而揭示了由稀疏自编码器(SAE)介导的控制受限于累积信号剂量而非密集的逐标记应用。

原作者: Nima Eshraghi, Lovedeep Gondara, Yuqing Huang, Sagarika Suresh, Leizer Teran, Jithin Pradeep, Xiaotong Xu, Fanny Chevalier

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Nima Eshraghi, Lovedeep Gondara, Yuqing Huang, Sagarika Suresh, Leizer Teran, Jithin Pradeep, Xiaotong Xu, Fanny Chevalier

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大语言模型(LLM)视为一位才华横溢但略显混乱的讲故事者。你希望他们讲述一个要么没那么刻薄(减少毒性),要么更忧伤(引导情绪)的故事。

传统上,为了修正这位讲故事者,研究人员使用了一种叫做**“密集转向”(Dense Steering)的方法。这就像是一位严厉的编辑站在讲故事者的肩膀后方,在他们说的每一个词**之后都进行耳语纠正。虽然这种方法可以改变故事,但它非常消耗精力。这种不断的耳语破坏了讲故事者自然的流利度,使他们听起来机械、重复或混乱。

这篇论文提出了一个简单的问题:我们真的需要在每一个词之后都耳语吗?

作者说:“不。”他们提出了一种新方法,叫做**“随机标记转向”(Stochastic Token Steering),这本质上是为每一个词进行一次抛硬币**。

核心理念:硬币翻转编辑器

与其做一个持续不断的编辑,不如想象一个新的规则:

  • 对于模型即将写的每一个词,我们抛一枚硬币。
  • 正面(50% 的概率): 我们进行纠正耳语。
  • 反面(50% 的概率): 我们让模型自然地写作,不受干扰。

论文介绍了两种实现方式:

  1. 随机标记转向 (STS):每一个单独的词抛一次硬币。有时模型会得到帮助,有时则不会。
  2. 随机块转向 (SBS): 仅在故事的最开始抛一次硬币。如果是正面,我们会在第一段文字中进行纠正耳语;如果是反面,我们则完全不耳语。

他们的发现

研究人员在两个不同的 AI 模型(LLaMA 和 Gemma)以及两个不同的目标(让 AI 减少毒性以及让它听起来更忧伤)上测试了这种方法。

1. 少即是多(“半价”效应)
他们发现,仅仅通过在50% 的词上进行纠正耳语,就能获得持续编辑器 95% 的收益

  • 类比: 想象你在试图驾驶一辆汽车。你并不需要 100% 的时间都紧握方向盘。如果你在半数的时间里轻轻拨动方向盘,车依然会按照你的意愿行驶,但过程会更加平稳。
  • 结果: AI 保持了流利度和自然感,但仍然遵循了新规则(例如变得不那么有毒)。

2. “音量”权衡
这里有一个巧妙之处:当他们停止频繁耳语时(降低硬币翻转的概率),他们在说话时必须把声音调大

  • 类比: 如果你每 10 英里才对司机说一次话,你就必须给出非常清晰、强力的指令。如果你每英里都说话,那么微小的推动就足够了。
  • 结果: 通过在干预频率降低时提高纠正的“音量”,他们在注入更少的总“噪声”的情况下,实现了同样的效果。

3. 随机比“早期”更好
他们还测试了另一种想法:也许我们应该只纠正故事的开头(“块”方法)。他们发现,在整个故事过程中随机纠正词汇(“标记”方法)比只修复开头效果更好。

  • 类比: 这就像是在给汤调味。只在烹饪最开始撒盐(块方法)并不能像在整个烹饪过程中随机撒盐(标记方法)那样均匀地为整锅汤增添风味。

为什么这很重要

论文得出结论:控制 AI 行为不在于你干预了多少次,而在于信号的总“剂量”

  • 旧方法: 持续的、低音量的噪声,破坏了流利度。
  • 新方法: 零星的、高音量的推动,保持了流利度的自然。

最棒的一点是,这种方法极其简单。它不需要训练一个新的 AI 或复杂的奖励系统。它只需要一个随机数生成器(抛硬币)和一个单一的设置来决定干预的频率。

简而言之: 你不需要微观管理 AI 来改变其行为。一点点随机且时机恰当的引导,就足以在不破坏其自然语调的情况下,将其引导至正确的方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →