← 最新论文
🤖 machine learning

Neither Parallel Nor Sequential: How DiffusionGemma Actually Commits Tokens

通过对 DiffusionGemma 26B 进行插桩,本研究揭示了其标记提交过程既非纯粹的并行,也非严格的顺序,而是一种依赖于机制的、部分从左至右偏置的过程,它形成了大规模的同步批次,证明了感知的解码顺序通常是测量粒度而非固定架构属性的产物。

原作者: Ali Asaria, Tony Salomone, Deep Gandhi

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali Asaria, Tony Salomone, Deep Gandhi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个巨大且混乱的艺术工作室,一个机器人正试图在一块巨大的画布上绘画(或写故事)。

在旧的工作方式中(称为“自回归”模型),机器人严格地从左向右绘画,就像读一本书一样。它完成一个词,然后再进行下一个,一个接一个地进行。

在新的“扩散”(Diffusion)方式中,机器人从一个充满了空白遮罩方块的画布开始。它应该同时观察整幅画,并同时填充许多方块。研究人员提出的核心问题是:这个新机器人是真的在同时绘制整幅画布,还是实际上在偷偷地回到左边,依然是一个词一个词地进行绘画?

这篇论文的作者决定在机器人的大脑里放一个微型摄像机,观察它究竟是如何绘画的。他们研究了一个名为 DiffusionGemma 的特定模型。

以下是他们的发现,用简单的方式进行了解释:

1. 它既不是“同时完成”,也不是“逐一进行”

机器人既不会通过一次神奇的闪现就画完整幅画,也不会像人类读书那样严格地从左向右。

相反,它以**大型、混乱的批次(batches)**进行绘画。

  • 类比: 想象一位老师正在批改一叠 20 篇论文。一个严格从左向右的机器人会先改第一篇,然后是第二篇,接着是第三篇。
  • DiffusionGemma 的做法: 它一次抓起一捆论文(比如 15 篇),同时批改它们,然后放下;再抓起另一捆,继续批改。
  • 结果: 在这一捆论文内部,机器人并不在意先改哪一篇。这是一个“批次”的工作。因为它是进行这些大批量的作业,所以顺序看起来有点乱,但随着它处理这些批次,仍然存在一种轻微的从左向右移动的倾向。

2. “16 块”的神话

早期人们认为机器人是以完美的 16 个单词为一个块进行工作的(就像一列拥有 16 节车厢的火车)。

  • 发现: 研究人员通过观察机器人以 4、8、16、32 和 64 个单词为一组的工作情况来测试这一点。
  • 真相: 机器人并没有在 16 个单词处突然跳入某种完美的模式。仅仅是随着组别的增大,其模式变得更加平滑且更趋向于“从左向右”。16 这个数字并不是机器人的特殊规则;它只是研究人员在观察数据时选取的数字。机器人的运作比这更加流畅。

3. “JSON”的例外

机器人的行为会根据它被要求做什么而改变。

  • 对于故事、代码和数学: 它遵循那种“混乱批次”式的从左向右模式。
  • 对于结构化数据(如 JSON): 它的表现几乎像是随机散布。如果你要求它填写带有特定键(keys)和值(values)的表单,它完全不在乎顺序。它会在任何它觉得合适的地方填入内容,没有任何从左向右的偏好。

4. “置信度”检查

机器人有一个“置信度计”(它衡量在锁定一个词之前对其确定程度的度量)。

  • 在数学题上: 如果机器人的置信度很高(低熵),它通常是正确的。如果它不确定,它出错的可能性就更高。置信度计在这里很有效。
  • 在事实性问题上: 置信度计毫无用处。机器人可以表现得超级自信,但仍然弄错事实。这就像一个学生百分之百确定法国的首都是“伦敦”,这种自信并非源于正确,而是源于他的主观确定感。

5. “提前完成”的惊喜

机器人被分配了一个最多可以进行 48 个“步长”(思考轮次)的预算来完成任务。

  • 现实情况: 它几乎从不使用全部预算。它通常在短短 3 到 17 步内就快速完成了任务。它会非常迅速地锁定答案,通常是在它已经非常有信心的时候,远在耗尽时间之前。

6. 它和旧的机器人一样好吗?

当研究人员将这种新的扩散机器人与旧的“从左向右”机器人(Gemma-4)进行比较时,他们发现它们在处理数学、事实和 JSON 任务并获得正确答案方面是同样出色的。新机器人只是以一种略微不同的、稍微混乱一点的方式到达终点。

总结

论文得出结论,DiffusionGemma 既非纯粹的并行,也非纯粹的顺序执行。它是一个混合体:

  • 它以大型、同步的批次进行工作。
  • 它具有微弱的从左向右移动的倾向,但只有当你从远处观察时才会发现。
  • 它会提前完成,并在感到自信后停止思考。
  • 它的“置信度”是数学成功的良好预测指标,但对于事实则是糟糕的预测指标。

作者强调,我们需要停止假设这些模型是完美的方块或完美的直线。它们更像是成组工作的画家,有时重叠工作,有时提前结束,并且会根据任务的不同而完全忽略顺序。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →