Ideas in Inference-time Scaling can Benefit Generative Pre-training Algorithms
本文认为,自回归模型与扩散模型之间的传统二分法具有误导性,转而提出生成式预训练应当在选择训练目标以克服根本算法限制之前,优先设计用于序列扩展和状态细化的高效推理程序。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,AI 图像与文本生成的世界就像一个巨大的建筑工地。多年来,业界一直纠结于争论两种完全不同的施工队伍,认为它们是完全不同的物种:
- “逐砖累进”型队伍(自回归模型/Autoregressive Models): 这些工人一次铺一块砖,再铺一块,再铺一块,从左向右砌成一面墙。他们擅长建造长墙(比如写长篇故事),但如果中间出了错,如果不拆掉整面墙,他们就无法修复中间的错误。
- “雕塑家”型队伍(扩散模型/Diffusion Models): 这些工人从一块充满噪声的大理石块开始,通过不断地凿刻和精炼,直到塑造出一个雕像。他们擅长制作高质量的形状,但通常是同时处理整个雕像,而不是添加新的部分。
论文的核心观点:
作者们说:“别再争论哪种队伍更好了,那是场毫无意义的争论。”
他们认为,真正的区别不在于“谁在建造”(模型类型),而在于“如何建造”(推理过程)。他们提议我们应该从两个不同的维度来扩展 AI 的效率:
- 维度 1:序列扩张(增加内容): 让墙变得更长,或者让故事变得更大。
- 维度 2:状态精炼(优化现有内容): 打磨雕像,或者修复墙中间的错误。
论文声称,未来的顶级 AI 不应该只是选择一种队伍,而应该在“雇佣工人”(训练)之前,先设计好**“施工计划”(推理)**。如果你的计划本身有缺陷,再多的训练也无法弥补。
以下是论文的三个主要教训,通过日常类比进行了说明:
1. “缺失指令”问题(DDIM 的修正)
场景: 想象你正在使用一个 GPS 导航应用。你告诉 GPS:“带我从 A 点到 B 点。”但 GPS 只知道你现在在哪里(A 点)以及当前的时间。它不知道你最终想去哪里(B 点),也不知道你打算什么时候到达。它只是根据你当前的位置来猜测一个方向。
论文的观点:
目前的 AI 模型(特别是“DDIM”采样器)通常试图通过一个巨大的跨步,从充满噪声的图像直接跳跃到清晰的图像。但它们使用的数学逻辑就像那个 GPS:它不知道“目标时间”(目的地)。它试图在不知道终点在哪的情况下,盲目猜测这一大步该怎么跳。
修正方案: 论文说:“直接把目的地告诉 GPS!”通过简单地将“目标时间”作为输入加入到 AI 的大脑中,模型突然就具备了实现完美“一步到位”跳转到最终图像的能力。这仅仅是指令上的一个小改变,却让整个过程变得行之有效。
2. “扑克牌手”问题(多 Token 预测)
场景: 想象你正在尝试预测句子中的下两个单词:“这手扑克牌是……”
如果你独立地去猜测第一个词和第二个词,你可能会猜出“高(High)”和“房子(House)”。单独看,这两个词都有意义。但组合在一起,“高房子(High House)”并不是一种真实的扑克牌。你需要理解“高”和“房子”之间是有联系的。
论文的观点:
许多现代 AI 模型为了提高速度,会尝试同时预测多个单词。但它们往往是独立地进行预测,就像同时掷两颗互不相关的骰子。这破坏了单词之间的关联性。
修正方案: 论文指出,如果你想同时预测多个单词,你的 AI 需要经过训练,以理解它们之间的关系(联合分布)。如果你没有在预测过程中构建这种关系,AI 就会一直产生奇怪的组合,无论你用多少训练数据,都无法解决这种底层的预测缺陷。
3. “长距离跳跃” vs. “小碎步”(流映射/Flow Maps)
场景: 想象你需要从山脚走到山顶。
- 旧方法: 你迈出细小的、试探性的碎步,每走一步都要检查一下平衡。这很慢,而且需要很多步。
- 新方法: 你学会了直接向山顶发起一次自信的纵身长跳。
论文的观点:
目前大多数 AI 模型都是通过“小碎步”(局部更新)进行训练的。它们学习如何移动一小步,然后再移动一小步。论文认为,为了让 AI 变快,它需要学习**“流映射”(Flow Maps)**。
把“流映射”想象成一份“传送指南”。与其学习如何迈出一小步,不如让 AI 学习一条直接路径(地图),从而实现从混乱状态到清晰状态的单次或两次大规模跨越。近期的研究方法正开始转向这一点,因为它们不再进行小碎步式的挪动,而是开始进行长距离的跨越,因此速度更快。
总结
论文得出结论:我们不应该过度痴迷于一个模型是“自回归”还是“扩散”模型。相反,我们应该问:
- 这个计划是否允许 AI 高效地增加更多内容?(序列扩张)
- 这个计划是否允许 AI 高效地精炼其作品?(状态精炼)
如果 AI 的“施工计划”(推理)缺失了关键变量(如目标时间),或者基于错误的假设(如假设单词是独立的),那么训练永远不会达到完美。先设计好动作,再去训练选手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。