Support Before Frequency in Discrete Diffusion
本文表明,离散扩散模型在学习细化该支撑内的具体频率之前,先学习了数据的结构有效性(支撑),揭示了一个层次化学习过程,其中粗略的支撑信息比细粒度的频率细节更早出现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人写故事。你希望它学会两件事:
- 语法与有效性:知道哪些句子是可能存在的(例如,“猫坐在垫子上”是有效的;“垫子上的猫坐了”则不是)。
- 频率与风格:知道特定的有效句子在现实世界中出现的频率(例如,“猫坐了”比“猫坐在垫子上”更常见)。
本文认为,离散扩散模型(一种通过逐步修复混乱的词语来生成文本的人工智能)会以非常特定的顺序学习这两件事:首先,它们学习什么是有效的。只有后来,它们才学习什么是常见的。
以下是使用简单类比进行的分解:
核心思想:“支持先于频率”假设
将“支持”想象成大陆上所有有效城市的地图。将“频率”想象成居住在这些城市中的人口数量。
本文声称,当这些人工智能模型学习时,它们首先弄清楚城市位于何处(即地图)。它们学会区分“城市”与“海洋”。只有在它们拥有了一张像样的地图后,它们才开始数人口,以找出哪些城市是繁华的大都市,哪些是微小的村庄。
人工智能如何学习:“噪声”类比
这些模型的工作原理是:将一个完美的句子用噪声打乱(比如将其变成胡言乱语),然后尝试一次一个词地将其修复回来。
研究人员观察了“修复”过程的最后阶段,此时噪声非常低(句子几乎完美,只有几个词是错误的)。他们发现人工智能在决定下一个词时存在一种数学上的“层级”:
- 大信号(尺度):人工智能首先会问:“如果我改变这个词,句子是否会变得更符合语法?”这是一个巨大、响亮的信号。就像交通灯从红灯变为绿灯。
- 小信号(系数):只有当人工智能知道句子在语法上是正确的之后,它才会问:“在这些正确的词中,哪一个最流行?”这是一个安静、微妙的信号。就像在两条有效的路线中选择,看哪一条交通更少。
这一发现:由于“这是否有效?”的信号比“这是否流行?”的信号响亮得多(在数学上,它们属于不同的“数量级”),人工智能会先学习有效性规则。它能在很久之前就能告诉你一个句子是错误的,远早于它能告诉你哪个正确的句子最常见。
两种类型的“修复者”
本文比较了这些模型尝试修复文本的两种方式,就像两种不同类型的编辑:
- “均匀”编辑(通才):这种编辑可以将任何词改为任何其他词。
- 它是如何学习的:它必须同时学习三件事:“让它变得更好”、“保持原样”或“不要让它变得更糟”。这有点混乱。本文表明,如果你强迫这种编辑只听从最响亮的“让它变得更好”的信号,它在寻找有效句子方面会变得更好。
- “掩码”编辑(专才):这种编辑只处理被隐藏(掩码)为
[MASK]标记的词。它无法触碰已经可见的词。- 它是如何学习的:因为它只能填充空白,所以它自然会忽略“糟糕的举动”。这就像拼图 solver 只将拼图块放入空槽中。本文发现,这种编辑在寻找“有效城市地图”方面天生更擅长,因为它不会浪费时间试图修复已经正确的词。
实验:观察学习过程
研究人员通过两种方式测试了这一假设:
- 合成实验(训练轮):他们创造了一种带有严格规则的简单人造语言(就像具有清晰边界的电子游戏)。他们观察人工智能的学习过程,发现“这是否是一个有效的举动?”这一指标的提升速度远快于“哪个有效举动最常见?”这一指标。
- 现实世界实验(FineWeb 测试):他们在真实的互联网文本(FineWeb)上训练了一个模型。由于我们没有所有有效英语句子的完美列表,他们使用了一个巧妙的技巧:他们观察单词在训练数据中特定上下文中出现的频率。
- 结果:该模型在处理了约1.16 亿个单词后,学会了区分“有效”的单词选择与“无效”的选择。
- 结果:直到处理了2.34 亿个单词,该模型才开始可靠地选择最常见的有效选择,而不是较少见的有效选择。
结论
本文得出结论,这些人工智能模型并非一次性“完美”地学习。它们首先建立基础。
- 第一阶段:模型学习结构。它学会避免胡言乱语并找到“有效”的路径。
- 第二阶段:模型完善细节。它学习频率和风格的细微差别。
这解释了为什么在训练初期,这些模型可能会生成语法正确但听起来有点奇怪或重复的句子(它们有了地图,但尚未学会人口密度)。它们需要更多时间来完善其知识中的“频率”部分。
简而言之:人工智能先学会“正确”地说话,然后才学会“自然”地说话。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。