想象一下,你是一位正试图创造出世界上最美味汤品的厨师,但你的厨房灶台对用电量有严格的限制。你可以把电力花在一个巨大的、昂贵的锅上,一次性盛装大量的汤;或者你可以用一个小一点的锅,但通过长时间地搅拌来使用它。你也可以把能量花在不断品尝汤的味道以观察是否需要加盐,或者花在更快地切菜上。在人工智能的世界里,特别是在教计算机程序思考和解决问题时,科学家们也面临着类似的难题。他们有一个固定的“预算”(以 FLOPs 为单位衡量,这仅仅是计算机能进行的数学计算次数)。核心问题在于,如果你有一定量的电力,你应该把电力花在哪里?你应该为 AI 使用一个更大、更聪明的“大脑”吗?你应该让 AI 在学习之前尝试更多的猜测吗?还是你应该把更多电力花在一个给 AI 的作业打分的“老师”身上?如果平衡得不好,即使你有充足的电力,AI 也可能学得很慢,甚至根本无法学习。
这篇题为《强化学习后训练的计算资源应该投向何处?》(Where Should RL Post-Training Compute Go?)的论文,深入探讨了正是这个问题。作者帕特里克·威廉姆斯(Patrick Wilhelm)和奥德·考(Odej Kao)将计算机的能量预算视为一笔需要分配给三个主要方面的有限资金:搜索(让 AI 尝试许多不同的答案)、学习(根据这些答案实际更新 AI 的大脑)以及反馈(使用另一个程序来评判这些答案的好坏)。他们发现,并没有一种单一的“最佳”方式来分配资金。相反,完美的配方会根据 AI 大脑的大小、评分老师的类型以及你希望 AI 稍后通过什么样的测试而发生变化。
研究人员发现,仅仅说“我们使用了 100 个单位的功率”并不足以理解一个 AI 是如何被训练的。这就像是说一位厨师使用了 100 瓦的电,却没告诉你这些电是花在了炉灶上、搅拌机上,还是灯光上。如果你有一个较小的 AI 大脑,你可能会通过将大部分功率用于让它尝试许多不同的答案(搜索)来获得最佳效果。但如果你有一个巨大且强大的大脑,同样数量的功率可能只能买到几次尝试,因此你可能需要把更多精力花在实际的学习步骤上。他们还发现,“老师”非常重要。如果老师是一个简单的基于规则的检查器(比如数学标准答案),几乎所有的功率都会用于 AI 的尝试。但如果老师是另一个复杂的 AI 程序,那么很大一部分功率预算就会被老师履行职责的工作所消耗,从而留给学生 AI 学习的份额就变少了。
论文指出,训练 AI 的“最佳”方式完全取决于你的目标。如果你想让 AI 在某项特定的练习测试中获得高分,那么搜索和学习的一种特定组合可能效果最好。但如果你想让它稍后解决一个全新的问题,另一种组合可能会更好。为了帮助科学家们在不浪费数百万美元进行试错实验的情况下弄清楚这一点,作者引入了一个名为 RACE 的工具。把 RACE 想象成一次快速、廉价的“试吃”。它运行一个微小的、低功率的实验,来预测投入预算的“甜点位”(最佳平衡点)在哪里,这样研究人员就能知道哪些大规模实验是值得做的。作者谨慎地表示,这并不是一个保证 AI 会变得更聪明的魔法保证;它只是一个诊断工具,旨在帮助他们在投入全部资源之前选对方向。