Compute Aligned Training: Optimizing for Test Time Inference
本文提出了“计算对齐训练”这一新颖框架,该框架通过推导新的损失函数,将大型语言模型的训练目标与推理阶段的测试策略相一致,从而相较于标准的监督微调(SFT)和强化学习(RL)方法显著提升了性能扩展能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在为一种非常特定的期末考试培训学生。
旧方法(标准训练):
传统上,当我们教授人工智能模型(例如那些撰写文章或解决数学问题的模型)时,我们就像一位严格的老师,单独批改每一份作业。如果学生答对了问题,我们就说“做得好!”;如果答错了,我们就说“再试一次”。我们想要学生每次都完美地答对第一个答案。
问题是,这并不能让他们为真正的考试做好准备。在现实世界中,我们不仅仅是向模型索取一个答案。我们要求它生成许多不同的答案(就像要求学生写 10 篇不同的文章草稿),然后我们挑选最好的一个,或者投票选出最常见的那个。
如果你训练学生完美地写出第一稿,他们可能会变得过于自信,从而停止探索新想法。他们可能会陷入一种“安全”的思维模式。当你后来要求他们生成 10 份草稿时,他们可能只会写出 10 份略有不同的同一份“安全”答案,而这些答案中没有一个可能是你所需的精彩、创造性的解决方案。
新方法(计算对齐训练 - CAT):
这篇论文的作者提出了一种名为**计算对齐训练(Compute Aligned Training, CAT)*的新训练方法。他们不是根据单次作业来给学生打分,而是根据学生在实际*考试形式中的表现来评分。
以下是其工作原理,通过几个类比来说明:
1. “通过@N"类比(彩票票)
想象考试允许你为一道题购买N 张彩票(假设是 64 张)。只要你的 64 张彩票中任何一张是中奖号码,你就赢了。
- 标准训练: 如果学生用一张彩票就有 50% 的胜率,老师会不断逼迫他们达到 90% 或 99%。但在 64 张彩票的抽奖中,一旦你有了 50% 的胜率,购买更多彩票就足以保证获胜了。老师浪费精力试图让一个“好”学生在简单问题上变得“完美”,却忽略了学生只有 1% 胜率的那些难题。
- CAT 训练: 老师意识到:“嘿,这个学生用 64 张彩票很可能已经会赢了。我不再这么严格地批改这个简单问题了。”相反,他们将所有精力集中在学生目前失败的难题上。他们教导学生分散机会,确保 64 张彩票中至少有一张是中奖票,而不是试图让某一张特定的彩票变得完美。
2. “多数投票”类比(选举)
想象考试要求模型生成 10 个答案,然后全班投票选出最受欢迎的那个。
- 标准训练: 老师试图让学生的第一个答案成为绝对最受欢迎的,即使它已经以压倒性优势获胜。这就像一位已经赢得 90% 选票的候选人;老师却不断告诉他要更努力地竞选,这是浪费时间。
- CAT 训练: 老师关注“临界点”。如果学生的答案目前以微弱劣势落败,老师会给予巨大的提升,帮助他们冲过终点线。如果学生已经轻松获胜,老师就不再给他们额外的分数。这迫使模型将精力集中在“战场”问题上,因为在这些问题上,一点点额外的努力就能扭转选票。
3. “最佳 N 选”类比(才艺表演)
想象模型生成 10 首歌曲,而你只保留其中最好的一首。
- 标准训练: 老师试图让平均水平的歌曲听起来不错。这导致音乐安全、无聊、平庸,虽然从不糟糕,但也从不惊艳。
- CAT 训练: 老师告诉模型:“没关系,哪怕你的 10 首歌里有 9 首很糟糕,只要第 10 首是杰作就行。”这鼓励模型去冒险,尝试奇怪、高方差的想法。它学会了产生多样化的输出,因为它知道“搜索”过程(挑选最好的那个)会过滤掉失败者并保留获胜者。
他们实际上做了什么?
研究人员通过三种具体方式测试了这一想法:
- 数学问题: 他们训练人工智能模型解决数学问题。当他们使用 CAT 来为“通过@N"(生成许多答案并挑选正确的那个)做准备时,与标准方法相比,模型在解决难题方面取得了显著进步。
- 投票: 他们训练模型为“多数投票”生成答案。同样,当应用投票策略时,CAT 模型的表现更好。
- 蛋白质设计: 他们甚至将这一方法测试于一种完全不同的 AI,即设计蛋白质(生命的构建模块)的 AI。在 AI 必须从许多劣质结构中找到稀有、高质量的蛋白质结构的场景中,经过 CAT 训练的模型比标准模型更擅长找到“头奖”蛋白质。
核心结论
这篇论文认为,你训练模型的方式应该与你使用它的方式相匹配。
如果你计划使用模型生成许多选项并挑选最好的一个,你不应该训练它完美地通过第一次尝试。你应该训练它擅长创建一个选项池,以便最有可能从中找到最好的那个。
他们称之为“计算对齐训练”,因为它将训练过程与测试时使用的“计算”(额外的思考能力)对齐了。这是一种在不需更强大的计算机或更多训练时间的情况下获得更好结果的方法;你只需改变游戏规则,以匹配模型实际被使用的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。