← 最新论文
🤖 machine learning

Can Bayesian Optimization Efficiently Find a Strong Single Expert in Neural Thickets?

本文表明,将贝叶斯优化应用于权重空间中的低维随机线性嵌入,能够实现对大语言模型高效的无梯度后训练,在实现与现有方法(如 RandOpt)相当或更优性能的同时,所需的候选评估次数减少了五倍。

原作者: Nigel Bastian Cendra, Abdelhamid Ezzerg, Fernando Julio Cendra, Jeremias Knoblauch, Jakob Zeitler

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Nigel Bastian Cendra, Abdelhamid Ezzerg, Fernando Julio Cendra, Jeremias Knoblauch, Jakob Zeitler

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、超级聪明的机器人大脑,它已经阅读了互联网上几乎所有的内容。这个大脑就是一个“大语言模型”。通常情况下,如果你想教它一个新技巧——比如解数学谜题或玩特定的游戏——你必须使用一种叫做“基于梯度的优化”的方法。这就像是在浓雾中寻找山顶,通过感受脚下的坡度并迈出细小、谨慎的步伐来前进。这虽然可行,但速度慢、成本高,且需要大量的计算能力。

最近,科学家们发现了一种不需要这些沉重攀爬装备就能微调这些大脑的方法。他们发现,如果你只是稍微随机地摇晃一下大脑的设置,其中一些随机的摇晃竟然会让它在特定任务上变得更聪明。这就像摇晃一个乐高盒子;大多数时候,你只会得到一堆乱七八糟的东西,但偶尔,你会意外地拼凑出一个完美的微型宇宙飞船。这个想法被称为“神经丛林”(Neural Thickets)。问题在于,如果只是通过随机摇晃盒子来寻找那个完美的宇宙飞船,就像是在蒙着眼睛找大海里的针。你必须尝试数千次摇晃,测试每一次的结果,并寄希望于运气好。这篇论文提出了一个简单的问题:我们能否更聪明一点,让这种“摇晃”变得更有章法?与其盲目猜测,我们能否使用一个“智能猜测者”来确定下一步该往哪个方向摇晃,从而用更少的尝试找到最好的结果?


智能摇晃者:无需眼罩即可寻得针尖

研究这些模型的团队使用的是名为 Qwen2.5 的模型,他们决定测试一种叫做**贝叶斯优化(Bayesian Optimization)**的方法。为了让你理解他们在做什么,让我们把机器人的大脑设置想象成一张巨大的、多维的地图。那种“随机摇晃”的方法(称为 RandOpt)就像是从远处向这张地图投掷飞镖。你投掷数千枚飞镖,看看哪些击中了“好”的位置,然后保留最好的那些。这虽然有效,但很浪费。

作者提出了一种不同的策略:贝叶斯优化 (BO)。把这想象成有一个神奇的、隐形的向导,他已经看过你投掷的几枚飞镖。在你投掷了几枚飞镖之后,这个向导会构建一张关于好位置“可能”在哪里的一张粗略地图。与其随机投掷飞镖,向导会准确地告诉你下一步该往哪里投,以便学到最多的东西。这就像是在玩“猜热还是猜冷”的游戏,但向导的猜测极其精准,以至于你只需寥寥数步就能找到宝藏,而不是成百上千步。

为了实现这一点,团队并没有观察整个巨大的地图。他们意识到,对机器人大脑的“好”的变化,很可能发生在那个庞大空间中一个非常狭窄、细小的通道里。因此,他们构建了一个只有 64 维的微型地图“切片”来进行搜索。然后,他们利用这个智能向导来探索这个切片。

他们的发现:更聪明,而非更辛苦

研究结果非常令人兴奋,但也带有重要的注意事项。当他们在像 Countdown(数字游戏)、GSM8k(数学应用题)和 MATH500(更难的数学题)这样的推理任务上进行测试时,“智能摇床”(BO)表现出了非凡的能力。

仅使用 200 次尝试(评估),贝叶斯优化方法就达到了与使用了 1,000 次尝试的“随机摇床”(RandOpt)相当甚至更高的性能。这意味着效率提升了五倍!

  • 在使用 15 亿参数模型的 Countdown 任务上,智能摇床得到了 15.05 的分数,而使用了五倍努力的随机摇床仅得到了 14.60
  • GSM8k 上,智能摇床得分 67.78,超过了随机摇床的 66.13

这表明,通过使用智能向导来导航搜索空间,你不需要投掷那么多飞镖就能找到一个强大的单一专家模型。你可以得到一个准备好独立上场的“超级机器人”,而不需要通过五十个不同版本的投票来决定答案。

陷阱:“虚假宝藏”问题

然而,论文也警告我们,这个神奇的向导并非完美无缺。这里有一个棘手的现象,叫做“赢家诅咒”。

想象你在果园里寻找最好的苹果。如果你挑选那个在阳光下看起来最闪亮的苹果,那可能只是因为光线好,而不是因为它真的最甜。研究人员发现,当他们过度推动搜索时,“智能摇床”会找到那些在训练题目(选择集)上表现惊人,但在处理新的、未见过的题目时实际表现却变差的模型。

例如,在 MATH500 任务上,智能摇床找到了在练习题上得分极高(超过 63%)的模型,但当测试真正的难题时,它们的表现实际上比基础模型还要差!向导对那些仅仅是靠运气得到的“闪亮苹果”过于自信了。论文指出,一旦达到某个临界点,搜索过程就变成了单纯的死记硬背练习题,而不是学习真正的技能。

总结

这篇论文表明,贝叶斯优化是无需进行昂贵的前后计算,就能为神经网络寻找强大单一专家的有力工具。它证明了,只要在搜索开始出现“过拟合”(即死记硬背练习题)之前停止,你可以用比随机猜测少五倍的精力找到更好的解决方案。

虽然这种方法并不能在所有任务上都创造奇迹(尤其是当“好”的解非常罕见或者练习题具有误导性时),但它展示了一个充满希望的未来。我们不再需要通过数百万次的随机猜测来蛮干,而是可以利用智能的、有引导性的搜索来寻找我们 AI 大脑的最佳版本,在获得顶级性能的同时,节省时间和能源。作者建议,随着预算的增加和解决“幸运光照”问题方法的改进,这种方法有望成为下一代 AI 微调的标准方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →