← 最新论文
🤖 AI

AI Research Preference Models

本文介绍了人工智能研究偏好模型(AI Research Preference Models, RPMs),这类模型利用冻结的语言模型来高效地优先排序并选择最具潜力的机器学习研究候选对象进行执行,从而与无引导智能体相比,显著降低了计算成本并加速了在前沿任务上的进展。

原作者: Thomas Simon Foster, Bassel Al Omari, Tingchen Fu, Thomas Mann, Carl Domond, Lucia Cipolina-Kun, Bhavul Gauri, Muna Aghamelu, Alexander D. Goldie, Eryk Helenowski, Jean-Christophe Gagnon-Audet, Albert
发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Thomas Simon Foster, Bassel Al Omari, Tingchen Fu, Thomas Mann, Carl Domond, Lucia Cipolina-Kun, Bhavul Gauri, Muna Aghamelu, Alexander D. Goldie, Eryk Helenowski, Jean-Christophe Gagnon-Audet, Alberto Pepe, Saba Nazir, Daniel Izcovich, Noam Levi, Rishi Hazra, Karen Hambardzumyan, Nicolas Baldwin, Xian Li, Martin Josifoski, Paris Giampouras, Masoud Jalili Sabet, Anya Sims, Hela Momand, Tatiana Shavrina, Despoina Magka, Jason Weston, Yulin Wang, Anirudh Goyal, João Henriques, Yoram Bachrach, Emily McMilin, Jakob Nicolaus Foerster

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正在探索广袤、未知星系的宇宙飞船船长。你拥有一台强大的引擎,能在眨眼之间生成数千条新的航线。然而,你的飞船面临一个致命问题:验证一条航线是否真的通向宝藏岛屿需要耗费数天的燃料和时间。如果你试图测试引擎创造的每一条航线,在你还没离开起航点之前,就会耗尽所有的燃料。这正是被称为“AI研究智能体(AI Research Agents)”的新一代人工智能所面临的困境。这些是聪明的计算机程序,旨在设计并测试它们自己的科学实验,特别是在机器学习领域。问题在于,虽然这些智能体可以在几分钟内构思出新想法(比如编写一个新的AI模型代码),但实际运行这些想法以观察其效果却可能需要数小时甚至数天的高昂计算资源。

为了解决这个问题,科学家们一直在构建“搜索支架(search scaffolds)”,它们就像是这些AI探险家的导航系统。这些系统允许AI生成许多可能的解决方案,挑选其中一个,进行测试,然后利用结果来生成下一批想法。但直到现在,系统中决定“下一个测试哪个想法”的部分,有点像在掷骰子。由于AI无法负担测试所有想法的代价,它必须去猜测哪个想法才是最好的。如果它猜错了,就会浪费珍贵的时间和金钱在死胡同的想法上。大问题在于:AI如何学会在买下彩票中的每一张之前,就选出那张中奖的彩票?

本文介绍了一种名为**AI研究偏好模型(AI Research Preference Model, RPM)**的巧妙新工具。把RPM想象成一个超级聪明的侦察兵,或者是AI想法的“试吃员”。RPM不再让AI盲目地挑选航线进行测试,而是观察新的想法,将其与过去的实验进行对比,并预测哪一个最有可能成功。研究人员构建了两种类型的侦察兵。第一种是“仅推理型(Inference-only)”侦察兵,它利用纯粹的推理来评判想法,就像影评人阅读电影剧本并预判其是否会成为热门影片一样。第二种是“智能体型(Agentic)”侦察兵,它会在做出最终决定之前,先对想法进行微型且快速的练习测试(称为试点实验),就像导演在正式拍摄全片前,先拍一段短镜头来测试灯光效果一样。

当研究人员将这些侦察兵接入他们的AI探险家(称为AIRA-dojo)并派遣它去解决20个不同的机器学习挑战时,结果令人印象深刻。配备了“仅推理型”侦察兵的AI,其平均得分从0.684提升到了0.711。而配备了“智能体型”侦察兵(即进行了额外练习测试)的AI表现得更出色,达到了0.729的分数。或许最令人兴奋的是,配备了这些侦察兵的AI达到与无引导AI同样高水平性能所需的时间,从24小时缩短到了大约15小时。这意味着该AI使用的计算资源不到原本所需的三分之二。事实上,在两个特定的任务上,配备了最佳侦察兵的AI甚至创造了新的世界纪录,超越了以往所有的尝试。这项研究表明,通过花费一点额外的思考时间来选择正确的想法,AI研究人员可以节省大量的资源和精力,从而在不耗尽资源的情况下,探索更多的科学前沿。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →