Learning the ARTS of Search for Automated Discovery
本文介绍了 ARTS,一种利用语言模型来区分错误假设与执行错误,并采用测试时训练来克服上下文限制的智能体推理框架,该框架在科学发现任务中不仅优于领先的搜索算法,且在成本显著降低的情况下达到了前沿模型的性能水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图解决一个巨大的、复杂的拼图,但你手头没有包装盒上的图片。你必须猜测这些碎片看起来是什么样的,尝试将它们拼凑在一起,看看是否可行。如果一个碎片无法契合,你必须做出决定:是这个碎片本身的形状不对,还是我只是尝试用错误的方式把它强行塞进去?
这就是自动化科学发现的核心挑战,而这篇论文介绍了一种名为 ARTS(用于树搜索的代理推理,Agentic Reasoning for Tree Search)的新系统来解决这个问题。
以下是通过简单的类比对 ARTS 工作原理进行的解释:
1. 问题所在:“好点子 vs 差执行”陷阱
在以往的方法中,AI 科学家会尝试一个假设(一个新想法),编写代码进行测试,然后得到一个分数。
- 缺陷: 如果分数很低,旧的 AI 会立即丢弃这个想法,并尝试完全不同的东西。
- 现实情况: 有时,一个天才的想法之所以得分低,仅仅是因为代码有一个微小的 Bug,或者训练还没完成,或者设置略有偏差。这就像一位厨师做了一道完美的菜谱,却因为烤箱温度太高把吐司烤焦了。旧的 AI 会说:“这个食谱很烂!”然后将其丢弃,永远不会意识到那个食谱其实非常出色。
2. 解决方案:“侦探科学家”
ARTS 引入了一个科学家(一个聪明的 AI 推理器)和一个执行者(一个快速的 AI 编程器)。他们像侦探和实验技术员一样协同工作。
侦探(科学家): 侦探不仅仅看最终的分数,他们还会查看实验的整个历史过程。他们阅读日志,检查代码,并观察训练曲线。
- 类比: 如果一辆车测试失败了,侦探不会只说“这辆车是废铁”。他们会检查日志并说:“引擎没问题,但技师忘了加机油。”
- 结果: 如果想法很好但执行很差,侦达会告诉执行者再次尝试同一个想法,但要使用更好的指令。这挽救了那些会被其他方法过早丢弃的“有前景”的想法。
实验技术员(执行者): 这个 AI 速度很快,擅长编写代码。它接收侦探的具体指令,并构建实验。
3. 避免“回声壁效应”
旧的搜索方法经常陷入循环。它们发现一个效果还不错的想法,然后就不断地对其进行微小且乏味的修改(就像是在改变汽车的颜色,却从不修理引擎)。
- ARTS 的妙招: 它使用了一种叫做**“语言化采样”(Verbalized Sampling)**的技术。它不仅仅是挑选单一的“最佳”想法,而是让科学家列出几种不同的可能性(例如,“尝试新引擎”、“尝试新燃料”、“尝试新轮毂设计”)并分配概率。
- 类比: ARTS 不仅仅是沿着目前看起来最有希望的路径前进,它还会向许多不同的路径派出探索者,看看是否在别处隐藏着一个山谷。这确保了它们不会仅仅因为过于专注于一个点而错过重大的突破。
4. “记忆”问题:当笔记本写满时
随着 AI 进行搜索,它会产生海量的实验历史。最终,这些历史会变得太长,导致 AI 无法记住(它耗尽了“上下文窗口”或精神空间)。
- 旧方法: AI 会删除旧笔记以腾出空间,从而忘记了为什么要尝试某些事情。
- ARTS 的方法(测试时训练/Test-Time Training): 当笔记本快满时,ARTS 不仅仅是删除笔记。它会将从过去实验中学习到的教训**“烘焙”进 AI 的大脑里**。
- 类比: 想象一个读过上千本书的学生。他们不需要随身携带所有的书,而是通过一场考试,迫使自己写下关键教训。一旦通过考试,这些教训就成为了他们永久记忆的一部分。
- 结果: 一个经过“学习”了搜索历史的较小、更便宜的 AI 模型(Qwen3-4B),其表现可以媲美巨大的、昂贵的 AI(如 GPT-o3 或 Gemini),但成本仅为后者的一小部分。
5. 结果:更聪明,而不只是更努力
论文在 22 个不同的机器学习挑战(如预测房价、识别 X 光中的疾病或玩游戏)上测试了 ARTS。
- 性能: 在 22 个任务中有 16 个,ARTS 击败了之前的最优方法。
- 效率: 它不仅仅是运气好;它通过研究为什么实验失败,找到了更好的解决方案。
- 成本: 通过使用“测试时训练”这一技巧,一个小型的开源 AI 模型可以达到最昂贵的闭源超级 AI 的水平,节省了高达 5 倍的计算成本。
总结
ARTS 是一种让 AI 进行科学研究的新方式。它不再盲目地尝试并立即丢弃任何看似失败的东西,而是表现得像一个充满好奇心的侦探。它调查为什么失败,挽救那些仅仅是执行不当的有前景的想法,同时探索许多不同的路径,并从自己的错误中学习,以便不需要庞大的记忆力也能持续进行。这使得它能够比以前更快、更便宜地发现更好的科学成果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。