← 最新论文
🤖 AI

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

本文介绍了 ReASearch,这是一个统一的框架,其中单个推理驱动型智能体能够自主管理提示词、程序和机器学习工作流的整个优化过程,有效地内化了复杂的搜索策略,并在多种任务中超越了专门化系统。

原作者: Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人解谜题、写诗或者训练一个电子游戏角色去获胜。在人工智能的世界里,这被称为“优化”(optimization)。通常情况下,人类扮演着场边严厉教练的角色。他们设计一套僵化的游戏计划:“试试这个,再试试那个,如果失败了,就回去尝试别的。”机器人(即大语言模型)仅仅是一个玩家,盲目地遵循指令进行微小的改动,而人类教练则决定着宏观的策略。但如果机器人也能成为教练呢?如果它能观察记分牌,弄清楚自己为什么输了,决定改变游戏的规则,甚至意识到自己陷入了困境并需要一个全新的方法——全靠它自己呢?这篇论文探讨的正是一个这样的问题:一个智能的 AI 智能体(agent)能否在没有人类编写的脚本告诉它如何思考的情况下,学会自主管理其寻找最优解的过程?

这项研究背后的研究人员在 COLM 2026 会议上介绍了名为 ReASearch 的新系统。你可以把它想象成递给机器人一把瑞士军刀,而不仅仅是一把锤子。在过去,AI 优化器就像一条拥有固定传送带的工厂流水线:由人类设计的算法决定下一个要测试哪个候选方案、投入多少时间以及何时放弃。AI 的唯一工作就是对当前的方案进行细微的修改。ReASearch 则颠覆了这一局面。它给了 AI 智能体一套工具——比如用于运行代码的 Python 解释器、用于记录过往错误的记忆文件,以及运行实验的能力——然后让智能体自行决定一切。智能体会问自己:“我应该先在小样本上测试这个想法吗?我是不是又犯了同样的错误?我应该放弃当前的计划,回到之前尝试过的更好的方案上吗?”这个智能体不仅仅是在瞎猜,它在整个过程中进行推理,并在过程中构建策略。

团队在 14 个不同的挑战中测试了这个“自我教练”型智能体,这些挑战涵盖了从微调文本提示词以使其更聪明,到进化计算机程序以解决数学难题,甚至优化机器学习训练工作流。结果令人惊讶地强大。在许多情况下,ReASearch 击败了由人类专家构建、带有特定硬编码规则的专门系统。例如,在名为“圆堆积”(Circle Packing,即将圆尽可能紧密地放入正方形中)的任务中,该智能体发现的解决方案比人类之前发现的最佳已知结果还要好。在其他任务中,它将性能提升了 2% 到惊人的 40% 不等。

真正令人着迷的是这个智能体是如何做到的。研究人员发现,尽管没有人教它,该智能体自然而然地开始表现得像一位经验丰富的科学家或国际象棋大师。它开始在投入使用有潜力的想法之前进行“双重检查”。它学会了当新路径导致死路时,将方案“回退”到早期更安全的版本。它开始保留一份“经验教训”日志,以避免重复同样的错误。最令人印象深刻的是,它发现有时你需要结合两种不同的技术来解决问题,而这种发现通常需要深厚的人类洞察力。论文表明,当你给 AI 提供合适的工具并让它通过推理来处理过程时,它可以内化复杂的搜索策略,而我们此前认为这些策略需要人类设计的算法来管理。事实证明,优化器不需要是一个独立的、僵化的控制器;优化器本身就可以是智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →