← 最新论文
🤖 AI

Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher

该论文提出了混合开放式三向演化(HOTE)框架,该框架利用混合模式强化学习来协同演化提议者、求解器和评判者,使一个 8B 参数的模型在开放式任务上能够超越规模更大且处于最先进水平的深度研究模型,同时降低了时间开销。

原作者: Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Derek Li, Ying Wei, Bryan Dai

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Derek Li, Ying Wei, Bryan Dai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:教机器人成为超级研究员

想象一下,你想打造一个能像世界级研究员一样工作的 AI。它需要能在互联网上寻找信息、阅读成千上万篇文章,并针对复杂话题(例如“2050年气候变化如何影响咖啡生产?”)撰写一份详尽的长篇报告。

问题在于,大多数 AI 模型就像是只能通过固定教科书学习的学生。一旦读完了这本教科书,它们就会停止学习。它们无法通过自主研究新事物来让自己变得更强。

这篇论文介绍了一个名为 HOTE(混合开放式三方演化)的新系统。不要把 HOTE 看作是一个单一的学生,而要把它看作是一个通过自我博弈来不断进化的自我改进研究团队

团队中的三个角色

HOTE 并没有让一个 AI 尝试完成所有事情,而是使用了三个专门的角色,它们共同进化:

  1. 求解者 (The Solver / 研究员):

    • 角色: 这是实际干活的 AI。它接收一个问题,搜索网络,阅读文档,并撰写一份长篇研究报告。
    • 类比: 把求解者想象成一名试图破解谜团的侦探
  2. 评判者 (The Judge / 评论家):

    • 角色: 这个 AI 阅读求解者撰写的报告。它不仅仅是简单地说“好”或“坏”,而是会创建一个定制的检查清单(称为“评分标准/rubric”)来给报告打分。它会寻找具体的优势和劣势。
    • 类比: 评判者就像是一位严厉的编辑体育裁判。如果侦探漏掉了线索,裁判就会吹哨并说:“你漏掉了这个具体的细节。”至关重要的是,评判者会随着看到新的错误类型而更新自己的规则手册,因此不会困于旧规则。
  3. 提议者 (The Proposer / 出题官):

    • 角色: 这个 AI 观察评判者的反馈和侦探犯下的错误,从而创造出新的、更难的问题。它的目标是找到侦探的弱点并对其发起挑战。
    • 类比: 提议者就像是一位健身教练,他观察运动员在某个特定动作上的失败,然后设计一个新的、稍微难一点的训练项目,以精准修复那个弱点。

如何训练: “三方演化”游戏

其魔力在于这三个角色在一个循环中协同工作,不断变得更强:

  1. 出题官创造一个具有挑战性的研究问题。
  2. 侦探尝试回答它,搜索网络并撰写报告。
  3. 裁判为报告评分,创建新的检查清单,并指出侦探在哪里失败了。
  4. 侦探从评分中学习并再次尝试。
  5. 出题官观察侦探仍然不擅长的领域,并在下一轮中设计一个更难的问题。

这个循环重复了数千次。论文称之为“三方演化”(Tri-Evolution),因为这三个角色都在同时进行演化(改进)。

“混合”秘诀

论文还提到了一个“双模混合”(Dual-Mode Hybrid)策略。这就像是以两种不同的方式训练一名运动员:

  • 模式 A (工具使用): 侦探被允许使用互联网(搜索工具)来寻找答案。这很真实,但可能会产生噪音且速度较慢。
  • 模式 B (无工具): 侦探必须仅凭记忆和逻辑来回答问题,而不进行任何查找。这更快,但依赖于他们已有的知识。

HOTE 系统同时在两种模式下训练侦探。

  • 为什么? 如果只用互联网训练,侦探可能会变得懒惰,过度依赖搜索结果。如果只在没有工具的情况下训练,他们可能会忘记如何有效地使用互联网。通过将两者混合,侦探学会了成为一名既知道何时搜索,又知道如何在没有工具时进行深度思考的顶级研究员。

结果:为什么这很重要

研究人员在三个困难的基准测试(健康、科学和通用研究)上测试了这个系统。

  • 结论: 一个经过 HOTE 训练的 80 亿参数模型(中型规模 AI)变得比许多更大的模型(32B+)以及其他最先进的研究型 AI 更加聪明
  • 效率: 与其他方法相比,它在更短的时间内并使用更少的计算能力达到了这些结果。
  • 可持续性: 不同于在一段时间后就会停止进步的其他方法,HOTE 团队能够长期保持进步,因为“出题官”不断寻找新的、具有挑战性的问题,而这些问题是“侦探”尚未解决的。

一句话总结

HOTE 是一个自我改进的 AI 系统,其中研究员评论家出题官通过一场持续的“国际象棋”博弈,结合互联网搜索与纯粹的思考,将一个中型规模的 AI 转化为比以往任何方法都更快、更好的世界级深度研究员。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →