← 最新论文
💬 NLP

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

本文介绍了 DR Tulu,这是一个通过“基于动态演进评分标准的强化学习”(RLER)训练的开源深度研究模型,该模型使评估标准与策略协同演进,从而在长篇研究任务中不仅超越了现有开源智能体,更可与专有系统相媲美,同时显著提升了成本效益。

原作者: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca So
发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《DR Tulu:基于动态评分标准的强化学习用于深度研究》的解释,采用通俗易懂的日常语言和类比进行翻译。

大局观:教机器人成为研究员

想象一下,你想教一个机器人撰写一篇关于复杂主题的长篇详细研究报告,比如“基因突变如何导致罕见疾病?”或“可再生能源的历史是什么?”

当今的大多数 AI 模型就像只为了应对短测验而学习的学生。它们非常擅长回答简单的问题,比如“法国的首都是哪里?”,但当被要求撰写一篇需要浏览数百个网站、核实事实并引用来源的 20 页报告时,它们就会束手无策。

这篇论文的作者构建了一个名为DR Tulu的新 AI。它是第一个专门训练成为“深度研究员”的开源模型。它不只是猜测;它会规划、搜索网络、阅读论文,并撰写一份引用详实的长篇报告。

问题:如何给长篇报告打分?

要教会 AI 做得更好,通常使用一种称为强化学习的方法。这就像训练一只狗:

  1. 狗(AI)表演一个动作。
  2. 如果它做对了,就会得到奖励(奖励)。
  3. 如果它做错了,就得不到奖励。

长篇研究报告的问题在于,很难知道什么样的报告才算“好”。

  • 静态评分标准(旧方法): 想象一位老师给狗一个固定的检查清单:“必须有 5 个段落。必须提到 1990 年。”如果狗写了一篇关于 1991 年的精彩报告,老师会因为其没有遵循僵化的检查清单而给它不及格。这个清单不知道狗实际上发现了什么。
  • “闭卷”问题: 如果你要求 AI 仅根据其已有的知识来制定检查清单,它可能会遗漏它刚刚在互联网上发现的新事实。

解决方案:“动态评分标准”(聪明的老师)

这篇论文介绍了一种名为**RLER(基于动态评分标准的强化学习)**的新方法。

想象一位聪明的老师,她不使用固定的检查清单。相反,这位老师会实时观察学生(AI)进行研究。

  1. 学生搜索: 学生走出去,发现新事实,并起草一份报告。
  2. 老师适应: 聪明的老师查看学生发现了什么。“哦,我不知道存在这个事实!我应该在我的清单中增加一条新规则:‘必须解释这个新事实。’"
  3. 反馈循环: 老师学生学习的同时更新清单。如果学生试图作弊(比如不阅读就直接复制文本),老师会立即增加一条规则:“禁止作弊”。

从技术术语来说,论文称这些为动态评分标准。它们是随着 AI 探索更多信息而变化和变得更智能的评估标准。这使得 AI 能够从自己的发现中学习,而不是被束缚在一套静态的规则中。

结果:预算友好的超级研究员

作者使用这种“聪明老师”的方法训练了 DR Tulu。以下是发生的情况:

  • 它更聪明: DR Tulu 的表现远超其他开源研究模型。它撰写的报告更好,发现的事实更准确,并且正确引用了来源。
  • 它可与巨头媲美: 它的表现与 OpenAI 和 Google 等大公司昂贵且专有的系统一样好(有时甚至更好)。
  • 它很便宜: 这是最大的胜利。昂贵的系统每个问题花费约1.80 美元。而 DR Tulu 每个问题仅花费约0.002 美元。这大约便宜了1000 倍

“遗传病”测试

为了证明它真的有效,团队给 DR Tulu 布置了一项非常艰巨的任务:分析基因突变,看它们是否可以用特定药物治疗。这通常是人类医学专家才承担的任务。

  • DR Tulu 成功搜索了医学数据库,找到了相关论文,并综合撰写了一份报告。
  • 它能够在这项任务上与最昂贵的闭源 AI 系统竞争。
  • 其他开源模型失败了,因为它们无法找到正确的引用或核实事实。

工具箱:"dr-agent-lib"

这篇论文还发布了一个名为dr-agent-lib的“工具箱”。

  • 你可以把它想象成 AI 研究员的瑞士军刀
  • 它允许 AI 使用不同的工具:谷歌搜索、阅读特定网页以及搜索学术论文。
  • 关键在于,AI 学会了为工作挑选正确的工具。如果问题涉及科学,它就使用“论文搜索”工具。如果是关于一般新闻,它就使用“网络搜索”。它不会盲目地只使用一种工具。

总结

这篇论文介绍了DR Tulu,这是一个开源 AI,能够学习进行深度的长篇研究。它使用一种特殊的训练方法(动态评分标准),其中 AI 的“评分规则”会根据 AI 的发现进行实时更新。这使得 AI 比当前最先进的研究工具更聪明、更准确,且成本低得多。作者已经分享了代码、数据和模型,以便任何人都可以使用它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →