DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
本文介绍了 DR Tulu,这是一个通过“基于动态演进评分标准的强化学习”(RLER)训练的开源深度研究模型,该模型使评估标准与策略协同演进,从而在长篇研究任务中不仅超越了现有开源智能体,更可与专有系统相媲美,同时显著提升了成本效益。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《DR Tulu:基于动态评分标准的强化学习用于深度研究》的解释,采用通俗易懂的日常语言和类比进行翻译。
大局观:教机器人成为研究员
想象一下,你想教一个机器人撰写一篇关于复杂主题的长篇详细研究报告,比如“基因突变如何导致罕见疾病?”或“可再生能源的历史是什么?”
当今的大多数 AI 模型就像只为了应对短测验而学习的学生。它们非常擅长回答简单的问题,比如“法国的首都是哪里?”,但当被要求撰写一篇需要浏览数百个网站、核实事实并引用来源的 20 页报告时,它们就会束手无策。
这篇论文的作者构建了一个名为DR Tulu的新 AI。它是第一个专门训练成为“深度研究员”的开源模型。它不只是猜测;它会规划、搜索网络、阅读论文,并撰写一份引用详实的长篇报告。
问题:如何给长篇报告打分?
要教会 AI 做得更好,通常使用一种称为强化学习的方法。这就像训练一只狗:
- 狗(AI)表演一个动作。
- 如果它做对了,就会得到奖励(奖励)。
- 如果它做错了,就得不到奖励。
长篇研究报告的问题在于,很难知道什么样的报告才算“好”。
- 静态评分标准(旧方法): 想象一位老师给狗一个固定的检查清单:“必须有 5 个段落。必须提到 1990 年。”如果狗写了一篇关于 1991 年的精彩报告,老师会因为其没有遵循僵化的检查清单而给它不及格。这个清单不知道狗实际上发现了什么。
- “闭卷”问题: 如果你要求 AI 仅根据其已有的知识来制定检查清单,它可能会遗漏它刚刚在互联网上发现的新事实。
解决方案:“动态评分标准”(聪明的老师)
这篇论文介绍了一种名为**RLER(基于动态评分标准的强化学习)**的新方法。
想象一位聪明的老师,她不使用固定的检查清单。相反,这位老师会实时观察学生(AI)进行研究。
- 学生搜索: 学生走出去,发现新事实,并起草一份报告。
- 老师适应: 聪明的老师查看学生发现了什么。“哦,我不知道存在这个事实!我应该在我的清单中增加一条新规则:‘必须解释这个新事实。’"
- 反馈循环: 老师在学生学习的同时更新清单。如果学生试图作弊(比如不阅读就直接复制文本),老师会立即增加一条规则:“禁止作弊”。
从技术术语来说,论文称这些为动态评分标准。它们是随着 AI 探索更多信息而变化和变得更智能的评估标准。这使得 AI 能够从自己的发现中学习,而不是被束缚在一套静态的规则中。
结果:预算友好的超级研究员
作者使用这种“聪明老师”的方法训练了 DR Tulu。以下是发生的情况:
- 它更聪明: DR Tulu 的表现远超其他开源研究模型。它撰写的报告更好,发现的事实更准确,并且正确引用了来源。
- 它可与巨头媲美: 它的表现与 OpenAI 和 Google 等大公司昂贵且专有的系统一样好(有时甚至更好)。
- 它很便宜: 这是最大的胜利。昂贵的系统每个问题花费约1.80 美元。而 DR Tulu 每个问题仅花费约0.002 美元。这大约便宜了1000 倍。
“遗传病”测试
为了证明它真的有效,团队给 DR Tulu 布置了一项非常艰巨的任务:分析基因突变,看它们是否可以用特定药物治疗。这通常是人类医学专家才承担的任务。
- DR Tulu 成功搜索了医学数据库,找到了相关论文,并综合撰写了一份报告。
- 它能够在这项任务上与最昂贵的闭源 AI 系统竞争。
- 其他开源模型失败了,因为它们无法找到正确的引用或核实事实。
工具箱:"dr-agent-lib"
这篇论文还发布了一个名为dr-agent-lib的“工具箱”。
- 你可以把它想象成 AI 研究员的瑞士军刀。
- 它允许 AI 使用不同的工具:谷歌搜索、阅读特定网页以及搜索学术论文。
- 关键在于,AI 学会了为工作挑选正确的工具。如果问题涉及科学,它就使用“论文搜索”工具。如果是关于一般新闻,它就使用“网络搜索”。它不会盲目地只使用一种工具。
总结
这篇论文介绍了DR Tulu,这是一个开源 AI,能够学习进行深度的长篇研究。它使用一种特殊的训练方法(动态评分标准),其中 AI 的“评分规则”会根据 AI 的发现进行实时更新。这使得 AI 比当前最先进的研究工具更聪明、更准确,且成本低得多。作者已经分享了代码、数据和模型,以便任何人都可以使用它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。