Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design
本文提出了 Marco DeepResearch,这是一种通过引入以验证为核心的框架设计(涵盖 QA 数据合成、轨迹构建及测试时扩展三个层面)来显著优化长程复杂任务表现,并在 600 次工具调用预算下性能超越或接近更大规模(30B)模型的深度研究智能体。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
🕵️♂️ Marco DeepResearch:让"8 亿参数”的小侦探,干翻"300 亿参数”的超级专家
想象一下,你有一个小侦探(8B 模型)和一个超级专家(30B 模型)。通常,小侦探因为脑子小、经验少,遇到复杂的案件(比如要在互联网上翻遍几千个网页找答案)时,很容易晕头转向,或者被假线索带偏。
但阿里巴巴的这篇论文介绍了一个叫 Marco DeepResearch 的新侦探。它虽然只有 8 亿参数(个头小),却通过一套"以验证为核心"的独门秘籍,在解决复杂搜索任务时,不仅吊打了其他小侦探,甚至能跟那些 300 亿参数的超级专家掰手腕,甚至超越它们!
它是怎么做到的?我们把它拆解成三个“超能力”来聊聊:
🎓 第一招:严师出高徒——“验证式”特训教材
(Verified Data Synthesis)
- 老问题:以前训练 AI 侦探,就像给学生发试卷。很多试卷是机器自动生成的,结果题目出得模棱两可,或者答案不唯一(比如问“谁拿了冠军”,结果有两个人并列,机器却只标了一个)。学生拿着这种烂试卷练,越练越糊涂,甚至学会了“瞎蒙”。
- Marco 的解法:
- 出题前先“验题”:在生成题目时,Marco 引入了一个“魔鬼考官”(验证机制)。它不仅要出题,还要扮演“找茬者”(Attacker),拼命尝试用其他答案来反驳这道题。
- 只有“铁证如山”的题目才过关:如果考官发现这道题有歧义,或者能轻易通过搜索捷径找到答案,这道题就直接作废。
- 效果:就像给侦探发了一套经过千锤百炼、答案唯一且极具挑战性的“真题集”。侦探练的都是真功夫,不再被假线索带偏。
🧩 第二招:边做边查——“带纠错”的办案流程
(Verification-Driven Trajectory Construction)
- 老问题:以前的侦探办案(生成推理过程)是“一条道走到黑”。比如它先搜了个网页,觉得答案差不多,就赶紧写结论。结果第一步就错了,后面越错越远,最后得出一个荒谬的结论,而且它自己还意识不到。
- Marco 的解法:
- 引入“复核员”:Marco 在训练时,让侦探在每一步推理后,都要停下来,请一位独立的“复核员”(Verifier Agent)用搜索引擎去验证刚才的结论对不对。
- 错了就重来:如果复核员说“不对”,侦探就得把刚才那步推翻,重新搜、重新想。
- 效果:这就像侦探在办案时,每走一步都要回头确认脚印。虽然慢了一点,但保证了每一步都扎实。它学会了“不要急着下结论,先验证再行动”。
🔍 第三招:死磕到底——“无限次重试”的考试策略
(Verifier-Guided Test-Time Scaling)
- 老问题:考试时,如果时间到了(工具调用次数限制),很多侦探就算没想明白,也会硬着头皮交卷,哪怕答案全是错的。
- Marco 的解法:
- 智能“弃子”策略:如果侦探发现自己在某条思路上钻了牛角尖(比如搜了 10 次还是没结果,或者逻辑乱了),它会果断清空所有笔记,重新开始(Discard All),换一条路走。
- 自我“阅卷”:在最终交卷前,它会把自己生成的几个备选答案,再拿出来互相“打架”(验证),选出最靠谱的那个。
- 效果:这就像考试时,只要没到截止时间,我就不断尝试新解法,直到找到正确答案为止。它不再盲目地“刷”次数,而是聪明地“验证”次数。
🏆 战绩如何?
这套“验证三件套”让 Marco DeepResearch 发生了质变:
- 小身材,大能量:作为一个8B(80 亿参数)的小模型,它在 BrowseComp(一个很难的网页搜索测试)和 BrowseComp-ZH(中文版)等硬核榜单上,吊打了所有同体量的其他开源模型。
- 越级挑战:更惊人的是,在限制最多调用 600 次搜索工具的情况下,它的表现超过了甚至追平了几个30B(300 亿参数)的超级大模型(比如通义 DeepResearch-30B)。
- 省钱又高效:这意味着我们不需要花巨资训练巨大的模型,只要把“验证”和“纠错”的方法用对,小模型也能干大活。
💡 总结
这篇论文的核心思想很简单:与其盲目地让 AI 变“大”、变“快”,不如让它变“稳”、变“准”。
通过严格筛选教材、强制中间检查、智能重试机制,Marco DeepResearch 证明了:在解决复杂问题时,“验证”比“猜测”更重要。它让一个小侦探学会了像老刑警一样思考,最终实现了“四两拨千斤”的效果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。