← 最新论文
🤖 AI

WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning

本文提出了通过多智能体强化学习训练的 WideSeek-R1 框架,利用“主智能体 - 子智能体”架构实现并行化广度信息搜索,证明了在 4B 参数规模下其性能可媲美 671B 参数的单智能体模型,并展示了宽度扩展的有效性。

原作者: Zelai Xu, Zhexuan Xu, Ruize Zhang, Chunyang Zhu, Shi Yu, Weilin Liu, Quanlu Zhang, Wenbo Ding, Chao Yu, Yu Wang

发布于 2026-03-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Zelai Xu, Zhexuan Xu, Ruize Zhang, Chunyang Zhu, Shi Yu, Weilin Liu, Quanlu Zhang, Wenbo Ding, Chao Yu, Yu Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 WIDESEEK-R1 的新系统,它解决了一个大问题:当任务变得非常庞大和复杂时,单个超级大脑(大模型)往往忙不过来,这时候该怎么办?

简单来说,以前的研究都在拼命把单个模型“练”得更强(这叫深度扩展,就像让一个超级侦探独自去查案,哪怕要查几千条线索,他也得一条一条查,查到最后可能脑子都乱了)。

而这篇论文提出了一个全新的思路:“广度扩展”(Width Scaling)。它的核心思想是:与其让一个人累死,不如组建一个高效的团队,大家分工合作,同时干活。

下面我用几个生动的比喻来解释这个系统是如何工作的:

1. 核心比喻:从“超级侦探”到“高效情报局”

  • 旧模式(深度扩展): 想象一个超级侦探(单个大模型)。他记忆力超群,推理能力极强。但是,如果让他去查“全世界所有大学校长的名字和建校年份”,他只能一个人查。查完哈佛查普林斯顿,再查耶鲁……查着查着,前面的信息就忘了(这叫“上下文污染”),而且效率极低,因为他是串行工作的(一次只能做一件事)。
  • 新模式(WIDESEEK-R1,广度扩展): 想象一个情报局
    • 局长(Lead Agent): 他不需要自己查资料,他的工作是分派任务。他接到“查所有大学”的指令后,迅速把任务拆解成:“你查哈佛”、“你查普林斯顿”、“你查耶鲁”……
    • 特工们(Subagents): 这些是平行工作的。局长一声令下,10 个特工同时出发去查不同的学校。
    • 结果: 10 个特工同时干完,局长把大家的情报汇总,瞬间就得到了答案。

2. 这个系统是怎么“学会”合作的?(多智能体强化学习)

以前很多多智能体系统(多机器人/多模型系统)就像是一群没有经过训练、只会按死板流程办事的机器人。比如:“局长必须先说话,然后特工 A 说话,再特工 B 说话……"这种轮流说话的方式,其实并没有真正发挥“并行”的优势,效率还是很低。

WIDESEEK-R1 的厉害之处在于“训练”:
作者用了一种叫多智能体强化学习(MARL) 的方法。

  • 比喻: 就像在训练一支特种部队
    • 他们不是靠死记硬背操作手册(人工编写的工作流)。
    • 而是通过成千上万次的“实战演习”(在 2 万个复杂的搜索任务中训练)。
    • 如果局长分派任务不合理,或者特工们没查清楚,整个团队就“扣分”(奖励低)。
    • 如果局长能精准拆解任务,特工们能同时高效查资料并汇总,团队就“加分”(奖励高)。
    • 久而久之,局长学会了如何完美指挥,特工们学会了如何高效执行,他们之间形成了一种默契的“化学反应”。

3. 为什么这很重要?(小模型也能干大活)

论文里有一个非常惊人的发现:

  • DeepSeek-R1-671B:这是一个拥有 6710 亿 参数的超级大模型(像是一个拥有整个图书馆知识的超级天才),它单打独斗,查这些宽泛信息的效果很好。
  • WIDESEEK-R1-4B:这是一个只有 40 亿 参数的小模型(像是一个普通大学生),但它通过“组队 + 强化学习”,效果竟然和那个超级天才差不多!

这意味着什么?
这意味着我们不需要再死磕着去造那种几百亿、几千亿参数的“超级大脑”了。只要组织得当,让一群小模型通过并行协作,就能解决超级复杂的问题。这大大降低了算力成本,让普通公司甚至个人也能用得起强大的 AI 系统。

4. 他们是怎么造数据的?(自动化的“出题老师”)

为了训练这个系统,他们需要大量的“考题”。以前的题目大多是“查一个具体事实”(深度),但这次需要“查一大片信息”(广度)。

  • 作者开发了一个全自动流水线,像是一个不知疲倦的出题机器
  • 它从维基百科等地方抓取信息,自动生成像“列出前 20 个最大人口国家及其首都”这样的复杂表格任务。
  • 然后让 AI 自己生成答案,再互相核对,确保题目和答案都是高质量的。
  • 最终,他们造出了 2 万个 这种“广度搜索”的练习题,专门用来训练这个“情报局”。

总结

WIDESEEK-R1 告诉我们:
在 AI 的世界里,“人多力量大”不仅仅是口号,更是一种新的技术路径。

  • 以前: 我们追求让一个人变得无所不能(深度)。
  • 现在: 我们学会了如何让一群人(多智能体)高效协作(广度)。

通过让一个小模型学会如何指挥团队并行工作,它就能完成以前只有超级大模型才能完成的复杂任务。这就像是用一群训练有素的蚂蚁,通过完美的协作,搬动了一只大象

这篇论文不仅提出了一个新的模型,还开源了数据和代码,为未来“小模型 + 大协作”的 AI 时代打下了基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →