← 最新论文
💬 NLP

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

该论文介绍了 UNIBROWSE,这是一个新颖的数据到智能体(data-to-agent)框架,它生成了涵盖所有三种多模态浏览信息流模式的全面训练数据,并采用探索感知强化学习来训练一个 35B 规模的智能体,该智能体在多模态 BrowseComp 基准测试中实现了最先进的性能,显著超越了其基础模型以及领先的闭源智能体。

原作者: Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探,但你不仅仅是阅读笔记本上的几条线索,而是必须在图书馆、相册和实时新闻流之间来回穿梭来寻找答案。这就是所谓的“多模态浏览与推理”(Multimodal BrowseComp)任务:一个超级困难的谜题,AI 智能体必须通过阅读文本、观察图片并使用搜索工具,将碎片信息拼凑起来,从而得出一个并非直接呈现在某个网页上的答案。

长期以来,我们训练的 AI 侦探一直有些“偏科”。它们擅长阅读文本线索,或者通过看一张图片再阅读文本来寻找答案(比如看到一张狗的照片,然后搜索“这是什么品种?”),但它们在反向任务上表现得很差:即通过阅读文本来弄清楚应该在图片中寻找什么(比如读到一段关于一座奇特建筑的描述,然后搜索照片以确认其形状)。

重大发现:“UniBrowse”侦探
来自北京大学的研究团队开发了一种名为 UNIBROWSE 的全新训练系统,这可以被视为一个超级智能的训练营,终于教会了 AI 智能体如何处理三种类型的线索:

  1. 仅限文本: 仅仅是阅读并连接事实。
  2. 图转文: 从一张照片开始,寻找背后的故事。
  3. 文转图: 先阅读故事,然后搜寻匹配的照片以进行验证。

在此之前,大多数训练营只涵盖前两种类型。作者认为,忽略第三种类型(文转图)会让 AI 在面对现实世界场景时处于“训练不足”的状态,因为在现实中,你需要通过阅读来验证一个事实的视觉特征。他们还注意到,以往的方法就像是在城市里盲目游荡(这会导致大量的噪音和错误的转向),或者仅仅是盯着一张完美的、虚假的地图(这与混乱的现实世界并不相符)。UNIBROWSE 通过这种方式解决了这个问题:它先从一个坚实的“地图”(知识图谱)开始,然后派 AI 出发去互联网上抓取实时的、真实的证据,以确保线索的真实性。

“探索”过滤器:剔除冗余
这里有一个巧妙之处:研究人员意识到,并非所有的练习题都是同等质量的。有些问题只有一种枯燥的解法,而另一些问题则迫使智能体尝试不同的路径、回溯并重试。

为了解决这个问题,他们发明了一个新的指标,叫做**“探索程度”(exploration degree)**。想象一下你在给学生的作业评分。如果每个学生都用完全相同、简单的方式解决数学题,那么学习效果就很有限。但如果有些学生尝试了捷径,有些被困住并回溯,还有一些人找到了聪颖的新路径,那才是真正的学习发生之处

该团队利用这种“探索程度”来过滤数据。他们丢弃了那些枯燥的、只有单一路径的问题,只保留了最具“探索性”的前 30% 的问题。这使得他们的强化学习(即 AI 通过试错进行学习的部分)变得更加高效,因为它只专注于那些能真正教会智能体深度思考的难题。

结果:新的冠军
通过这条流水线,他们构建了一个拥有 350 亿参数 的 AI 智能体(一个非常大的大脑)。他们不仅是凭直觉判断它会奏效,还通过五个不同的硬核基准测试对其进行了衡量。

结果令人印象深刻。他们的全新智能体 Uni-Browse 在这些测试中的平均准确率达到了 54.4

  • 这比它的基础模型(Qwen3.5-35B-A3B,初始分数为 43.9)提升了 10.5 个百分点
  • 它击败了几个著名的“闭源”巨头(如 GPT-5 和 Gemini-2.5 Pro,它们的得分分别在 42.944.8 左右)。
  • 它甚至超越了其他开源模型,如 Kimi K2.5(50.8)。

他们并未声称的事项
了解这篇论文没有说什么也很重要。作者谨慎地指出,虽然 UniBrowse 是他们见过的最强的开源智能体,但它仍然未能击败绝对最强大的专有系统(如 Gemini-3.1 Pro,其得分达到了 63.2)。他们也承认,他们的智能体目前局限于处理文本和图像的公开网页浏览;它还无法处理交互式网站、视频或地图。他们建议,可能需要更大的模型和更好的工具来缩小剩余的差距,但他们并未声称已经解决了 AI 浏览的全部问题。

核心总结
通过构建一个涵盖三种线索类型(文本、图转文、文转图)的训练系统,并通过过滤掉枯燥的练习题,UNIBROWSE 团队创造了一个在解决互联网复杂多步谜题方面显著更优秀的 AI 智能体。这是一个坚实的进步,证明了训练智能体的方式与它的“大脑”规模同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →