Mango: Multi-Agent Web Navigation via Global-View Optimization
该论文提出了名为 Mango 的多智能体网页导航方法,通过利用网站结构动态优化起始点、结合 Thompson Sampling 分配导航预算以及引入 episodic 记忆机制,显著提升了在复杂层级网站中的任务成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 MANGO 的新系统,它的核心任务是教人工智能(AI)如何更聪明、更高效地在互联网上“冲浪”并找到答案。
为了让你更容易理解,我们可以把互联网想象成一个巨大的、迷宫般的图书馆,而AI 代理(Agent)就是一个刚入职的图书管理员。
1. 以前的困境:盲目地从大门开始找
在 MANGO 出现之前,大多数 AI 图书管理员接到任务(比如“帮我找 2023 年诺贝尔文学奖得主的传记”)时,习惯的做法是:
- 从正门(首页)开始:不管任务是什么,它们总是先走进图书馆的大门。
- 盲目乱撞:然后它们开始一层层地爬楼梯,走进一个个书架(子页面)。
- 陷入死胡同:因为图书馆太大、太复杂,它们经常走进死胡同,或者在完全无关的书架(比如“儿童绘本区”)里浪费时间。
- 体力耗尽:AI 的“体力”(计算预算/点击次数)是有限的。往往还没找到书,体力就用光了,任务失败。
问题核心:它们没有全局地图,不知道目标书大概在哪个区域,只能靠“瞎蒙”和“试错”。
2. MANGO 的解决方案:先画地图,再精准打击
MANGO 就像是一个拥有“上帝视角”的超级管理员。它不再盲目地从大门开始,而是分四步走:
第一步:快速扫描,绘制“藏宝图” (全局结构分析)
在正式找书之前,MANGO 会先派出一群“侦察兵”(轻量级爬虫),快速扫视整个图书馆。
- 它不看每一本书的细节,而是看目录和标签。
- 它结合搜索引擎(比如 Google 站内搜索),根据用户的问题,迅速圈定出几个最可能藏有答案的区域(候选 URL 集合)。
- 比喻:就像你要找一本关于“量子物理”的书,MANGO 不会从“历史区”开始找,而是直接通过目录知道,书大概率在“科学区”的“物理架”上。
第二步:像赌徒一样聪明地分配体力 (Thompson Sampling)
现在手里有几个可能的区域(候选 URL),但体力有限,不能每个都去翻一遍。MANGO 使用了一种叫Thompson Sampling的策略(一种多臂老虎机算法)。
- 比喻:想象你在玩老虎机,有几个拉杆。MANGO 会先试着拉几个,根据反馈(是找到了线索,还是空手而归),动态调整策略。
- 如果某个区域看起来很有希望,它就多分配点体力去那里;如果某个区域总是死胡同,它就果断放弃,不再浪费体力。
- 这让 AI 能在探索(去新地方看看)和利用(在好地方深挖)之间找到完美的平衡。
第三步:聪明的“图书管理员” (Web Navigation Agent)
一旦选定了目标区域,AI 就进去开始找书。
- 如果它之前去过这里但失败了,它会查阅“记事本”(记忆模块),看看上次是怎么失败的,避免重蹈覆辙。
- 它会在网页上点击、输入,直到找到答案。
第四步:事后复盘 (Reflection Agent)
每次找完(无论成功还是失败),MANGO 都会停下来“反思”:
- 成功了吗?答案对吗?
- 失败了是因为路走错了,还是因为体力不够了?
- 根据反思结果,它会更新“老虎机”的概率,告诉下次去哪个区域更靠谱,并把这次的经验记在“记事本”里,防止下次犯同样的错。
3. 效果如何?
论文在两个著名的测试集(WebVoyager 和 WebWalkerQA)上进行了测试,结果非常亮眼:
- 成功率更高:在使用 GPT-5-mini 模型时,MANGO 的成功率达到了 63.6%,比目前最好的竞争对手高了 7.3%。在另一个更难的测试中,它甚至领先了 26.8%。
- 更抗造:对于那种需要翻很多页才能找到的“长任务”,MANGO 表现得特别顽强,能坚持到找到答案,而别的 AI 早就放弃了。
- 通用性强:无论是开源模型还是闭源模型,MANGO 都能让它们变得更强。
4. 还有什么不足?
虽然 MANGO 很厉害,但它也不是完美的:
- 地图不全:如果目标信息藏在图书馆最深处、且从未被“侦察兵”扫描到的角落,MANGO 可能还是找不到。
- 看走眼:有时候它找到了正确的书,但 AI 自己读不懂书里的内容(推理错误),或者把答案理解错了。
- 体力消耗:为了找到难找的答案,它有时候会比别的 AI 多花一些点击次数(虽然这是为了成功,但在某些对速度要求极高的场景下可能不是最优)。
总结
MANGO 就像是给 AI 装上了一个**“导航仪” + “经验包”**。它不再像无头苍蝇一样从大门撞进来,而是先看看地图,挑几个最有希望的地方,聪明地分配精力,并且懂得从失败中吸取教训。这让它在复杂的互联网迷宫中,找东西更快、更准、更聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。