← 最新论文
🤖 AI

MELLON - Multimodal Enhanced LLM for Online Navigation

该论文介绍了 MELLON,这是一个通过对齐文本和图像以提升推理与规划能力,从而显著增强在 WebShop 基准测试上网页导航智能体性能的多模态框架,在仅经过一个轮次的训练后,准确率便提升了 9.26%。

原作者: Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人去网上购物。你可能会想:“只要给它文本指令,比如‘买一件红色的衬衫’,它就会阅读网页并点击按钮。”但问题在于:网页不仅仅是文字的堆砌。它们是充满图片、布局和设计的色彩斑斓的视觉空间。如果你让一个人去找一双特定的鞋子,他们不仅仅是阅读描述;他们还会看照片来观察颜色、款式和形状。长期以来,试图导航网页的最智能计算机程序就像盲目的购物者——它们能完美地阅读文本,却无法“看到”图像。这篇论文属于人工智能领域,特别关注“网页导航智能体”(Web Navigation Agents)。这些是旨在理解自然语言指令并在真实网站上执行任务(如购买商品或预订门票)的数字助手。研究人员提出的核心问题是:我们能否教会这些智能体同时使用它们的“眼睛”(观察图像)和“大脑”(阅读文本),就像人类一样?

这项研究背后的研究人员正在开展一个名为 MELLON 的项目,他们决定在名为 WebShop 的模拟在线商店上测试这个想法。他们想看看,如果给 AI 智能体提供产品图片的视图,同时结合文本描述,是否能帮助它做出更好的决策。他们并不只是凭空猜测;他们构建了三种不同的实验工具来尝试解开这个谜题。第一个,也是最成功的,就是 MELLON 本身。把 MELLON 想象成一位戴着特殊眼镜的超级聪明购物者,这些眼镜能将视觉世界转化为 AI 大脑能够理解的语言。团队发现,通过仅进行一轮学习(一个“epoch”),该智能体的表现就有了显著提升。具体来说,完成任务的准确率比仅观察文本的基础版本提高了 9.26%。这表明,融合视觉和文本是帮助 AI 导航网页的一种强大方式,尽管该系统仍处于成长期。

然而,这个故事并不是一个简单的“多模态总是更好”的胜利凯旋。团队还尝试了另外两种不如预期有效的创意方法。一种想法是将购物任务视为一场“视觉问答”(VQAgent)游戏,即 AI 查看一张图片和一个问题,然后选出正确答案。他们认为这会奏效,因为购物与回答有关图像的问题非常相似。但他们发现,在 WebShop 这种混乱的现实场景中,文本描述实际上比图片包含了更重要的线索。由于 AI 被训练为过度依赖图像,当文本才是解决问题的关键时,它就会感到困惑。这就像试图通过盯着一张图画来解开谜题,而答案其实隐藏在细则之中。

第三次尝试涉及一个“多模态排序器”(Multimodal Ranker),这是一个旨在让智能体停下来,在做出选择之前仔细比较页面上的每一件物品,而不是直接抓取它看到的第一个东西。人们曾希望这种额外的思考时间能带来更好的结果。相反,实验表明,这种额外的谨慎反而让智能体变得更慢且准确度更低。研究人员发现,用于衡量图像和文本相似性的工具(称为 BERT 和 CLIP 分数)与游戏中实际判定一个产品是否为“匹配项”的评分系统并不匹配。事实证明,试图对每一个选项进行排序,就像是一个购物者花了一个小时对比店里的每一件衬衫,最后却因为信息过载而买错了东西。

那么,这场数字购物冒险的最终启示是什么?论文指出,虽然赋予 AI 智能体“看见”网络的能力是一条充满前景的道路,但它并不是一根魔杖。MELLON 智能体证明了对齐图像和文本可以提升性能,但其他实验表明,仅仅增加复杂的视觉推理或强迫智能体观察所有内容并不总是正确的策略。研究人员总结道,我们需要继续探索如何最好地混合这些视觉和文本线索,也许是在未来通过更长时间的训练,或者使用更聪明的“大脑”(大语言模型)。目前来看,他们已经证明了,一点点视觉能力就能大有裨益,但 AI 仍需学习何时该看图片,何时该读细则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →