Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
本文介绍了 Agent-X,这是一个大规模基准测试,涵盖六个多样化环境中的 828 项真实世界多模态任务,并采用细粒度的步骤级评估框架来评估以视觉为中心的代理的深度推理能力,结果表明当前领先的模型在复杂的多步骤场景中难以实现全链条成功。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你建造了一个超级智能的机器人助手。你为它配备了一台摄像头、一个“大脑”以及一个装满各种小工具的百宝箱(例如放大镜、计算器或网络浏览器)。你让它解决一个棘手的谜题,比如:“找出飞往巴黎最便宜的航班,查询那里的天气,并告诉我是否需要带伞。”
长期以来,我们一直用简单的、虚构的谜题来测试这些机器人,这些谜题看起来就像视频游戏的关卡。但现实世界杂乱无章,涉及视频内容,并且要求机器人进行多步骤思考,而不仅仅是单一步骤。
现在,Agent-X 登场了。可以将这篇论文视为创作者们设计的一个全新的、极其困难的“障碍赛”,专门用于测试这些机器人助手在现实世界中深入思考和使用工具的能力。
以下是他们所做工作的分解,并辅以一些日常类比:
1. 问题所在:“视频游戏”与“现实世界”的对比
之前的测试就像给机器人一个视频游戏关卡,规则直接写在墙上:“使用红色钥匙打开蓝色门。”机器人只需遵循指令即可。
但在现实生活中,没人会告诉你该使用哪种工具。你只是说:“修理漏水的龙头。”机器人必须自己弄清楚:我需要扳手吗?我需要查找视频教程吗?我需要叫水管工吗?
作者指出,目前的机器人就像那些擅长死记硬背特定考试答案的学生,但一旦被要求解决从未见过的问题,就会束手无策。它们难以将多个思考步骤串联起来。
2. 解决方案:"Agent-X"障碍赛
该团队创建了 Agent-X,这是一个包含 828 个现实世界挑战 的大型集合。
- 场景:他们不使用虚构的图片,而是使用了来自六个不同生活“街区”的真实照片、视频和截图:
- 驾驶:观看一段汽车视频,判断行人是否即将过马路。
- 监控:查看监控录像以发现可疑人员。
- 体育:分析比赛视频以统计球员人数或预测获胜者。
- 网页浏览:在网站上导航以查找特定信息,而不被告知具体点击哪些按钮。
- 数学与通用逻辑:解决图片中发现的方程式,或比较多张图片。
- 转折:机器人不会收到检查清单。它们必须观察图片,意识到缺失了什么,从工具箱中挑选正确的工具,使用该工具,观察结果,然后决定下一步做什么。
3. “裁判”:如何给机器人评分
这是最重要的部分。通常,我们只检查机器人是否得出了最终答案(就像老师批改数学试卷)。
Agent-X 引入了一个分步裁判。想象一位老师,他不仅看最终答案,还会查看学生的草稿纸。
- 他们是否选择了正确的工具?(例如:他们是否使用了计算器而不是放大镜?)
- 他们是否正确使用了工具?(例如:他们是否按正确的顺序输入了数字?)
- 他们的逻辑是否合理?(例如:他们是否在查看证据之前就草率下结论?)
如果机器人猜对了答案,但却是通过幻觉(凭空捏造)或跳过步骤得出的,Agent-X 会判定其不及格。这就像一位厨师做出了美味的蛋糕,但使用了错误的食材;蛋糕味道不错,但过程存在缺陷。
4. 结果:机器人仍在学习
作者测试了 12 个最先进的人工智能模型(包括 GPT-4、Gemini 和 Qwen 等知名模型)。
裁决:即使是“最聪明”的机器人也在挣扎。
- 得分:表现最好的模型在从头到尾的任务中,完全正确的比例不到 50%。
- 瓶颈:机器人擅长观察图片和谈论它,但在规划方面却表现糟糕。它们经常:
- 忘记使用所需的工具。
- 使用不存在的工具(幻觉出不存在的工具)。
- 当需要观看视频并追踪随时间发生的事情时感到困惑。
- 搞错答案的格式(例如,本该填写表格却写成了信件)。
5. 结论
该论文总结道,虽然这些人工智能代理令人印象深刻,但它们尚未准备好成为完全自主的工人。它们就像一位博闻强记的实习生,知道很多事实,但需要持续的监督才能弄清楚如何完成工作。
作者构建 Agent-X 是为了进行一场“压力测试”,向我们确切展示这些机器人在哪里失败,以便研究人员修复其处理规划和工具使用的“大脑”中的特定部分。他们不仅仅在问:“你能回答这个问题吗?”他们问的是:“你能理清思路解决这个问题吗?”到目前为止,答案还是“还差一点”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。