MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents
本文介绍了 MM-ToolSandBox,这是一个包含 500 多个工具和 258 个经人工验证的场景的具有状态环境的统一框架与基准测试,用于评估视觉工具调用智能体,并揭示了当前模型在视觉精度方面存在显著困难,且失败模式从较小模型的规划缺陷转向了较大模型的感知错误。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人助手,它能读取你发送的图像,操作模拟应用,并组织任务。听起来像魔法,对吧?好吧,苹果公司的一个团队构建了一个巨大的、高科技的游乐场,叫做 MM-ToolSandBox,以此来观察这些机器人是否真的能够处理现实生活中混乱且具有视觉性的现实。
以下是详情:他们不仅仅是要求机器人阅读文本;他们向机器人投掷了一个巨大的视觉谜题。
这个游乐场:一个有状态的视频游戏
把 MM-ToolSandBox 想象成一个视频游戏,其中分布着 511 种不同的工具(比如购物车、音乐播放器、日历和文件管理器),横跨 16 个不同的模拟世界。但这里的转折在于,这个游戏是“有状态的”(stateful)。这意味着,如果你在第一轮买了一根香蕉,那么在第二轮,这根香蕉会确实出现在你的购物车里。机器人必须记住它做了什么,追踪不断变化的世界,并处理多轮对话——在对话过程中,你可能会中途改变主意。
更酷的是,机器人必须查看你发送给它的图像。你可能会拍一张演唱会海报的照片并说:“买这张票!”或者发送一张杂乱表格的截图并说:“找出总数。”机器人必须阅读图片,弄清楚该使用哪个工具,并在这种模拟环境中真正地执行这件事。
测试:258 个棘手的场景
研究人员并没有随心所欲地编造任务。他们构建了一个能够生成 258 个经过人类验证的场景(外加 50 个针对交互式屏幕的特殊场景)的机器。这些场景并不容易。它们包括:
- 渐进式到达: 你在聊天进行到一半时发送一张图片,机器人必须在稍后记住它。
- 目标变更: 你说,“预订航班”,然后五分钟后又说,“其实,算了,我们改去海滩吧。”
- 错误修正: 你在照片中不小心写错了日期,机器人必须捕捉到这个错误。
他们测试了世界上 12 个最聪明的 AI 模型,从微小的开源模型到最大、最昂贵的“前沿”系统。
大揭秘:机器人依然笨拙
这里是重点:即使是世界上最好的机器人,也有一半以上的失败率。
表现最好的模型 Claude 4.5 Opus 仅完成了 48.8% 的任务。这意味着它在超过一半的场景中失败了。论文明确排除了这些模型已经“解决”了视觉工具调用(visual tool calling)的可能性。它们仍然在挣扎。
“为什么”:两个失败的故事
研究人员进行了深入调查,以找出机器人失败的原因,他们发现了一个有趣的模式,且这个模式会随着机器人“大脑”的大小而变化。
小机器人(“我该做什么?”的问题):
较小的模型(例如 40 亿参数的模型)主要失败在无法进行规划。它们看到了图片,知道用户想要什么,但在试图搞清楚应该按哪些按钮或使用哪些工具时迷失了方向。它们就像一个知道要烤蛋糕,却不知道如何打开烤箱的孩子。大机器人(“我看到了什么?”的问题):
那些巨大的模型(例如 3970 亿参数的模型)非常擅长规划。它们准确知道该使用哪些工具以及按什么顺序使用。但它们失败是因为它们无法正确读取图片。- 统计数据: 最强模型的失败中有 53% 是“事实性错误”。
- 比喻: 想象一位出色的厨师,他知道制作蛋糕的确切食谱。他拿好食材,完美地混合,然后烘焙。但是,当他看向你发送的巧克力棒照片时,他读错了标签,抓起了一块黄油而不是巧克力。他做对了一切,唯独在阅读视觉线索时出了错。
这表明存在一种“交叉”效应:随着模型变大,它们不再失败于“规划”,而是开始失败于“感知”。
“UI”噩梦
研究人员还尝试了一种模式,即让机器人为你绘制一个可点击的屏幕以便你进行交互(类似于一个微型应用)。这甚至更加困难。最好的模型在这种模式下的成功率降至仅 26%。事实证明,让一个机器人不仅能阅读屏幕,还能即时绘制出一个功能完备的新屏幕,是一个目前尚未攻克的巨大挑战。
核心结论
论文指出,虽然我们在教机器人思考和规划方面取得了进步,但我们在视觉精准度上遇到了瓶颈。机器人足够聪明,知道自己要做什么,但它们在阅读你发送的照片中的细节时仍然太笨拙了。
作者们总结道,视觉工具调用远未解决。即使是当今最强大的模型也未能达标,解决这个问题需要一种全新的研究方向,专注于让机器人看得更清,而不仅仅是思考得更深。该框架和测试结果现已公开,其他科学家可以利用这些资源,帮助机器人更好地理解和阅读这个世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。