OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories
该论文介绍了 OpenVisTool,这是一个通过同时筛选答案正确性和工具观测结果的因果贡献来合成指令性视觉工具使用轨迹的框架,从而产生了一个能够显著提升多模态智能体性能的数据集和基准测试,教导模型将工具使用扎根于证据而非仅仅模仿调用模式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何破解谜题。你拥有一个巨大的线索(图像)图书馆,以及一套特殊的放大镜(工具),它们可以放大、裁剪或突出显示图片的特定部分。在人工智能的世界里,这些“多模态智能体”正变得越来越聪明,但它们经常会遇到一个瓶颈:它们只能看到初始快照中的内容。如果线索隐藏在微小的文字或模糊的角落里,机器人就会错过它。为了解决这个问题,科学家们正在教机器人如何在回答之前,主动使用它们的放大镜来收集新的证据。但棘手的部分在于:仅仅因为机器人使用了工具并得到了正确答案,并不意味着这个工具真的起到了作用。也许机器人早就从记忆中知道了答案,只是因为被要求使用工具而假装在使用。这篇文章提出了一个至关重要的问题:我们如何教机器人仅在真正需要时才使用工具,而不是仅仅模仿使用工具的习惯?
这项研究背后的研究人员提出了名为 OpenVisTool 的观点,认为目前训练这些机器人的方式是有缺陷的。他们说,仅仅向机器人展示一个使用工具并得到正确答案的“成功”故事,就像是给学生看一份数学考试卷,学生虽然猜对了答案,但仍然写下了每一个复杂的公式步骤。学生学到的是“写公式能拿到高分”,但他们并没有学到为什么需要这个公式。作者提出了一种更严格的新型训练数据配方。他们坚持认为,只有当两件事同时发生时,一个训练样本才是有效的:首先,机器人得到了正确答案(结果有效性,Outcome Validity);其次,机器人确实需要该工具才能达到目标(因果效用,Causal Utility)。如果机器人无需工具也能解决问题,那么这个样本就会被剔除。
为了证明这一点,团队构建了一个庞大的新数据集 OpenVisTool-42K,其中包含 42,000 个经过精心筛选的样本,涵盖了五种不同的视觉世界:阅读图表、分析表格、导航计算机屏幕、搜索视觉细节以及将网页转化为代码。他们使用了一个三步走的过程来创建这个数据集。首先,他们筛选出了机器人不使用工具就无法解决的“难题”。第二,他们让一个超级聪明的“老师”机器人利用针对每种谜题设计的特定策略来解决这些问题。最后,他们进行了一项严格的“监督验证”测试:他们提取老师的解决方案,并让一个较弱的“学生”机器人解决同一个问题。如果学生机器人在没有老师的工具笔记时失败,但在有了笔记后成功了,那么这个样本就会被保留;如果学生机器人无论有没有工具都能解决问题,该样本就会被视为“冗余”并被丢弃。
结果令人印象深刻。当研究人员使用这个新数据集对四种不同的机器人模型(参数量从 40 亿到 270 亿不等)进行微调时,这些机器人在使用工具方面变得明显更好。在他们的自定义测试平台 OpenVisTool-Bench 上,模型的表现平均提升了 10.7 分。最大的飞跃出现在视觉搜索领域,模型提升了 23.8 分。更令人兴奋的是,在这些数据上训练的小型开源模型,其表现几乎可以媲美通常在领域内占据主导地位的巨型闭源模型(如 GPT-5.5)。例如,经过 OpenVisTool-42K 训练的 Qwen3.5-9B 模型平均得分 45.8,超过了不带工具的 GPT-5.5(得分为 41.9),并且非常接近带工具的 GPT-5.5(得分 49.0)。
研究还发现,这种新的训练方法教授了一种适用于不同类型谜题的“元技能”。当他们测试经过训练的机器人在处理从未见过的任务(分布外任务)时,这些机器人的表现仍然优于那些使用旧的、不够严格的数据进行训练的机器人。然而,作者也发现,仅针对一种类型的谜题(如仅针对图表)进行训练有时会损害在其他类型(如网页)上的表现,这表明混合多种挑战是最好的。最终,论文表明,教机器人使用工具的秘诀不仅是向它们展示成功的案例,更是要向它们展示那些工具作为“真正英雄”的案例。通过过滤掉“虚假”的工具使用,OpenVisTool 不仅帮助机器人学习如何使用放大镜,还帮助它们学习何时真正需要拿起放大镜。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。