From Bounding Boxes to Visual Reasoning: An On-Policy Data Annotation Tool for Vision-Language Models
本文介绍了 ScreenAnnotator,这是一个开源的在策略(on-policy)数据标注工具,它通过将空间、语义和结构原语统一到单一模式中,弥合了边界框与视觉推理之间的鸿沟,从而实现了高效的数据合成,并显著提升了视觉语言模型在复杂推理任务上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个非常聪明但目前还很笨拙的机器人去理解复杂的图片,比如流程图或移动应用界面。你希望机器人不仅仅是说“这里有一个框”,而是能解释这个框是什么、它为什么在那里,以及它如何与其他框进行连接。
目前我们用来“教”机器人的工具(称为标注工具)存在问题,它们就像过时的剪贴板。它们擅长在猫的周围画一个简单的方框并写上“猫”,但对于现代机器人所需的复杂、多层级的指令来说,这些工具太差了。它们僵化、缓慢,而且一旦你教会了机器人一件事,你就必须从头开始教另一件事。
本文作者开发了一个名为 ScreenAnnotator 的新工具来解决这个问题。以下是它的工作原理,使用简单的类比来解释:
1. “全能型”乐高积木 (统一标注原子)
旧工具将图片的地理位置、名称和描述视为三张独立的纸。如果丢失了其中一张,数据就会损坏。
ScreenAnnotator 创建了一个“超级积木”(称为标注原子)。想象一个拥有以下属性的乐高积木:
- 一个 GPS 坐标(它在哪里)。
- 一个名称标签(它是什么)。
- 一段写在上面的详细故事(自由格式的描述)。
- 一系列特定的特征(比如“坐着的”、“棕色的”或“紧急的”)。
通过将所有这些信息粘合进一个单一单元中,机器人得到了一个更丰富、更完整的世界图景。
2. “副驾驶”训练循环 (在策略标注)
通常,教机器人是一个单行道:人类画框,然后机器人学习,然后人类再画更多的框。机器人从不帮助人类。
ScreenAnnotator 将其变成了一场舞蹈。
- 第一步: 机器人(“副驾驶”)观察一张新图片,并尝试猜测方框的位置及其含义。
- 第二步: 人类查看机器人的猜测。如果机器人是对的,人类只需说“做得好!”(节省时间)。如果机器人错了,人类就进行修正。
- 第三步: 机器人立即从这次修正中学习,并在观察下一张图片之前变得更好。
结果: 起初,机器人很笨拙,需要很多帮助。但随着它的学习,它变得越来越好,以至于人类几乎不需要再去触碰屏幕。论文显示,对于流程图,机器人最终能几乎 100% 地自主完成;而对于应用界面,它的自主正确率达到了 77%。人类的工作从“动手做”转变为“检查工作”。
3. “测谎仪” (贝叶斯标注验证器)
即使有了“副驾驶”,错误仍然会发生。你如何知道机器人是否在自信地犯错?
该工具包含一个特殊的测谎仪(称为贝叶斯标注验证器)。这不是人类,而是一个聪明的算法,充当质量控制检查员。
- 它查看机器人绘制的每一个方框,并询问:“我们对这个结果有多大把握?”
- 如果机器人表现得很自信,但数学计算显示其结果并不稳固,测谎仪就会将其标记出来。
- 这些“可疑”的项目会被送回给人类进行第二次检查。
这确保了机器人不会从自己的错误中学习。论文发现,这个工具在检测前 1% 被标记项中的错误方面极其出色,其效果是随机抽取图片检查的 2 到 3 倍。
4. “食谱手册” (模板驱动合成)
这是最大的省时之处。通常,如果你想教机器人执行一项新任务(比如“数方框的数量”或“寻找从 A 到 B 的路径”),你必须雇佣人类重新标注数千张图片。
ScreenAnnotator 使用了食谱手册的方法。
- 一旦人类使用“超级积木”(第一步)标注了图片,系统就可以从这同一张标注过的图片中自动生成数千个不同的问题和答案。
- 这就像拥有一种高质量的食材(标注过的图片),然后使用模板同时烤出蛋糕、派和饼干。
- 你不需要重新标注图片,你只需要改变“食谱”(模板)来提出不同的问题。
最终成果
作者在两类对象上测试了该工具:流程图(展示过程的图表)和移动应用截图。
- 效率: 随着机器人变得越来越聪明,标注图像所需的时间显著下降。
- 更聪明的机器人: 当他们使用来自 ScreenAnnotator 的数据来训练机器人时,机器人理解流程图的能力从 41% 的准确率跃升至 76.1%。这是一个巨大的飞跃,证明了更好的数据工具可以创造更聪明的机器人。
简而言之: ScreenAnnotator 是一个让机器人协助人类标注数据、自动捕捉机器人错误,并能将一张标注过的图像转化为数百个不同训练练习的工具,它使整个过程更快、更便宜且更有效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。