COCOTree: A Dataset and Benchmark for Open Tree-Structured Visual Decomposition
本文介绍了 COCOTree,这是一个面向开放树状视觉分解的大规模数据集与基准,它利用自动化大型视觉语言模型(LVLM)与 SAM 3 流水线,在 2.1 万张图像上生成了 180 万个层级节点,并配套提出了一种新的评估指标(OTQ),用于衡量掩码精度、标签准确性以及结构一致性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在看一张繁忙厨房的照片。
旧方法:
传统的计算机视觉工具查看这张照片时会说:“我看到了一个人、一张桌子和一把椅子。”它们甚至可能把人分解得稍微细致一点:“头部、躯干、手臂。”但它们就止步于此。它们将图像视为物品的扁平列表。如果你问计算机:“那个安装在橱柜上的把手是什么?”它可能只会看到一个漂浮在空中的“把手”。它不知道这个把手属于橱柜,而橱柜属于厨房,也不知道这个把手是由特定的旋钮和螺丝组成的。它缺乏物体之间的“家谱”。
新方法(COCOTREE):
这篇论文介绍了COCOTREE,这是一种教导计算机不再将世界视为扁平列表,而是视为一棵巨大的、分叉的家谱树的新方法。
把它想象成一个俄罗斯套娃或一棵有根有枝的树:
- 树根: 整张图片是树干。
- 树枝: 树干分裂成大物体(一个人、一个橱柜)。
- 细枝: 这些物体分裂成部件(橱柜分裂成一扇门、一个架子和一个把手)。
- 树叶: 部件进一步分裂(把手分裂成一个旋钮和一个螺丝)。
目标是描绘出物体每一个可见的部分,一直深入到最微小的细节,并将它们以逻辑层级连接起来。
他们是如何构建这个的?(机器人厨师)
手工为成千上万张照片构建这样的地图是不可能的。让人类去标记每一个螺丝和铰链将耗费数年光阴。
相反,作者们构建了一个**全自动的“机器人厨师”**来替他们完成这项工作。这个机器人使用两个强大的 AI 工具协同工作:
- 大脑(LVLM): 大型视觉 - 语言模型扮演一位好奇的厨师。它观察图像并说:“我看到了一个橱柜。里面有什么?啊,一个架子和一个把手!”它利用“常识”来推测存在哪些部件。
- 双手(SAM 3): 一个精确的分割模型扮演一双稳定的手。一旦“大脑”猜出“把手”,“双手”就会在照片中那个特定的把手周围画出完美的轮廓。
过程:
机器人从整张图片开始。它让“大脑”找出主要部分。“双手”在它们周围画线。然后,机器人只取“橱柜”这一部分,放大图像,再次询问“大脑”:“现在我只看橱柜,我看到了什么?”“大脑”回答:“一扇门和一个把手。”“双手”画出它们的轮廓。这个过程不断重复,递归进行,直到机器人找不到更多更小的部件为止。
结果:一个庞大的树状图书馆
结果是COCOTREE,这是一个包含超过21,000 张图像和180 万个结构节点(物体部件)的数据集。
- 无约束: 与旧数据集仅知道 80 或 100 个特定词汇(如“狗”或“汽车”)不同,该数据集使用“开放词汇”。如果它看到了一个奇怪、独特的物体,它可以用一个长长的、具体的描述来标记它。
- 深度: 它比以前的方法深入得多。旧数据集可能止步于“门”,而这个数据集会深入到“门 -> 把手 -> 旋钮 -> 螺丝”。
- 已验证: 作者们并没有仅仅信任机器人。他们让 20 名人类审查员检查了这项工作。人类审查员一致认为,机器人的“家谱”是准确的,并且与人类看待世界的方式相符。
我们如何给机器人打分?(OTQ 分数)
你如何给一份答案复杂如树状的测试打分?你不能仅仅检查机器人是否正确地识别了“汽车”。你必须检查:
- 它是否正确画出了车轮的轮廓?(掩膜精度)
- 它是否将其称为“车轮”而不是“轮胎”?(标签准确性)
- 它是否正确地将其归入“车轮在汽车下,轮胎在车轮下”的层级?(结构一致性)
为此,他们创建了一个名为**OTQ(开放树质量)**的新评分系统。这就像一份成绩单,根据机器人画图、命名部件以及组织家谱的优劣程度给出一个单一分数。
总结
简而言之,COCOTREE是一个庞大的、自动生成的图书馆,它教导计算机分层地观察世界。它超越了仅仅关注“图片里有什么”,转而关注“图片中的事物是如何构建和连接的”,利用 AI 机器人团队来构建地图,并由人类审查员确保地图的准确性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。