← 最新论文
💻 computer science

LlamaSeg: Image Segmentation via Autoregressive Mask Generation

LlamaSeg 是一个视觉自回归框架,通过将掩码编码为用于下一标记预测的视觉标记来统一多种图像分割任务,并由一个新的 2M 规模的 SA-OVRS 数据集和一种新型的基于豪斯多夫距离的指标提供支持,从而实现了卓越的掩码准确度和开放词汇定位能力。

原作者: Jiru Deng, Tengjin Weng, Tianyu Yang, Wenhan Luo, Zhiheng Li, Wenhao Jiang

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiru Deng, Tengjin Weng, Tianyu Yang, Wenhan Luo, Zhiheng Li, Wenhao Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你有一本神奇的素描本,它不仅能画出图像,还能完美理解你的话语。如果你对它说,“画出左边的那辆巴士”,它不会只是瞎猜;它会像绘制像素一样,精准地画出那辆特定巴士的轮廓。这就是 LlamaSeg 的核心理念——一种让计算机通过将图像视为一个逐词书写的“故事”来理解图像的新方法。

旧方法 vs. 新方法

长期以来,试图在照片中寻找物体的计算机一直采用“接力赛”模式。首先,一个 AI 会猜测物体是什么(比如说“巴士”),然后将这个猜测传递给第二个专门用于绘制轮廓的 AI。这就像是请一位朋友描述一辆车,然后把这段描述交给另一位朋友去画。这种方法虽然可行,但很笨拙,且需要两类不同的专家。

其他方法尝试通过列出坐标来绘制轮廓,比如说“从点 1 开始,到点 2,再到点 3”。但这就像试图通过列出数百个微小的步骤来画出一个复杂的形状;这会让过程变得混乱且缓慢。

LlamaSeg 抛弃了接力赛和坐标列表。相反,它将掩码(即轮廓)视为一个视觉故事。它将图像分解成被称为“token”(标记)的微小拼图块。正如语言模型预测句子中的下一个词一样,LlamaSeg 通过预测下一个“视觉 token”来构建掩码。这就像计算机正在根据你的文本提示,一个微小的方块接一个微小的方块地“写出”巴士的轮廓。

秘密武器:一个庞大的新库

要教会计算机完成这项任务,你需要一个庞大的示例库。作者意识到现有的库规模太小或多样性不足。因此,他们构建了一个名为 SA-OVRS 的新库。

可以将 SA-OVRS 想象成一本巨大的、组织极其严密的相册,其中包含了 200 万个不同的物体。但最酷的部分在于:每一个物体不仅仅是被标记为“椅子”或“狗”。它拥有丰富的、开放词汇的描述。其中一张椅子可能被标记为“那把带断腿的红椅子”,而另一张则是“左边的椅子”。该数据集包含超过 5,800 种不同类型的标签和描述,涵盖了从日常用品到复杂场景的一切。他们通过两个步骤构建了这个数据集:首先,将图像与标签进行匹配;其次,利用 AI 为每个物体编写独特的描述性句子,以确保计算机能够区分相似的事物。

它的表现如何?

作者在几个标准挑战赛上测试了 LlamaSeg,以观察它是否真的能比旧方法画得更好。

  • 计分板:ADE20KCOCO-Stuff 等常见图像数据集的测试中,LlamaSeg 的得分高于之前的“视觉生成式”模型。例如,他们的较大模型(LlamaSeg-L)在 ADE20K 上达到了 52.0 分,在 COCO-Stuff 上达到了 55.7 分。与甚至规模更大的其他生成式模型相比,这是一个显著的飞跃。
  • “边缘”测试: 画出物体的内部很容易;但画出完美的边缘却很难。作者发明了一个新的衡量标准,称为 dAHD(平均豪斯多夫距离)。分数越低,意味着边缘越接近真实情况。LlamaSeg 在这项测试中得分极低(例如在 ADE20K 上为 25.54),这意味着它的轮廓比其他生成式模型更加锐利和准确。
  • 速度: 由于 LlamaSeg 是像写句子一样逐个 token 地写入掩码,所以它比一些旧的并行方法要慢。然而,它仍然比其他尝试做同样事情的生成式模型快得多。例如,它的运行速度为 0.250 FPS(每秒帧数),这相对于竞争模型 Unified-IO2-Large 的 0.017 FPS 来说是一个巨大的进步。

作者并未声称的内容

了解这篇论文没有表达的内容也很重要。作者明确反对认为在语言模型猜出物体后,必须使用一个单独的“专家”模型来绘制掩码的观点。他们证明了一个统一的系统可以完成整个工作。

他们还指出,虽然他们的模型在画边缘方面表现出色,但在某些特定的指代分割任务中,仍然落后于专门的“判别式”模型(即那些传统的专家模型)。他们并不声称解决了所有问题;他们只是展示了这种全新的“像写故事一样绘图”的方法是一种强大的、统一的方式,可以非常接近目前最好的结果。

总结

LlamaSeg 表明,如果你将图像分割视为一个语言问题——即计算机通过逐个 token “写出”掩码——那么你可以在不需要不同 AI 专家团队的情况下,获得极其精确的结果。通过在他们全新的 200 万样本数据集上进行训练,他们证明了这种方法可以产生比以往生成式方法更精细、更准确的掩码,从而证明了有时,最好的画画方式就是去“写”出来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →