DRAgent: Discriminative Reasoning Agent for Referring Expression Segmentation
DRAGent 是一种新颖的由多模态大语言模型(MLLM)驱动的指代性表达分割(Referring Expression Segmentation)框架,它通过采用一种判别式推理机制,从检测器生成的空间中选择最佳候选目标来引导基础分割模型,从而取代了直接的坐标生成,进而提升了定位精度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,存在着一个被称为“指代性表达分割”(referring expression segmentation)的特定挑战。想象一下,计算机正在观察一张照片,这时有人说:“找到那个坐在蓝色椅子上的红球。”目标不仅仅是识别出球和椅子的存在,而是要精确到像素级别,为那个特定的红球勾勒出轮廓。这种能力对于需要与物理世界交互的机器人和自主系统至关重要;如果机器无法首先准确识别出一个物体的起始与终点,它就无法抓取该物体。多年来,研究人员一直试图通过教导大型语言模型充当机器的“眼睛”来解决这个问题,让它们直接生成目标物体的坐标,就像书写一组地图导向指令一样。然而,这种方法有一个根本性的缺陷:当计算机试图将连续的视觉空间转化为字符串形式的文本数字时,它往往会迷失方向,导致生成的轮廓模糊或错误,尤其是在包含许多相似物品的拥挤场景中。
一组研究人员提出了一种解决这一难题的不同方法,将计算机的角色从“制图员”转变为“精心的选择者”。他们不再要求人工智能从零开始创造物体的位置,而是让一个独立的、专门的工具先撒下一张由候选对象组成的“大网”,标记出图像中看到的每一个潜在物体。随后,大型语言模型被赋予了一项更简单、更可靠的任务:查看这份标记好的可能性清单,并决定哪一个符合描述。这种被称为 DRAgent 的方法,将任务视为在选项中进行“辨析”,而非生成位置。系统首先对清单进行筛选,保留最可能的候选对象,然后对剩余的这少数几个选项进行第二次、更仔细的检查,以验证哪一个真正符合描述。一旦选定了正确的方框,分割模型就会利用该方框来绘制最终精确的轮廓。
研究人员发现,这种“筛选与验证”的两步走过程显著减少了困扰以往方法的错误。通过避免将视觉空间直接转换为文本坐标这一困难任务,该系统保持了词汇与图像之间更清晰的联系。为了让语言模型在选择过程中表现得更出色,团队开发了一种过滤掉不可靠推理的训练方法。他们教导模型进行自我检查,确保其用于挑选物体的逻辑确实与图像中可见的内容相符,而不仅仅是听起来很有道理。在包含数千张图像和复杂描述的标准基准测试中,这种新方法取得了极高的准确率,特别是在物体密集分布或描述冗长详细的场景下。研究结果表明,为了让机器真正理解视觉指令,让它们从一组明确的可能性中进行选择,往往比强迫它们凭空猜测答案更为有效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。