Visual-Prompt Guided Wildlife Instance-Level Recognition
本文提出了一种用于细粒度野生动物重识别的一阶段端到端模型,该模型集成了 DINOv2 和 MegaDescriptor,并利用提示引导的潜在查询(prompt-guided latent queries)来同时进行身份搜索和目标检测,实现了与传统两阶段流水线相比具有竞争力的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在非洲广袤而阳光明媚的稀树草原上,辨别不同动物之间的差异,长期以来一直是人类观察者以及我们用来监测它们的机器所面临的挑战。虽然现代摄像机可以轻松识别出斑马是斑马或猎豹是猎豹,但要识别群体中的特定个体则是完全不同的故事。这是因为每只斑马都携带一张独特的条纹地图,每只猎豹都拥有独特的斑点星座,就像人类的指纹一样。对于研究野生动物的研究人员来说,识别这些个体身份对于追踪种群健康、迁徙模式和生存率至关重要。直到最近,计算机解决这一难题最有效的方法仍需要一个两步走的过程:首先,机器会扫描照片以寻找并裁剪出它能看到的所有动物,然后,在第二个独立的步骤中,它会将裁剪出的碎片与已知个体的数据库进行比对以寻找匹配项。这种方法虽然可行,但过程缓慢、碎片化,并且在动物拥挤或部分遮挡时经常表现不佳。
来自南非和瑞典的一个研究小组提出了一种应对这一问题的新方法,他们认为机器可以直接在完整场景中寻找特定的动物,而无需先将图像切割开。他们的研究方法详述于最近的一项研究中,该方法将寻找特定动物的过程视为不是一场“寻找并裁剪”的游戏,而是计算机与图像之间的一次直接对话。系统不再盲目地扫描任何动物然后再试图猜测它是谁,而是被赋予了一个“视觉提示”——即研究人员正在寻找的那只特定斑马或猎豹的小图。随后,计算机利用这个提示扫描整张照片,在寻找该特定条纹或斑点模式的同时,也弄清楚了动物站在哪里。这是一个将寻找动物的行为与识别动物的行为结合在一起的单一且流畅的过程。
为了实现这一点,研究人员构建了一个借鉴了两种强大人工智能类型的系统。系统的其中一部分经过训练以理解场景的宏观几何结构,了解如何观察景观的形状以及物体之间的空间关系。另一部分则是专门针对野生动物进行训练的专家,能够识别区分不同个体的精细且复杂的细节。在他们的设置中,系统接收一张完整的动物群照片和一张目标动物的小型参考图像。然后,它使用一种机制,让参考图像向完整的场景“询问”匹配的动物躲在哪里。这个过程是在单个阶段完成的,这意味着计算机不会停下来裁剪图像或将其传递到第二个过滤器;它在一个步骤内就完成了定位目标并为其画框的工作。
研究结果令人期待,尽管研究人员谨慎地指出这项工作仍处于早期阶段。当他们在长颈鹿和斑马的图像上测试该系统时,即使在困难条件下,例如动物距离较远、被其他动物部分遮挡或融入背景时,系统也能成功定位并识别特定动物。该系统在衡量其寻找并识别正确个体的准确度方面得分为 30.584%。虽然这低于传统两步法取得的 44.89% 的得分,但新方法在效率方面具有显著优势。它通过单次处理图像来获得结果,而旧方法则需要多个不同的处理阶段。研究人员发现,即使在个体重叠的密集兽群中,他们的系统也能在目标动物周围画出紧凑且准确的框。
这项研究表明,这种直接的方法在未来的野生动物监测领域具有巨大的潜力。通过允许计算机在完整的场景语境中直接搜索特定的身份,该系统模拟了人类观察者观察兽群并发现熟悉面孔的方式,而无需先隔离出每一只动物。虽然当前版本在原始准确度上尚未超越既有的两步法,但研究人员相信,完善这一单阶段过程最终可以催生出既更快又更准确的系统。研究结果表明,视觉提示可以有效地引导机器不仅理解图像中有什么,还能理解确切是谁在那里,这为更高效、更智能地保护和研究自然世界打开了大门。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。