Generalizable Vision-Language Few-Shot Adaptation with Predictive Prompts and Negative Learning
本文介绍了 SCAN,这是一个无参数的视觉 - 语言少样本适应框架,它通过采用查询特定的负向路由、大语言模型生成的对比提示以及自适应融合权重,有效应对查询特定的类别混淆和分布偏移,从而提升性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个非常聪明但略显僵硬的机器人识别不同种类的鸟类。你只有每种鸟的少量照片可供展示(这被称为“少样本学习”)。该机器人已经通过阅读整个互联网掌握了大量世界知识,但当两只鸟看起来非常相似时(例如红尾鵟和红肩鵟),它仍然会感到困惑。
这篇论文介绍了一种名为SCAN(选择性混淆感知负样本)的新方法,旨在解决这种混淆。其工作原理可分解为三个简单的理念:
1. “智能保安”(查询自适应路由)
旧方法: 想象博物馆里的一名保安,每当有访客进入,他都会对着博物馆里的每一个物体大喊:“你不是画,你不是雕像,你不是花瓶……"这种嘈杂混乱的声音无助于访客弄清楚他们实际在看什么。机器人也是如此:它试图告诉每张图像它不是什么,即使该图像根本不可能与那些事物混淆。
SCAN 方法: SCAN 扮演一名智能保安,他会先观察访客。如果访客看起来像鵟,保安只会低声说:“你肯定不是红肩鵟”,因为那是唯一可能让你混淆的对象。保安会忽略所有其他鸟类(如企鹅或火烈鸟),因为你显然不是它们。
- 为何有效: 通过仅聚焦于图像最可能混淆的特定对象,机器人能做出更清晰的判断,而不会被无关的噪音分散注意力。这一过程无需额外的内存或训练。
2. “专家艺术评论家”(大语言模型引导的提示)
旧方法: 当向机器人描述鸟类时,旧方法可能只会说:“这是一张红尾鵟的照片。”如果机器人看到一只相似的鸟,它可能会想:“嗯,那也是一张鸟的照片,所以也许就是同一只。”这种描述过于模糊。
SCAN 方法: SCAN 聘请了一位AI 艺术评论家(大语言模型)来撰写更佳的描述。评论家不只是命名鸟类,而是会说:“这是一只红尾鵟,你可以将其与红肩鵟区分开来,因为红尾鵟拥有锈色的尾巴和白色的腹部,而另一只则有条纹状的尾巴。”
- 为何有效: 它为机器人提供了区分相似物品的具体“线索”。这就像是在说“别吃那个”与“别吃那个蘑菇;它看起来像可食用的那个,但它有红色斑点”之间的区别。
3. “直觉平衡秤”(自适应融合)
旧方法: 机器人有两种思考方式:观察图片(视觉)和阅读描述(文本)。通常,人类必须手动决定在多大程度上信任图片而非文本。这就像试图通过猜测每一侧有多重来平衡天平。如果猜错了,机器人就会感到困惑。
SCAN 方法: SCAN 拥有一架魔法天平,能自动确定平衡点。如果图片非常清晰且独特,天平会倾向于更信任图片;如果图片模糊但名称差异很大,天平则会倾向于更信任文本。它通过查看你提供的少量示例,即时决定最佳混合比例,无需人类猜测。
结果:效果如何?
作者在 11 项不同的挑战中测试了这套“智能保安”系统,涵盖从识别花卉到发现汽车和纹理等任务。
- 得分: 平均而言,在给定 16 个示例的情况下,SCAN 的准确率比之前的最佳方法高出4.6%。
- 重大突破: 它在最困难的任务中表现最为出色(例如区分非常相似的鸟类或汽车),准确率提升了高达7.7%。
- 棘手情况: 即使数据混乱(例如 50% 的标签错误,就像老师在试卷上标错了答案),SCAN 的表现仍优于竞争对手。它也非常擅长识别那些从未见过的、但在不同光照或风格下(例如猫的素描而非照片)略有变化的事物。
总结
简而言之,SCAN 教导机器人停止对一切事物大喊“不!”,转而只对那些重要的事物低声说“不!”。它利用一位聪明的评论家来解释事物为何不同,并自动知道是应该信任眼睛还是大脑。这使得它仅凭少量示例就能更好地学习新事物。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。