CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning
CMAP 引入了一种参数高效的多领域任务增量学习框架,该框架利用 CLIP 尚未被开发的文本嵌入空间来实现鲁棒的任务路由、置信度估计和编码器自适应,在无需外部数据或任务身份信息的情况下,于 MTIL 基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在聘请一位超级聪明的艺术评论家,他早已读过数百万本书籍,看过数百万幅画作。这位评论家(即 AI 模型)能够仅凭文字就完美地描述“猫”或“汽车”。然而,你希望教会这位评论家逐一识别新的、特定的物体类型(例如某种特定品种的狗或一种罕见的花卉),且不再向他们展示任何旧有的示例。
在这种情境下,最大的问题在于遗忘。如果你教这位评论家识别“金毛寻回犬”,他们可能会忘记如何识别“暹罗猫”。如果你教得太激进,当他们看到尚未学习过的新型鸟类时,可能会感到困惑。
当前的方法试图通过仅查看图片来解决这一问题。它们会问:“这张新照片是否像我以前见过的照片?”论文认为,这就像试图仅通过看鞋子来在人群中识别一个人,而忽略了其面部和声音。这种方法效率低下且容易出错,尤其是在你缺乏足够照片供学习时。
作者提出了一种名为CMAP(跨模态自适应提示)的新系统。以下是其工作原理,辅以简单的类比:
1. “基于文本的身份卡”(文本空间任务路由)
旧方法:当新照片到来时,旧系统会尝试将其与它见过的模糊照片云进行匹配。如果照片略有不同(例如处于不同姿势的狗),系统就会困惑于该照片属于哪个“任务”(类别)。
CMAP 方法:CMAP 不根据照片的外观进行猜测,而是查看类别的文本描述。它会问:“这张照片是否符合‘金毛寻回犬’或‘暹罗猫’的概念?”
- 类比:想象你有一个图书馆。与其试图通过观察某人衬衫的颜色(视觉)来猜测他们在找哪本书,不如直接问他们:“哪个书名听起来像是你在找的?”(文本)。由于书名(文本原型)永远不会改变,即使你只有一两张照片可供学习,这种方法也极其稳定。其设置无需额外成本。
2. “双重检查系统”(多原型置信度)
旧方法:系统假设每个物体看起来都完全一样(就像一个完美的圆形)。如果照片有点奇怪或模糊,系统就会不确定,并可能猜错。
CMAP 方法:CMAP 意识到“狗”可以呈现出多种不同的样子(奔跑、睡觉、侧面视角)。它为每个类别创建了多个“思维快照”(原型)。
- 类比:系统不再只有一条关于“什么是狗”的规则,而是保留了一个文件夹,里面有三张不同的狗的素描:一张在奔跑,一张在睡觉,一张在坐着。当新照片进来时,它会对照这三张素描进行检查。
- 转折:它不仅仅检查素描;它还会检查文本描述。它会问:“这张照片看起来像素描吗?并且它是否符合‘狗’这个词?”如果两者一致,系统就会非常有信心。如果它们不一致,系统就会知道需要谨慎行事。
3. “同步守门人”(对称跨模态门控)
旧方法:系统有两扇门:一扇用于图像,一扇用于文本。过去,如果图像门关闭(因为照片奇怪或未知),文本门仍然会保持大开。这会导致不匹配,就像翻译在说听众听不懂的语言一样。
CMAP 方法:CMAP 安装了一个联动机制。如果图像门因为照片令人困惑而关闭,文本门也会在同一时间完全关闭。
- 类比:想象博物馆里的一名保安。如果保安看到一幅可疑的画作(图像),他们会立即锁上音频导览(文本),以免访客因混合信号而感到困惑。这确保了“图片”和“文字”即使在系统遇到从未见过的事物时,也能保持完美和谐。
结果
作者在涉及11 个不同数据集(从汽车到花卉再到手写数字)的庞大挑战中测试了该系统,涵盖超过1,200 个不同类别。
- 性能:CMAP 以显著优势击败了之前的最佳方法(准确率提高了约 3 到 5 个百分点)。
- 效率:它仅增加了极少量的“算力”(约 250 万个可调整参数),这大约相当于一个小应用程序的大小,而无需重新训练整个庞大的模型。
- 数据稀缺性:当系统仅获得极少的示例(每个类别仅 16 张照片)供学习时,其表现尤为出色,这证明了使用“文本身份卡”比单纯盯着更多照片学习是一种更聪明的学习方式。
简而言之:CMAP 教导 AI 在观察图片的同时,也要倾听其内部的“文本声音”来学习新任务。这防止了 AI 遗忘旧知识,帮助其处理奇怪的输入,且无需庞大的计算机或海量的过往照片库即可完成这一切。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。