Continual Visual Learning under Evolving Semantic Concept Shift
本文介绍了 SemReWrite,这是一个旨在通过选择性地更新过时的视觉-语义映射并保留有效知识,来处理视觉基础模型中演进的语义概念偏移的框架,并通过一个新的基准测试(EvoShift-Bench)和专门的评估指标进行了验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个命名规则发生变化,但事物本身保持不变的世界。在每一张照片中,汽车依然是汽车,但一项新的交通法规可能会突然要求我们根据此前被忽略的细微细节,将车辆区分为“私家车”、“商用卡车”和“应急响应车”。同样地,一只曾经被简单称为“麻雀”的鸟,可能会因为一项新的科学研究而被重新分类为两个不同的物种;或者一个工厂缺陷可能会因为更严格的安全标准而被重新定义。这正是长寿计算机视觉系统所面临的现实:视觉世界保持不变,但我们赋予它的意义却在演变。几十年来,人工智能研究人员一直致力于教计算机即使在光照变化或相机角度偏移时也能识别物体。然而,一个新的挑战出现了:我们如何教计算机在不抹除已学知识的前提下,更新其意义的词典?
一个研究团队通过开发一种名为 SemReхere 的新框架解决了这一问题。他们的工作针对的是一种特定且困难的情景,即“演进式语义概念漂移”(evolving semantic concept shift)。在这种情况下,AI所看到的视觉证据并未改变,但该证据所代表的定义发生了变化。考虑一个自动驾驶系统,它最初将所有移动车辆视为同一类别。随后,一项新政策要求系统将乘用车与应急车辆区分开来,因为它们需要采取不同的行动。这些车辆的图像看起来完全相同,但对计算机而言,正确答案已经发生了根本性的变化。传统的 AI 模型更新方法通常在此失效。如果你仅仅根据新规则重新训练模型,它可能会学会新的区别,却忘记了如何处理那些仍然有效的旧类别。如果你过于严格地保护旧知识,模型可能会拒绝学习新规则。研究人员发现,解决方案不在于在“学习”与“记忆”之间做选择,而在于有选择性地同时实现两者。
他们方法的核心是一个像精明编辑而非空白画布般的系统。当语义规则发生变化时,系统首先分析旧定义与新定义之间的差异。它利用少量带有更新规则标签的新样本,精准定位视觉世界的哪些部分受到了这种变化的影响。例如,如果规则变为区分车辆类型,系统会识别出车辆的大小或形状等视觉特征现在变得至关重要,而道路或天气的特征对于新定义而言则不再相关。一旦系统明确了变化发生的位置,它就会仅对模型决策过程中受影响的特定区域进行针对性的更新。处理世界中未发生变化部分的其余模型部分则保持不动。这确保了系统在学习新定义的同时,不会意外地遗忘那些原本正确的旧定义。
为了测试这一想法,研究人员创建了一个名为 EvoShift-Bench 的新基准测试,模拟了意义演变的各种方式。他们测试了单类别分裂为两个、两个类别合并为一个、类别边界发生偏移以及插入全新类别等场景。他们还测试了视觉世界外观与定义同时发生变化的情况,例如,一个基于清晰照片训练的系统必须适应素描或低光照图像。在这些测试中,该新框架始终优于现有方法。虽然其他方法要么无法学习新规则,要么遗忘了旧规则,但这种选择性重写方法在两方面都取得了高分。它成功学习了新的区别,同时保留了未改变概念的准确性。
结果表明,该系统具有极高的效率。它可以使用极少的样本——有时每个新类别仅需一两个图像——来学习这些新的语义规则。这至关重要,因为在现实世界中,获取大量标注正确的图像往往既困难又昂贵。研究人员还发现,该系统可以处理随时间变化的序列变化。随着规则经历多个阶段的演进,系统能够持续适应,而不会积累误差或丧失识别稳定概念的能力。至关重要的是,该系统能够抑制旧的、错误的关联。它不仅学会了现在的正确答案,还主动停止了对受影响图像进行旧的、现已错误的预测。这种区别至关重要:一个优秀的适配系统不仅要知道现在什么是正确的,还要知道什么不再是正确的。
这项研究表明,长寿视觉系统的未来在于这种选择性的更新。这些系统不能将所有知识视为同等永久或同等可弃,而是必须能够识别其理解中的哪些部分已过时,哪些部分仍然有效。通过将对定义如何变化的清晰理解与仅更新模型必要部分的精确机制相结合,研究人员展示了让 AI 能够随其观察的世界共同成长和变化的路径。这项工作并不声称解决了人工智能中的所有问题,但它为处理静态视觉世界中不断变化的意义这一特定且复杂的现实,提供了一种具体且有效的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。