DIFFCZSL: Compositional Zero-Shot Learning Regularized by Diffusion Representations
该论文提出了 DIFFCZSL,这是一个通过将中间扩散表示集成到基于 CLIP 的流水线中,以提供辅助监督和更丰富的组合感知语义,且不增加推理成本的组合零样本学习框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:一台计算机可以观察一张红苹果的照片和一张绿苹果的照片,学习“红色”和“绿色”的含义,然后能够瞬间识别出一张它从未见过的“绿苹果”照片,即便它之前只接受过红苹果的训练。这就是组合式零样本学习(compositional zero-shot learning)所面临的挑战,这是人工智能的一个特定分支,它探讨机器如何理解简单概念是如何组合成新的、复杂的想法的。几十年来,研究人员一直试图通过向计算机展示数以千计的例子来教会它这项技能,但当要求机器以它们未曾练习过的方式进行混合与匹配时,机器往往会感到吃力。它们可能会识别出物体(如香蕉)和状态(如“成熟”),但却无法理解“成熟香蕉”是一个特定的视觉现实,而不仅仅是一个“成熟”的事物或一般的“香道”本身。其核心难点在于,如何教机器去观察部分之间的关系,而不仅仅是部分本身。
香港科技大学的一个研究小组发现了一种帮助这些机器学习这项技能的新方法,这种方法不是通过教它们更多的例子,而是通过借鉴另一种类型的智能。他们发现,虽然标准的AI模型非常擅长区分一张图像与另一张图像,但在理解概念如何融合方面有时却显得笨拙。为了解决这个问题,该团队在训练过程中引入了一个“生成式”助手。可以将这个助手想象成一个最初旨在根据文本描述创建图像,而非仅仅识别图像的模型。通过让AI在学习时观察这个图像创建模型的内部运作方式,研究人员能够引导学习过程走向对属性与物体如何契合的更深层理解。
由天航宇(Hangyu Tian)及其同事领导的研究人员构建了一个名为 DIFFCZSL 的系统。他们的方法始于一个强大的预训练AI模型,称为 CLIP,该模型非常擅长将图片与文字进行匹配。然而,团队注意到 CLIP 有时会将“成熟的香蕉”仅仅视为一个靠近“成熟”一词的香蕉,而不是一个统一的概念——即成熟度改变了水果的外观。为了纠正这一点,他们在训练阶段增加了第二个步骤。他们采用了一个预训练的图像生成模型(即那种当你输入一段描述就能画出图片的模型),并要求它观察与主AI研究相同的图像。这个生成模型拥有一种独特的观察世界的方式;因为它必须学习如何根据文本从头开始重建图像,所以它会密切关注诸如香蕉皮的纹理或苹果的颜色等特定细节是如何与物体本身相互作用的。
团队并没有用这个生成模型取代主AI。相反,他们将生成模型作为一名“老师”。当主AI尝试学习时,生成模型会提供额外的提示。它本质上是在向主AI低语:“看,当你看到香蕉时,‘成熟’这个概念不仅仅是一个独立的标签;它改变了香蕉的视觉形状和颜色。”研究人员从生成模型中提取了这些内部提示,并将其与主AI的理解相对齐。这个过程仅发生在计算机学习期间。一旦训练完成,生成模型就会被移除,主AI保留了其原始的速度和结构,但现在拥有了更敏锐的识别新组合的能力。
该实验的结果是在三个不同的图像集(涵盖鞋类、水果和日常物品)上进行衡量的。在每种情况下,接受了这种额外指导的AI模型表现都优于未受指导的模型。在一个名为 UT-Zappos 的鞋类数据集上,团队观察到了准确率的显著提升,即模型更频繁地正确识别未见的组合。例如,当被要求识别新语境下的“切开的苹果”或“成熟的香蕉”时,受指导的模型极少会产生混淆。无论测试是局限于已知类别,还是开放到广泛的可能组合,这种改进都是一致的。研究人员发现,模型在平衡已知知识与预测未知情况的能力方面变得更加出色,这对于新情况不断出现的现实应用场景至关重要。
其中一个最引人注目的发现是,这种提升并没有导致计算机变慢或变得臃肿。因为生成模型仅在学习阶段作为引导使用,并在之后被丢弃,所以最终系统的运行速度与原始系统一样快。团队还测试了生成模型的具体类型是否重要,发现更新、更先进的版本提供了比旧版本更好的引导。他们甚至将此方法与其他类型的强大AI模型进行了对比,发现生成模型独特的理解概念融合的能力才是关键,而不仅仅是因为它是一个大型的预训练系统。该研究表明,生成模型学习如何根据文本创建图像的方式,捕捉到了一种完美的、用于教机器如何组合想法的世界隐藏结构。
这项工作凸显了一条充满希望的人工智能发展路径。研究人员表明,与其试图构建一个能完美完成一切的单一庞大模型,不如通过结合不同类型模型的优势来获得更好的结果。通过让一个创建图像的模型去教一个识别图像的模型,他们弥合了计算机理解世界方式上的鸿沟。研究结果表明,人工智能的未来可能在于这些协作,即生成式模型与判别式模型共同协作,创造出不仅准确,而且能深度理解现实之复杂组成性质的系统。这种方法提供了一种简单且有效的方式,使机器在理解事物如何契合方面变得更加聪明,而不会给它们的日常任务增加任何额外负担。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。