← 最新论文
🤖 machine learning

Prompt Disentanglement via Language Guidance and Representation Alignment for Domain Generalization

本文提出了一种新颖的领域泛化框架,该框架利用大语言模型来解耦文本提示以引导视觉提示微调,并进一步通过最差显式表示对齐(WERA)引入抽象提示和风格化增强,以实现鲁棒的跨领域表示学习。

原作者: De Cheng, Zhipeng Xu, Xinyang Jiang, Dongsheng Li, Nannan Wang, Xinbo Gao

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: De Cheng, Zhipeng Xu, Xinyang Jiang, Dongsheng Li, Nannan Wang, Xinbo Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一名学生识别动物。你向他们展示了数千张马的照片:有些是写实油画,有些是卡通形象,有些是黑白素描,还有些是在强光或深影下拍摄的照片。

问题在于,如果只给学生看这些特定的例子,当他们看到一种从未见过的全新风格的马(比如乐高积木拼成的马,或者电子游戏里的马)时,他们可能会感到困惑。他们可能会认为:“这不是马,这是个乐高积木!”因为他们过度关注了“风格”(绘画、光影、背景),而忽略了“本质”(形状、腿部、鬃毛)。

这篇论文介绍了一种名为 PADG 的新方法来解决这个问题。它教会计算机将“马的特性”与“风格的特性”分离,从而无论马看起来是什么样,都能识别出它。

以下是 PADG 的工作原理,通过三个简单的类比进行分解:

1. “聪明图书管理员”(语言引导)

研究人员意识到,虽然图像可能会产生误导,但文字是非常清晰的。无论马是用铅笔画的还是用油彩画的,对马的描述始终是马。

  • 类比: 想象一位“聪明图书管理员”(类似于 GPT 这样的语言大模型),他是描述事物的专家。
  • 做法: 图书管理员观察所有不同的马的图片,并编写两份独立的清单:
    1. “恒真”清单: 对每一匹马都成立的事实(例如:“四条腿”、“蹄子”、“鬃毛”)。这就是**领域不变性(Domain-Invariant)**的部分。
    2. “特定风格”清单: 根据不同图片而变化的事实(例如:“黑白素描”、“阳光明媚的草地背景”)。这就是**领域特定性(Domain-Specific)**的部分。
  • 结果: 计算机利用这份“恒真”清单来学习什么是真正的马,从而忽略那些具有干扰性的风格。

2. “压力测试健身房”(最坏情况对齐)

仅仅阅读清单是不够的。计算机需要通过在怪异、困难的情况下观察马来进行练习,以确保它真正理解了。

  • 类比: 想象一名在健身房训练的拳击手。为了准备好应对任何对手,他们不仅仅是与一个人对练,而是在受控环境下与“最糟糕的”对手进行训练。
  • 做法: 系统获取一张正常的马的照片,并在数学上对其进行“扭曲”。它改变颜色、对比度和形状,创造出一个看起来与原图大不相同、但本质仍是同一匹马的“最坏情况”版本。
  • 目标: 迫使计算机观察原始的马和那个扭曲、怪异的马,并判定:“它们是同一个东西!”这迫使计算机忽略表面的变化,只专注于物体的核心身份。

3. “团队集结”(原型学习)

最后,当计算机面对一张从未见过的全新图片做出判断时,它不会只依赖一种思考方式。

  • 类比: 想象一名侦探在破案。有时他们会遵循通用规则(“领域不变性”知识),有时他们会回忆起与以往类似案例相关的具体细节(“领域特定性”知识)。
  • 做法: PADG 为它所见过的每种风格都创建了一个“记忆库”。当它看到一张新图片时,它会询问两个问题:
    1. “根据通用规则来看,这看起来像是一匹马吗?”
    2. “根据我之前见过的特定风格来看,这看起来像是一匹马吗?”
  • 结果: 它结合这两个问题的答案,做出最终的、高度准确的判断。

为什么这很重要?

论文在五个不同的主要数据集(例如来自不同艺术家和摄像机的庞大动物照片集合)上测试了这种方法。

  • 结果: PADG 击败了之前所有的“最先进(state-of-the-art)”方法。它在处理风格差异极大的复杂情况(如将手绘素描与写实照片进行比较)时表现尤为出色。
  • 结论: 作者指出,通过结合使用“聪明图书管理员”(文本)、“压力测试健身房”(数学扭曲)和“团队集结”(结合知识),计算机的学习变得更加鲁棒,且不易被新的、未见的风格所迷惑。

简而言之,这篇论文教会了计算机不要去死记硬背物体穿着的“戏服”,而是要去识别戏服之下真实的“本体”,无论他们接下来换上什么样的戏服。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →