← 最新论文
💻 computer science

Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization

本文介绍了渐进式对抗提示微调(PAPT),这是一种利用预训练文本生成图像扩散模型来自动学习抽象对抗提示的新型框架,旨在生成多样化的域外训练数据,从而显著增强单域泛化性能。

原作者: Zhipeng Xu, De Cheng, Xinyang Jiang, Nannan Wang, Dongsheng Li, Xinbo Gao

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhipeng Xu, De Cheng, Xinyang Jiang, Nannan Wang, Dongsheng Li, Xinbo Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一只狗去识别“马”。在一个完美的世界里,你会给这只狗看各种照片:阳光下的草地、雪中的森林、雨中的城市以及沙漠。这样,狗就会明白,无论背景如何,马始终是马。

但在现实世界中,你只有一张照片:一张在阳光草地上的马的照片。这就是**单域泛化(Single Domain Generalization, SDG)**所面临的挑战。你该如何仅凭一张照片,就教会这只狗去识别它从未见过的场景中的马呢?

本文提出了一种巧妙的解决方案,即利用一个“神奇图片生成器”(一种能将文本转化为图像的 AI)为这只狗创造新的训练照片。以下是他们的做法,用简单的语言解释如下:

1. “手动提示词”的问题

通常情况下,要让图片生成器创造出一张森林里的马,你必须输入:“一张在森林里的马的照片。” 要创造一张沙漠里的马,你得输入:“一张在沙漠里的马的照片。”

作者认为这样做太难了,原因有二:

  • 工作量太大: 你无法为马可能出现的每一种可能场景都手动编写提示词。
  • 有些东西很难描述: 一个“梦幻、抽象、1980年代霓虹风格”下的马长什么样?很难用文字来精准描述。

2. 解决方案:“隐形墨水”(可学习的提示词)

作者并没有使用像“森林”或“沙漠”这样的具体词汇,而是教会了 AI 使用隐形墨水(抽象提示词)。

可以将这些提示词想象成调音台上两个特殊的旋钮:

  • 旋钮 A(身份旋钮): 这个旋钮锁定了“本质”。它确保无论发生什么变化,那只动物始终是马,而不是牛或汽车。
  • 旋钮 B(风格旋钮): 这个旋钮掌握着“氛围”或“风格”。它不使用文字,而是使用数学模式来创造如“素描感”、“绘画感”或“未来感”等风格,即使我们无法用语言来描述这些风格。

3. “对抗性”游戏(创意大厨)

他们方法的核心是一个被称为**渐进式对抗提示词微调(Progressive Adversarial Prompt Tuning)**的游戏。

想象一位大厨(AI)正试图为一道“马肉料理”发明新食谱。

  1. 目标: 大厨想要做出一道既带有“马”的味道(身份旋钮),看起来又与之前做过的任何菜肴完全不同的菜肴(风格旋钮)。
  2. 记忆库: 大厨保留了一份他已经创造过的所有风格的清单(例如:“水彩画”、“油画”)。
  3. 挑战: 每当大厨尝试制作一道新菜时,一位“品鉴师”(对抗部分)就会检查清单。如果新菜看起来太像“水彩画”风格,品鉴师就会拒绝它。
  4. 结果: 大厨被迫发明一种全新的风格,这种风格必须与清单上的所有风格截然不同,同时还要确保这道菜清晰地呈现出“马肉料理”的特征。

他们一遍又一遍地进行这个过程。每当大厨发明一种新风格,他就会将其加入清单,并迫使大厨在下一次发明出更具差异性的东西。这创造了极其多样化的训练图像。

4. 为什么这种方法更好

他们在著名的图像数据集(如 PACS 和 VLCS)上测试了该方法。

  • 旧方法: 传统方法试图拉伸现有的那张照片,或者将其与其他照片混合。这就像试图拉伸一根橡皮筋;拉到最后要么断裂,要么变得奇形怪状。
  • 新方法: 他们的这种方法利用“神奇图片生成器”创造了数百张全新的、具有多样性的照片,展示了处于现实世界中尚不存在的风格下的马。

结果: 在这些 AI 生成的照片上进行训练的模型,在识别处于全新场景(如卡通风格或素描风格下的马)中的马时,表现得比以往所有方法都要出色。事实上,他们以显著的优势超越了目前的“最优”方法。

总结类比

如果你只有一张朋友的照片,想在人群中认出他:

  • 旧方法: 你盯着那张照片眯起眼睛,试图猜测他在穿不同衣服时会是什么样子。
  • 本文的方法: 你请一位神奇的艺术家,画出你的朋友穿着一百种不同的服装、发型和艺术风格(有些古怪,有些正常)。然后你把这些画作展示给你的大脑。现在,当你在现实世界中看到你的朋友时,你能瞬间认出他,因为你的大脑已经见过他在“每一种”可能风格下的样子。

本文声称,这是首次使用这种特定的“神奇艺术家”技术来解决“单张照片”问题,其核心在于通过学习抽象的“旋钮”而非编写文本描述来解决问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →