← 最新论文
💻 computer science

HAM: A Training-Free Style Transfer Approach via Heterogeneous Attention Modulation for Diffusion Models

该论文提出了一种名为 HAM 的免训练风格迁移方法,通过异质注意力调制(包括全局注意力调节和局部注意力移植)及风格噪声初始化,在扩散模型中有效平衡了风格迁移与内容身份保持之间的矛盾,实现了无需额外训练即可达到最先进的性能。

原作者: Yeqi He, Liang Li, Zhiwen Yang, Xichun Sheng, Zhidong Zhao, Chenggang Yan

发布于 2026-03-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yeqi He, Liang Li, Zhiwen Yang, Xichun Sheng, Zhidong Zhao, Chenggang Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 HAM 的新方法,它能让 AI 绘画模型(扩散模型)在不重新训练的情况下,轻松地把一张照片变成某种特定的艺术风格(比如把一张普通照片变成梵高的《星月夜》风格),同时还能完美保留原图里的人物或物体长什么样

为了让你更容易理解,我们可以把整个过程想象成**“给一位大厨(AI 模型)做一道新菜”**。

1. 以前的难题:要么“走样”,要么“没味”

在 HAM 出现之前,让 AI 换风格就像让大厨做一道“宫保鸡丁”风格的“红烧肉”。

  • 以前的方法 A(微调训练): 就像让大厨专门去进修一个月,只学做红烧肉。效果虽好,但太慢、太贵,而且换个菜系(风格)还得重新进修。
  • 以前的方法 B(直接注入风格): 就像直接往红烧肉里倒宫保鸡丁的调料。结果往往是:肉的味道变了(风格有了),但肉本身都煮烂了,或者形状全变了(原图的内容/身份丢失了)。这就叫**“风格与内容的失衡”**。

2. HAM 的解决方案:三位一体的“魔法烹饪术”

HAM 不需要重新训练大厨,它通过三个巧妙的步骤,在烹饪过程中实时“调教”AI,让它既保留原图的“灵魂”(内容),又穿上新的“衣服”(风格)。

第一步:准备食材(风格注入的噪声初始化 - SINI)

  • 比喻: 想象你要做一道菜,不能只用普通的白开水(随机噪声)开始,也不能只用纯鸡汤(风格噪声)。
  • HAM 的做法: 它把“原图的灵魂”和“风格的调料”混合在一起,作为烹饪的起点
  • 关键点: 它非常聪明地保留了一部分“原图特有的残留物”(Content Residual Noise)。就像在汤底里保留了一勺原汤,确保无论怎么加料,这道菜的“底味”(原图是谁)都不会变。

第二步:全局把控(全局注意力调节 - GAR)

  • 比喻: 这是**“宏观的调味师”**。
  • 作用: 在 AI 绘画的每一个笔触中,GAR 负责**“抓大放小”**。它看着整张画,确保画面的大结构、大轮廓(比如人的脸、房子的形状)保持原样,同时把整体的色调、光影氛围(风格)渗透进去。
  • 就像: 给一幅素描画上统一的滤镜,让整张画看起来像梵高画的,但素描的线条和人物位置完全没变。

第三步:局部精修(局部注意力移植 - LAT)

  • 比喻: 这是**“微观的化妆师”**。
  • 作用: 有时候,光靠宏观调色不够,细节(比如笔触的纹理、特定的色彩搭配)需要更精准的控制。HAM 发现,直接替换“关键信息”(Key/Value)会破坏原图,所以它换了一个思路:只替换“风格信息”,保留“内容提问”
  • 怎么做: 它把“风格老师”的笔触细节(Key/Value)移植过来,但坚持让“内容老师”来决定画什么(Query)。
  • 就像: 让一位画油画的老师(风格)来指导一位画素描的学生(内容),老师负责教怎么运笔、怎么上色,但学生决定画的是苹果还是香蕉。这样既有了油画的质感,又没画错东西。

3. 为什么 HAM 这么厉害?

  • 不用重新训练(Training-Free): 就像不需要给大厨重新上课,只需要给他一套“魔法调料包”和“操作手册”,他就能立刻做出完美的风格转换。
  • 两头兼顾(平衡大师): 以前的方法往往顾此失彼(要么风格太浓把脸画歪了,要么脸太像原图但风格没出来)。HAM 通过上述三个步骤的**“异质注意力调制”**,完美地找到了平衡点。
  • 通吃各种模型: 无论是老款的 SD2.1 还是新款的 SD3.5,这套方法都能用。

总结

你可以把 HAM 想象成一个超级智能的“风格滤镜”
以前给照片换风格,就像给一个人穿戏服,穿得太紧会把人勒变形(内容丢失),穿得太松又像没穿(风格不明显)。
HAM 就像是一个高明的裁缝,它能在不改变你身材(内容)的前提下,为你量体裁衣,穿上最华丽、最复杂的戏服(风格),让你看起来既像你自己,又像一位艺术大师。

一句话概括: HAM 让 AI 换风格变得像“给照片加滤镜”一样简单,但效果却像“请大师重画”一样逼真,而且完全不用重新训练 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →