← 最新论文
💻 computer science

InkDiffuser: High-Fidelity One-shot Chinese Calligraphy via Differentiable Morphological Optimization

InkDiffuser 是一个基于扩散的框架,它通过集成高频增强机制和一种新颖的可微墨迹结构(DIS)损失函数,显式地正则化墨迹形态并提升笔画真实感,从而实现高保真度的单样本中国书法合成。

原作者: Kunchong Shi, Jing Zhang

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Kunchong Shi, Jing Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教机器人书写中国书法。目标是让机器人仅观察一个由人类大师书写的汉字范例,随后便能以相同的风格书写任何它从未见过的其他汉字。

当前机器人的问题在于,它们的字迹显得过于“数字化”。线条过于完美,边缘过于锐利,缺乏真实墨汁在纸上晕染时那种杂乱而美妙的神韵。那看起来像是电脑字体,而非毛笔绘画。

这篇论文的作者,InkDiffuser,构建了一个新系统来解决这一问题。以下是他们的方法,运用了简单的类比:

1. “高频”眼镜(STAF 模块)

将标准 AI 模型想象成戴着雾面眼镜的人。它们能看到大局(汉字的整体轮廓),却会忽略微小的细节,比如笔画的锐利转角或墨迹停止的确切边缘。

作者在他们的系统中添加了一副特殊的“高频眼镜”。

  • 工作原理:他们将输入图像通过一个滤波器,该滤波器仅突出锐利的边缘和精细的线条(如同绘画的轮廓)。
  • 神奇之处:他们将这种“仅边缘”的视图与正常视图一同输入给 AI。这迫使机器人关注它通常忽略的微小细节。这就像给艺术家提供了一副放大镜,以免他们不小心将字母的转角模糊化。

2. “墨理”导师(DIS Loss)

这是该论文最独特的发明。真正的书法不仅仅是白纸上的黑线;它是墨与纸之间复杂的相互作用。墨汁拥有一个深色、坚实的核心(毛笔用力按压处)和一个模糊、扩散的光晕(墨汁渗入纸张处)。

当前的 AI 模型将整个字视为一块实心的色块。它们不理解中心与边缘应当有所不同。

作者创建了一位名为可微墨迹结构(DIS)损失的“导师”。

  • 类比:想象你要教学生画一朵云。如果你只说“画一个白色的形状”,他们可能会画出一个完美的圆圈。但如果你说“画一个深色中心,逐渐淡化为柔和、模糊的边缘”,他们就能画对。
  • 工作原理:DIS 损失就像一位严格的艺术老师。它将生成的图像分解为两部分:
    1. 核心:检查笔画的中心是否坚实且准确。
    2. 光晕:检查边缘是否像真实墨迹那样模糊且自然扩散。
  • 技巧:通常,关于“模糊性”的数学规则对计算机来说太难学习,因为它们涉及“硬性”截止(就像电灯开关要么开要么关)。作者发明了一种这些数学规则的“软”版本(使用平滑曲线代替开关),以便计算机能够通过试错来学习锐利边缘与柔和墨迹晕染之间的区别。

3. 结果

当他们把这两者结合起来——用“高频眼镜”来确保形状正确,用“墨理导师”来确保纹理正确——机器人生成的书法看起来极其逼真。

  • 之前:机器人的字迹显得扁平、模糊,或像标准的电脑字体。
  • 之后:机器人的字迹拥有了书法的“灵魂”。你可以看到墨迹的扩散、笔触的锐利转角,以及那些让它看起来像是由人书写的自然瑕疵。

核心结论

该论文声称,通过教导 AI 观察细微细节并理解墨迹扩散的物理原理,它们能够仅凭单个范例生成优美、高质量的中文书法。他们将其与其他顶级方法进行了测试,其系统胜出,生成的汉字在结构准确性和视觉逼真度上均优于目前任何现有方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →