← 最新论文
📊 statistics

Intrinsic-Hybrid Latent Diffusion Models for Generative Modeling on Unknown Manifolds

本文介绍了内在混合潜扩散模型(ILDM),这是一种生成式框架,它通过将潜空间解释为黎曼流形,并采用一种根据局部不确定性在欧几里得动力学与几何感知动力学之间进行动态切换的混合扩散过程,克服了标准扩散模型和潜扩散模型的局限性,从而在有限数据下实现了对未知流形的卓越生成质量。

原作者: Yizhu Wang, Mu Niu, Xiaochen Yang

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yizhu Wang, Mu Niu, Xiaochen Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人画一只猫。你给它看了成千上万张照片,最终,它学会了画出一只毛茸茸的猫科动物。但如果只给它看几张照片会怎样呢?机器人可能会感到困惑,画出一只长着三个头或者长着轮子而不是爪子的猫。这就是人工智能中“生成模型”(generative modeling)面临的挑战:在缺乏大量样本供其学习的情况下,如何教会计算机创造出新的、逼真的数据(如图像或声音)。

为了解决这个问题,科学家们经常使用一种被称为“扩散”(diffusion)的巧妙技巧。把它想象成一场反向进行的“传声游戏”。首先,你拿一张清晰的照片,慢慢加入静态噪声,直到它看起来像一团模糊的灰色混沌。然后,你训练计算机玩这个游戏的逆过程:从灰色噪声开始,它学习逐步去除静态噪声,直到一张清晰的图像显现出来。通常,这些计算机在一个平坦的、网格状的世界(称为“欧几里得空间”)中工作,在那里向上永远是向上,向左永远是向左。但现实世界的数据,比如人脸的形状或汽车的曲线,往往存在于一个扭曲、折叠的表面(即“流形”,manifold)上,这个表面无法整齐地放入平坦的网格中。如果你试图用一张平坦的地图在皱巴巴的纸上行走,你会迷路的。这篇论文探讨了如何教这些 AI 机器人去导航那些皱巴巴的、隐形的表面,尤其是当它们只有少量照片可以学习时。

这项研究的研究人员 Yizhu Wang、Mu Niu 和 Xiaochen Yang 引入了一种名为**内在混合潜扩散模型(Intrinsic Hybrid Latent Diffusion Model, ILM)**的新系统。他们的主要发现是,通过将 AI 使用的隐藏“地图”视为一个灵活的、弯曲的表面而非平坦的网格,机器人可以从更少的图片中学习得更好。他们发现,AI 的地图并非处处完美:在某些地方,它对数据所在的位置非常确定;但在其他地方(远离训练照片的地方),它则是摇摆不定且不确定的。

为了处理这个问题,ILDM 使用了一种“混合”策略,就像一个拥有两种不同旅行模式的徒步旅行者。当徒步旅行者走在一条已知、安全的路径上(低不确定性区域)时,他们会沿着地形的曲线小心行走,尊重土地的形状。这就是模型的**黎曼(Riemannian)**部分,在这里,AI 遵循数据的自然几何结构。但如果徒步旅行者走进了一片雾气缭绕、未知的森林(高不确定性区域,即地图不可靠的区域),他们就会切换到一种更简单的、直线行走的方式(欧几里得动力学),以避免陷入困境或掉下悬崖。该模型不断检查自身的信心:如果它不确定,它就切换到安全的直线行走模式;如果它有信心,它就紧贴数据的曲线。

论文反对目前大多数模型所采用的标准方法,即这些模型假设隐藏地图始终是平坦的,并忽略了这些曲线。作者指出,这种“平坦地图”的假设会导致 AI 犯错,尤其是在数据稀缺的情况下。他们也排除了我们需要预先知道数据表面精确形状的观点;相反,他们的模型使用概率解码器,在运行过程中实时学习形状和不确定性。

在实验中,团队在三组不同的数据上测试了这个新系统:一个旋转的“招财猫”玩具(来自 COIL-100 数据集)、一小组手写数字(MNIST)以及心脏扫描图像(心脏 MRI)。他们模拟了生成新图像的过程,并发现他们的混合模型比标准模型产生了显著更好的结果。具体而言,新模型生成的图像看起来更逼真,且畸变更少,在被称为 FID 和 LPIPS 的标准质量测试中得分更低。作者通过计算机模拟和对比测量了这一成功,表明通过让 AI 根据其确定程度在“曲线”和“直线”行走之间切换,即使在最初看到的例子很少的情况下,它也能生成高质量的图像。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →