← 最新论文
📊 statistics

Training Energy-Based Models with Non-MCMC Samplers and Efficient Temperature Estimation

本文通过提出用于高效并行采样的朗之文模拟分叉(LSB)采样器、用于准确温度估计的条件期望匹配(CEM)方法,以及用于有效结合这些组件以提升半受限玻尔兹曼机性能的采样器自适应学习(SAL)算法,引入了一个使用快速非 MCMC 采样器训练能量模型(EBM)的综合框架。

原作者: Kentaro Kubo, Hayato Goto

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Kentaro Kubo, Hayato Goto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代计算的广阔版图中,存在着一个基本挑战,它出现在从人工智能训练到原子行为模拟的方方面面:如何从一个复杂、混沌的系统中抽取具有代表性的样本。想象一下,试图通过观察天空的一个瞬间快照来理解天气;你会错过其中的模式、风暴和趋势。要真正掌握这个系统,你需要看到许多不同的状态,而且不仅仅是任何状态——你需要它们出现的频率与自然界中的情况一致。几十年来,科学家们一直依赖一种称为马尔可夫链蒙特卡洛(Markov chain Monte Carlo)的方法来完成这项工作。它的运作方式就像一位谨慎的、循序渐进的探险家,每一步都走得很慢,在迈出下一步之前先检查地形。虽然这种方法很可靠,但这位探险家动作迟缓。它无法并行运行,并且在复杂、崎岖的地形中,它经常陷入局部谷底,需要花费很长时间才能找到整个地形的真实轮廓。随着人工智能系统变得越来越庞大和复杂,这种缓慢现象已成为一个主要的瓶颈,限制了这些系统学习的速度和质量。

东芝(Toshiba)和理化学研究所(RIKEN)量子计算中心的研究团队现在提出了一种导航这些复杂景观的新方法,这种方法既快速又准确。他们引入了一种名为朗之万模拟分叉(Langevin simulated bifurcation)的新型采样方法,放弃了缓慢的、步进式的方法,转而采用一种动态的、并行的过程。该方法不再是一步一个脚印地移动,而是允许系统同时进行,以比传统技术快几个数量级的速度探索景观。然而,这种速度是有代价的:由于该方法与传统方式截然不同,所得样本的“温度”往往是未知的。在统计物理学领域,温度控制着系统中随机性的程度;如果不知道确切的温度,样本看起来可能正确,但在统计上却可能存在偏差,从而导致错误的结论。研究人员通过开发一种被称为条件期望匹配(conditional expectation matching)的巧妙估计技术解决了这个问题。这种方法就像一个精确的温度计,使他们能够在不减慢过程速度的情况下,测量出有效温度。通过将快速采样器与这种精确的温度测量相结合,他们创建了一个能够比以往更高效地训练复杂模型的学习框架。

研究人员在一种被称为半受限玻尔兹曼机(semi-restricted Boltzmann machine)的特定类型模型上测试了他们的方案。这些模型之所以强大,是因为它们可以捕捉数据点之间复杂的相互关系,但由于标准方法处理其复杂度的速度太慢,它们在历史上一直难以训练。团队发现,他们的新型采样器——朗之万模拟分叉,生成的样本与传统的、缓慢的方法一样准确,但耗时仅为后者的一小部分。在涉及变量随机配置的测试中,新方法产生的结果与既定的金标准相当,在某些情况下甚至更好,同时运行速度快了数千倍。至关重要的是,这种新的温度估计技术能够完美地与这种速度协同工作,提供了必要的校准,以确保样本在统计上是有效的。这种结合使得模型能够有效地学习,最大限度地减少误差,并找到对数据的最佳拟合。

为了证明这种方法在现实场景中的有效性,团队将其应用于三个不同的任务。首先,他们将其用于模拟一个具有复杂三向相互作用的系统,这类问题对于标准方法来说是出了名的难处理。新的框架成功学习了潜在模式,表现优于传统方法。接着,他们转向图像生成与重建。利用一个简单的黑白条纹图案数据集,他们训练模型生成新的、有效的模式,并填补图像中缺失的部分。模型迅速学习了条纹的规则,并在训练后,即使在近一半像素缺失的情况下,也能以几乎零误差重建图像。最后,他们在手写数字数据集上测试了该系统。模型学习了识别数字形状的方法,并能根据指令生成特定数字的新样本。它还在分类数字方面取得了高准确率,训练后达到了接近 90% 的正确率,这相对于随机猜测是一个显著的提升。

这项工作的意义在于它能够弥合速度与准确性之间的鸿沟。多年来,研究人员不得不在这两者之间做出选择:要么使用快速但不准确的采样方法,要么使用准确但慢到无法投入实际应用的精确方法。这个新框架证明了同时拥有这两者是可能的。通过使用快速的并行采样器,并利用专门的估计技术来修正其温度,研究人员为训练更具表达力和更复杂的模型打开了大门。虽然目前的研究侧重于特定类型的模型,但其底层原理足够广泛,可以应用于许多其他存在条件独立性的系统。这表明,该方法可以用于多样化的领域,从提高量子模拟的效率到构建更强大的人工智能系统。研究结果提供了一条清晰的前行路径,表明只要拥有正确的工具,长期阻碍概率学习进展的计算障碍是可以被克服的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →