← 最新论文
🤖 machine learning

RAMP: Recognition parametrisation by Amortised Message Passing

本文介绍了 RAMP,这是一种新颖的无监督学习方法,它利用一种灵活、非线性且摊销化的消息传递框架,在处理复杂高维数据的表达性模型时,能够高效地恢复隐变量分布,从而克服了传统概率方法的扩展性和可处理性限制。

原作者: Lior Fox, Kai Biegun, James Heald, Samo Hromadka, Arielle Rosinski, Maneesh Sahani

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Lior Fox, Kai Biegun, James Heald, Samo Hromadka, Arielle Rosinski, Maneesh Sahani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名试图破解谜团的侦探,但你手里只有一堆零散的线索:一个泥泞的脚印、一块撕裂的织物和一张模糊的照片。你的目标不仅仅是列出这些线索,而是要理清将它们联系在一起的隐藏故事。是一个巨人踩在了泥里?还是织物在挣扎中被撕裂了?在人工智能的世界里,这被称为“无监督学习”。这是教计算机去寻找那些解释现实世界事物发生原因的隐形、隐藏的原因(称为“潜在因子”)的艺术。

几十年来,科学家们一直试图构建能够实现这一目标的计算机,使用的是“概率模型”。把这些模型想象成一个巨大的、复杂的猜测网络。计算机绘制一张地图,展示不同的线索可能如何相互关联,然后尝试计算出最可能的剧情。问题在于,这些计算极其困难。如果网络变得过于纠缠,或者线索过于混乱,数学逻辑就会崩溃。计算机要么陷入循环,要么只能做一个非常粗略的猜测,从而错失现实世界的细微差别。这就像是戴着烤箱手套玩魔方;你可以接近目标,但你无法感觉到那些碎片并完美地转动它们。

这就是一种名为 RAMP 的新方法登场的地方。研究人员希望构建一个不仅仅是在猜测,而是学会如何“感知”线索之间联系的侦探。他们创建了一个系统,将现代神经网络(驱动图像识别的那种)的灵活性与概率论的严密逻辑结合在一起。RAMP 并没有强迫计算机一次性解决一个巨大的、不可能的方程,而是将问题分解成许多微小的、易于处理的步骤,在不同线索之间传递小小的“消息”,直到隐藏的故事显现出来。这是一种教机器理解世界隐藏结构的方法,无论是单摆的摆动还是人体姿态,而无需预先告知规则。

侦探的新工具箱:RAMP

该论文介绍了一种名为 RAMP(通过摊销消息传递进行识别参数化)的巧妙新方法,用于让计算机学习隐藏的模式。要理解它的工作原理,请想象一群正在处理大规模案件的侦探,但他们并不在一个大办公室里,而是分布在一个树状结构的房间网络中。

在传统的侦探故事中,如果你想知道凶手是谁,你可能会尝试同时询问所有人。但在复杂的案件中,这是不可能的。RAMP 改变了游戏规则。它建立了一个系统,其中每个侦探(代表一个隐藏变量)只与其直接相邻的邻居交谈。他们来回传递“消息”。这些消息不仅仅是笔记;它们是每位侦探目前所学到知识的总结。

这里有一个神奇的技巧:RAMP 使用神经网络(AI 的大脑部分)来编写这些消息。它不是使用僵化的、预先写好的公式来总结线索,而是让神经网络学习如何完美地总结它们。这就像是教一名侦探如何在任何情况下,都能用一句话完美地总结犯罪现场,无论现场多么混乱。这个过程被称为“摊销消息传递(amortised message passing)”。“摊销(Amortised)”是一个高级词汇,意味着计算机学会了一项通用技能(如何总结),然后针对每一个新案例反复使用这项技能,这使得它变得极其快速且高效。

研究人员在三个截然不同的场景中测试了这个想法,结果令人印象深刻。

首先,他们在**层级树(hierarchical tree)**上进行了测试,这就像是线索的家族树。他们生成的数据中,“父母”以特定方式影响“子女”。当树状结构完美时,RAMQ 找到了隐藏的原因,准确率接近 100%,达到了理论上的最优解。但更酷的地方在于:他们还测试了当树结构破碎或混乱(即“误设定的”树)时会发生什么。即使计算机得到的连接图谱是错误的,RAMP 依然表现出了惊人的鲁棒性。如果树的某个特定部分是正确的,那么该部分的侦探仍然能发现真相,即使他们的邻居感到困惑。这表明 RAMP 不仅仅是在记忆一张地图,它学习的是线索如何连接的底层逻辑。

接下来,他们用一个非线性单摆向 RAMP 发起了挑战。想象一段单摆摆动的视频。计算机只能看到单摆在每一时刻的图像,而看不到它的速度或角度。为了推断速度,计算机必须观察过去和未来。传统方法在这里经常失败,因为图像与速度之间的关系是复杂且弯曲的(非线性的)。然而,RAMP 学会了仅通过观看视频就能推断出角度和速度。它成功重建了“相空间”(系统的隐藏状态)在二维空间中的情况,其表现优于其他在寻找速度方面表现挣扎的先进方法。

最后,他们将 RAMP 应用于人体姿态估计。这项任务是仅通过观察身体的局部小块区域(比如膝盖或脖子周围的一小块区域)来确定一个人的站姿。计算机看不见完整的身体,它只看到这些微小的碎片。挑战在于,如果左脚踝被遮挡(occluded),计算机必须根据身体的其他部分来猜测脚踝的位置。RAMP 将人体视为一个由连接关节组成的树。通过在关节之间传递消息,它学会了膝盖的方向取决于臀部和脚踝。即使脚踝从画面中消失了,RAMP 也能利用这种“树”结构来推断腿部的正确姿势,有效地利用已学习到的关系来“填补空白”。

论文表明,RAMP 是寻找复杂数据中隐藏结构的强大工具。它表明,通过将神经网络的灵活性与消息传递的逻辑结构相结合,我们可以构建出能更深入理解世界的 AI。作者发现,只要核心连接还在,即使数据很混乱或模型与现实不完全匹配,RAMP 也能表现良好。虽然论文并未声称解决了 AI 的所有问题,但它提供了一条充满希望的新路径,表明机器可以通过学习如何彼此交流,从而学会成为更好的侦探。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →