← 最新论文
📊 statistics

Path Integral Value Matching for Linear Quadratic Stochastic Optimal Control

本文介绍了路径积分价值匹配(Path Integral Value Matching, PI-VM),这是一种基于价值的算法,它结合了截断且边缘化的路径积分公式、时序差分学习以及吉尔萨诺夫定理(Girsanov theorem),旨在为线性二次随机最优控制问题提供可扩展、高效且稳定的解,在计算效率和缓解模式崩塌方面均优于现有的最先进策略类方法。

原作者: Bangyan Liao, Chenglei Yu, Yuchen Yang, Chuanrui Wang, Zhisheng Song, Peidong Liu, Tailin Wu

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Bangyan Liao, Chenglei Yu, Yuchen Yang, Chuanrui Wang, Zhisheng Song, Peidong Liu, Tailin Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图驾驶一艘极其嘈杂、混乱的小船,穿越波涛汹涌的大洋,去寻找一座特定的宝藏岛。海浪变幻莫测,风向随机改变,而且你无法一眼看清整张地图。这就是**随机最优控制(Stochastic Optimal Control)**的本质——这是一个研究在未来充满模糊性和惊喜时,如何做出最佳决策的科学分支。它是自驾驶汽车在雨天湿滑街道上行驶,或是机器人学习如何在不跌倒的情况下行走背后的数学原理。

长期以来,解决这些“风暴中的小船”问题的最佳方法是反复模拟整个航程,不断尝试不同的转向角度,直到找到效果最好的那一个。这就像是通过成千上万次的摔倒来学习骑自行车,并寄希望于你的大脑最终能领悟平衡感。虽然这种方法有效,但极其缓慢且计算成本高昂,尤其是当“海洋”变得巨大(高维)时。近年来,科学家们一直尝试利用机器学习来加速这一过程,但旧的方法在面对所需的庞大“假设场景”数量时仍然显得力不从心。

本文介绍了一种解决此类问题的巧妙新方法,称为路径积分价值匹配(Path Integral Value Matching, PI-VM)。PI-VM 并不盲目地通过模拟漫长的完整旅程来学习如何转向,作者意识到可以将问题分解为微小且易于处理的步骤。他们发现了一个数学上的“捷径”,允许计算机通过仅观察稍远一点的未来,而不是观察直到旅程结束的全程,来学习当前处于特定位置的价值。

由西湖大学研究人员领导的团队发现,通过使用这种“循序渐进”的方法,他们可以比现有的最先进方法更快、更准确地训练其人工智能来解决复杂的控制问题。在测试中,在较简单的场景下,他们的新方法比现有技术快了 10 到 20 倍;更关键的是,当问题变得极其复杂且具有高维特性时,该方法并没有崩溃或失败。当其他方法在“海洋”变得过大时陷入困境或耗尽内存时,PI-VM 依然能够平稳航行,这证明了有时,只看前方一小段距离比试图看清整个地平线更为有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →