✨ 要点🔬 技术摘要
想象一下,你正在制造一个需要理解物理定律才能正确移动的机器人。如果你只是通过观察数百万张图片来教机器人去猜测物体的运动方式,它在看到新事物时可能会感到困惑,甚至更糟——它可能会因为“幻觉”出了一个并不存在的物理定律而犯下危险的错误。为了解决这个问题,科学家们使用了一个巧妙的技巧,叫做“物理信息驱动”(Physics-Informed)模型。这就像是给机器人一本已知定律的教科书(比如重力或摩擦力),并告诉它:“你完美地掌握了这些规则。现在,请用你的大脑去弄清楚教科书遗漏的那些微小、混乱的细节。”这个“大脑”通常是一个简单、快速的计算机程序,被称为神经网络。
最近,一种新型的神经网络——柯尔莫哥洛夫-阿诺德网络(简称 KAN)变得非常流行。它被宣传为旧式“大脑”的一种超高效、轻量级的版本,承诺能用更少的内存来完成同样的工作。这对于无人机或医疗传感器等小型、电池供电的设备来说是一件大事,因为在这些设备上,每一比特的内存和每一滴能量都至关重要。但问题在于,虽然 KAN 在理论上很节省空间,但在真实的微型计算机芯片上运行时,它可能会显得笨拙且缓慢。大问题在于:这种新的“高效”大脑在实际部署时,是真的节省了能量和时间,还是其复杂的数学运算让它变得过于缓慢而无法使用?
这篇论文通过将旧式的“大脑”(称为 MLP)与新的 KAN 在一个小型、真实的计算机芯片(RISC-V 处理器)上进行对决,来测试这个问题。研究人员不仅观察了它们的学习能力,还精确测量了它们做出决策所需的时间以及每个计算步骤消耗了多少电池电量。他们发现,虽然 KAN 的体积确实更小,但它却出人意料地迟钝且耗能。在执行相同任务时,研究发现 KAN 比传统的 MLP 慢了 8.0 到 13.5 倍 。更糟糕的是,在每一步计算中,它消耗的能量也是 MLP 的 5.6 到 11.3 倍 。
研究人员还测试了当你尝试通过舍入数值(这个过程称为量化)来使模型变得更小时会发生什么,这在节省空间方面是微型设备中常见的做法。在这里,KAN 的表现迅速崩溃。在一次测试中,KAN 的预测在仅仅经过 6.5 步 后就变得完全错误,而传统的 MLP 却能持续正确工作 282 步 ——可靠性差异达到了 43 倍 。研究结论指出,在这些小型、标准的计算机芯片上,KAN 的高效承诺并不成立。除非工程师专门为 KAN 设计特定的硬件,否则传统的 MLP 仍然是实现在嵌入式设备上运行物理模型的更可靠、更快且更节能的选择。
技术摘要:嵌入式 RISC-V 环境下 Kolmogorov–Arnold 网络在硬约束循环物理信息模型中的评估
问题陈述 硬约束循环物理信息神经网络(HRPINNs)将已知的物理动力学嵌入到循环数值积分器中,从而将神经网络部分限制在仅学习残差动力学。虽然 Kolmogorov–Arnold 网络(KANs)已被提议作为多层感知器(MLPs)在参数效率方面的替代方案,用于这些残差分支,但由于其可学习的 B-样条激活函数,其执行剖面与之显著不同。前人的工作已经确定 KANs 在发现精度上可以匹配或略逊于 MLPs,但并未评估其在部署时的计算效率和可靠性。本文研究了 KANs 的参数效率是否能转化为标量嵌入式核心上的部署成本,具体针对以下三个假设进行探讨:(H1)与精度相当的 MLPs 相比,KANs 会产生更高的单步执行延迟;(H2)这种延迟差异会导致每步积分能量消耗更高;(H3)在闭环循环内进行训练后量化时,KANs 比 MLPs 更早失去轨迹保真度。
方法论 本研究评估了部署在 StarFive VisionFive 2 平台(SiFive U74, RV64GC)上的具有相同训练权重的 MLP 和 KAN 残差分支,该平台为不带向量扩展的 RISC-V 标量核心。这种硬件选择确保了两种架构都编译为标量指令序列,从而将性能差异隔离在拓扑结构的运算组合和内存访问模式本身。
模型与基准测试: 评估使用两个基准系统:Duffing 振子(加法可分离残差)和 Van der Pol 振子(乘法耦合残差)。HRPINN 架构使用显式欧拉积分器。
实现: 开发了一个基于 C++17 的无分配(allocation-free)标量推理引擎。该引擎支持 FP32 和训练后静态量化(INT16, INT8, INT6, INT4)。测试了两种 KAN 变体:一种是匹配 PyTorch 数值的默认实现,另一种是预计算节点差值倒数的优化变体。
指标:
延迟: 测量为残差分支和完整 HRPINN 步长的中值单次调用时间。
能量: 通过 120 秒执行窗口内的内联 USB 电流计进行测量,计算每步微分能量(E s t e p = ( P l o a d − P i d l e ) / steps/s E_{step} = (P_{load} - P_{idle}) / \text{steps/s} E s t e p = ( P l o a d − P i d l e ) / steps/s )。
可靠性: 通过从 20 个初始条件进行 2,000 步闭环展开来评估。发散定义为量化展开与 FP32 基准之间的欧几里得距离超过 0.1 的步骤。
归因: 通过单独量化特定组件(权重、激活、状态或输入)来隔离量化的影响。
关键结果 实验证实了所有三个假设:
延迟 (H1): KANs 明显慢于 MLPs。对于精度相当的配对,KAN 残差分支的执行速度比其对应的 MLP 分支分别慢 13.5 倍和 8.0 倍。在所有四个参数匹配的大小层级中,延迟比例范围在 4.7 倍至 14.5 倍之间。按每个参数归一化,KANs 每参数花费 41–93 ns,而 MLPs 为 6.2–8.0 ns。优化后的倒数变体仅恢复了 6–18% 的延迟,仍存在巨大差距。
能量 (H2): 能量消耗与延迟直接相关。KAN 配对在每步积分中的能量消耗分别是 MLP 的 11.3 倍和 5.6 倍(例如,最小配对为 3.7 µJ vs. 0.33 µJ)。两种架构之间的增量主动功率差异与零无异,证实能量惩罚完全是由执行时间而非更高的每周期功耗驱动的。
量化下的可靠性 (H3): 在量化下,KANs 的发散远早于 MLPs。在全 INT8 量化模式下,Duffing KAN Very Small 模型在中值 6.5 步时发生发散,而匹配的 MLP Tiny 模型在 282 步时才发散(差异达 43 倍)。
归因分析: 发散主要是由权重量化 引起的,而非输入侧节点间隔的误分配。仅量化输入对结果影响微乎其微。然而,量化权重导致 KAN 的发现精度严重下降(例如,Duffing 的 R 2 R^2 R 2 从 0.90 降至 -0.10,在 INT8 下),而 MLPs 则保持稳定。KAN 样条系数的异构分布使其对逐张量缩放极其敏感,这种缩放会不成比例地压缩较小的系数。
意义与结论 论文得出结论,尽管 KANs 在处理可分离残差时具有参数效率优势,但这种优势并不能转化为标量嵌入式核心上的部署成本。B-样条公式引入的执行和精度水平成本抵消了参数节省带来的收益。
部署指南: 对于嵌入式 HRPINN 部署,除非采用特定的量化协同设计,否则 MLP 残差分支是更可靠的默认选择。
优化的局限性: 经典的内核工程(例如,超越函数的查找表或预计算倒数)只能缩小一小部分延迟差距。一个完全优化的标量内核仍会比 MLPs 慢一个数量级。
未来方向: 作者建议未来的工作应专注于协同设计的量化方案(例如,针对样条权重的逐边或逐通道缩放),并在具备向量能力的处理器上评估这些架构,尽管 KAN 这种重 gather 操作且具有分支性的递归特性,本质上比稠密矩阵乘法更难向量化。
本研究强调,虽然在内存占用为主要约束且执行保持在 FP32 或 INT16 情况下,KANs 仍具有辩护空间,但它们目前尚缺乏在标准训练后量化下进行通用嵌入式 CPS 部署所需的鲁棒性和效率。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。