大问题:以光速学习
想象你正在驾驶一艘飞船,它的移动速度极快,如果你等待哪怕一丁点时间去检查仪表盘,你就已经撞毁了。这就是像量子计算机和核聚变反应堆这类系统的现状。它们的变化速度极快(在微秒级别),传统的计算机反应太慢了。
通常,当计算机进行学习时,它会将数据发送给一个巨大的“大脑”(比如服务器或云端计算机),等待大脑完成数学运算,然后再将答案传回。等到答案到达时,情况早已发生了变化。
目标: 研究人员想要构建一个完全生活在机器内部(在芯片上)的“大脑”,它能够即时学习和适应,永远不需要离开设备。
旧方法 vs. 新方法
为了解决这个问题,团队对比了两种类型的学习模型:
旧方法 (MLPs - 多层感知机): 可以把它想象成一个巨大的、致密的网。要学习新知识,整个网都必须震动并重新排列。网中的每一根线都与其它所有线相连。
- 问题所在: 在空间和功耗都有限的微型芯片上,试图摇晃这整个网既慢又耗能。这就像试图通过重构整幅挂毯来修复其中一根松动的线。此外,当你尝试用低精度进行数学运算(比如使用只有大刻度的尺子)时,这个网会变得摇摆不定并发生崩溃。
新方法 (KANs - Kolmogorov-Arnold 网络): 把它想象成一面由富有弹性的橡胶带(称为 B-splines)组成的模块化乐高墙。
- 神奇的技巧: 当墙需要学习新知识时,你不需要触动整面墙。你只需要触碰发生变化的那个位置附近的少数特定橡胶带。
- 论文的观点: 因为这些橡胶带只影响它们的直接邻居(这种特性称为“局部性”),所以计算机每次更新只需进行极少量的数学运算。这使得它极其快速且高效。
为什么 KANs 对微型芯片更友好
论文强调了这种“乐高墙”方法在硬件芯片上胜出的三个主要原因:
“稀疏”更新: 想象你在画一幅壁画。
- MLP: 为了修复一个污点,你必须重画整面墙。
- KAN: 你只需要重画污点所在的那个小方块。
- 结果: KAN 使用的计算能力和内存要少得多,使其能够适配那些无法承受 MLP 沉重负载的小型芯片(FPGA)。
“稳定”的数学:
- MLP: 如果你尝试用低精度的尺子(定点数)进行数学运算,MLP 的计算可能会失控,就像麦克风离扬声器太近时发出的尖叫声一样。
- KAN: 橡胶带能自然地将数学运算保持在安全、可预测的范围内。即使使用低精度的尺子,KAN 也能保持稳定而不会崩溃。
在不崩溃的情况下成长:
- MLP: 要让 MLP 变得更聪明,你必须为整个网增加更多的线,这会让它变得更慢、更重。
- KAN: 要让 KAN 变得更聪明,你只需增加橡胶带上的“网格点”。每次更新所需的数学量保持不变,但模型的预测能力却大大提升。这就像是在不增加梯子重量的前提下,为梯子增加更多的横档。
实验:实战测试
研究人员在 FPGA(一种可以随时重新编程的芯片)上构建了这些模型,并在三个高速场景中进行了测试:
- 漂移传感器: 想象一个校准随时间缓慢变化的传感器。KAN 能够即时追踪这些变化,而 MLP 则会感到困惑并失去追踪。
- 量子读取: 他们尝试读取一个量子比特(qubit)的状态,这种状态非常嘈杂且形状多变。KAN 学会在实时状态下正确读取它,而 MLP 则要么失败,要么需要巨大的功耗。
- 机器人控制: 他们尝试控制一个双摆机器人(Acrobot),其重量会随机变化。KAN 能快速学会如何保持平衡,而 MLP 则难以适应。
核心结论
论文声称,这是首次展示了一台机器可以在小于一微秒(一百万分之一秒)的时间内,完全在芯片上实现学习和适应,而无需依赖超级计算机。
通过使用“乐高墙”方法(KANs)而非“致密网”(MLPs),他们实现了:
- 速度: 更新发生在 100 纳秒以内。
- 效率: 使用了 3 到 4 倍少的硬件资源。
- 稳定性: 即使使用简化的数学运算,系统也不会崩溃。
简而言之,他们找到了一种让 AI 实现“即时学习”的方法,使其能够跟上宇宙中最快的物理系统,而这在以前使用标准 AI 模型是无法实现的。
技术摘要:利用样条局部性实现基于 Kolmogorov–Arnold 网络(KAN)的超快速片上在线学习
1. 问题陈述
本文解决了在对响应时间要求极高的系统中,如何实现超快速无模型在线学习的关键挑战,这类系统要求在亚微秒级时间尺度内完成自适应。这对于量子计算控制、核聚变等离子体诊断以及高速通信等领域至关重要。
目前的方法面临显著瓶颈:
- 主机-加速器延迟: 传统的训练循环涉及离片梯度计算和参数更新(例如通过 PCIe),其速度太慢;当参数返回时,系统的运行条件可能已经发生了变化。
- MLP 的局限性: 传统的多层感知器(MLP)在严格的片上训练约束下效率低下且数值不稳定:
- 资源缩放: MLP 需要对所有参数进行稠密梯度更新,导致随着模型容量增加,片上资源(DSP、LUT、FF)和延迟呈线性增长。
- 定点数不稳定性: 由于存在无界的激活值和梯度缩放,在低精度(定点算术)条件下,MLP 的梯度下降优化容易出现不稳定现象。
- 内存限制: 用于反向传播的稠密激活值和权重存储会超出 FPGA 有限的片上内存。
2. 方法论
作者提出利用 Kolmogorov–Arnold 网络(KAN) 作为 MLP 的硬件原生替代方案,特别利用了 B-样条基函数的局部性(Locality)。
理论动机:
- 稀疏更新: 与更新所有权重的 MLP 不同,KANs 利用具有局部支撑特性的 B-样条。对于样条阶数 S,每个输入样本仅激活 S+1 个系数,无论总网格大小 G 为多少。这使得单样本更新复杂度为 O(S+1),而非 O(N)(其中 N 是总参数量)。
- 容量缩放: 增加网格分辨率 G 可以提高近似质量,而不会增加每样本的计算量。这实现了容量与计算成本的解耦。
- 量化鲁棒性: KAN 的激活值是学习系数的凸组合,被限制在 min(Wi)≤ϕ(x)≤max(Wi) 范围内。同样,梯度也被限制在 B-样条包络 [0,1] 内。这种内在的边界限制防止了在激进的定点量化下常见的 MLP 数值不稳定问题。
硬件实现:
- 平台: 系统实现在 AMD Virtex UltraScale+ XCVU13P FPGA 上。
- 架构: 使用 Vitis HLS 合成自定义内核,目标时钟频率为 200 MHz。
- KAN 内核:
- 输入被映射到网格单元索引 (k) 和查找表(LUT)索引 (u)。
- 预计算的 B-样条值及其导数存储在小型 ROM LUT 中。
- 前向和反向传递仅更新每条边上的活跃系数 (S+1),避免了全局内存访问。
- 所有状态(参数、上下文)均驻留在片上(LUT/FF/BRAM);不使用外部 DRAM。
- MLP 基准: 实现具有相同流式接口和定点约束的稠密矩阵乘法和全局权重更新。
3. 核心贡献
- 首个亚微秒级无模型在线学习: 该工作展示了第一个在片上实现确定性延迟低于 100 ns(亚微秒级)的无模型在线学习。
- 硬件感知的 KAN 分析: 它识别并利用了 B-样条的局部性来实现稀疏更新,挑战了认为 KAN 因递归求值而导致硬件效率低下的看法。
- 定点数稳定性: 它提供了理论证明和经验证据,表明 KAN 在本质上对定点量化具有鲁棒性,能够在 MLP 失效的量化条件下保持稳定训练。
- 自定义 FPGA 实现: 实现了一个完整的片上训练流水线(前向、反向及参数更新),消除了主机-加速器之间的通信瓶颈。
4. 实验结果
作者在三个完全在线的基准测试中使用定点算术评估了该系统:
- 自适应函数逼近(漂移回归):
- KAN 追踪概念漂移(Regime Changes)的效果显著优于参数匹配的 MLP,其累积遗憾值(Cumulative Regret)更低。
- 在定点量化(2 位整数位)下,KAN 保持稳定,而 MLP 则表现出“精度悬崖”,需要更高的位宽才能稳定。
- 自适应单次脉冲(Single-Shot)量子比特读取:
- 在非线性可分的漂移 IQ 分类任务中,KAN 随着网格规模的扩大保持高运行准确率(>90%)。
- 在类似的定点约束下,即使增加参数量,MLP 也会无法收敛或发生发散。
- 非平稳 Acrobot 控制:
- 在每轮随机动力学的强化学习设置中,基于定点 KAN 的 Actor-Critic 智能体在大约 300 个回合内达到了求解状态。
- 即使拥有 10 倍的参数预算,基于 MLP 的 Actor-Critic 仍无法适应,除非使用更稳定的(但更慢的)DQN 式更新规则。
- 可扩展性:
- KAN 在各项任务中均实现了亚 100 ns 的前向和反向延迟。
- 资源使用量(DSP/LUT/FF)随活跃集大小 (S+1) 而缩放,而非随总参数量缩放,这使得通过增加网格大小 G 来提升容量成为可能,且保持近乎恒定的延迟。
- 布线后验证确认设计满足时序约束并具有正余量(Positive Slack),实现了远低于 1 µs 的端到端延迟。
5. 重要性与主张
本文主张 Kolmogorov–Arnold 网络非常适合超快速片上在线学习,即 MLP 在其中面临根本困难的领域。
- 架构优势: 通过将稠密且易受干扰的梯度更新替换为稀疏、针对性的系数调整,KAN 实现了优化的资源缩放。
- 硬件原生效率: 本文认为现代机器学习栈针对稠密线性代法(GPU)进行了优化,却忽视了局部基函数学习的优势。支持样条求值的自定义硬件使 KAN 的推理和稀疏更新变得“硬件原生”。
- 影响: 这种方法为需要亚微秒级响应时间的新兴应用(如量子控制、等离子体系统和高速网络)提供了可靠的无模型自适应能力,且无需承担主机-加速器循环带来的延迟惩罚。
作者对优化过程保持谦逊,指出虽然使用了高层次综合(HLS)进行快速原型设计,但手动 RTL 精炼可以进一步提高效率,目前的重点在于架构优势和数量级的对比,而非极端的底层硬件调优。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。