ロボットが正しく動くためには、物理法則を理解する必要があると想像してみてください。もし、単に何百万枚もの画像を見て物の動きを推測するようにロボットに教え込んだとしたら、新しいものを見た時に混乱したり、最悪の場合、存在しない物理法則を「幻覚」として作り出し、危険な間違いを犯してしまうかもしれません。これを解決するために、科学者たちは「物理情報に基づく(Physics-Informed)」モデルという巧妙なトリックを使います。これは、ロボットに既知の法則(重力や摩擦など)が書かれた教科書を与え、「これらのルールは完璧に理解しなさい。その上で、教科書が逃した微細で複雑な詳細については、あなたの脳を使って考えなさい」と伝えるようなものです。この「脳」は通常、ニューラルネットワークと呼ばれる、単純で高速なコンピュータプログラムです。
最近、Kolmogorov–Arnold Network(略してKAN)と呼ばれる新しいタイプのニューラルネットワークが非常に人気となりました。これは、従来の「脳」の超効率的で軽量なバージョンとして宣伝されており、メモリに保存する数値の量を減らしつつ、同じ仕事ができると約束されていました。これは、ドローンや医療センサーのような、メモリのわずかな容量やエネルギーのわずかな消費量さえも重要となる、小型でバッテリー駆動のデバイスにとって大きなニュースです。しかし、落とし穴があります。KANは、紙の上では省スペースであることは素晴らしいのですが、実際の小さなコンピュータチップ上で動作させる際には、不器用で動作が遅くなる可能性があるのです。大きな疑問は、この新しい「効率的な」脳は、実世界に配備された際に実際にエネルギーと時間を節約できるのか、それともその華やかな数学的構造のせいで使い物にならないほど遅くなってしまうのか、ということです。
本論文はこの問いを検証するために、旧来の「脳」(MLPと呼ばれます)を、新しいKANと、小型の実用的なコンピュータチップ(RISC-Vプロセッサ)の上で対決させました。研究者たちは単に学習の精度を見ただけではありません。意思決定に正確にどれだけの時間がかかったか、そしてそれぞれの計算ステップでどれだけのバッテリー電力を消費したかを測定しました。その結果、KANは確かにサイズこそ小さいものの、驚くほど動作が鈍く、エネルギーを大量に消費することが判明しました。同じタスクを実行した際、KANは従来のMLPよりも8.0倍から13.5倍遅いことが分かりました。さらに悪いことに、計算のステップごとに、KANは5.6倍から11.3倍多くのエネルギーを消費していました。
また、研究者たちは、スペースを節約するために数値を丸めるプロセス(量子化と呼ばれます)を行った場合に、これらのモデルがどうなるかもテストしました。これは、小型デバイスにおいて一般的な手法です。ここでも、KANははるかに早く崩壊しました。あるテストでは、KANの予測はわずか6.5ステップで大きく狂ってしまいましたが、従来のMLPは282ステップの間、正しく動作し続けました。これは信頼性において43倍もの差です。研究は、標準的な小型コンピュータチップ上では、KANの効率性の約束は成り立たないと結論付けています。エンジニアがKAN専用の特殊なハードウェアを設計しない限り、物理ベースのモデルを組み込みデバイスで実行するには、古風なMLPの方が、より信頼性が高く、速く、そしてエネルギー効率の良い選択肢であり続けるでしょう。
技術要約:ハード制約付き回帰型物理情報ニューラルネットワークにおける、埋め込み型RISC-Vを用いたKolmogorov–Arnoldネットワークの評価
問題提起
ハード制約付き回帰型物理情報ニューラルネットワーク(HRPINN)は、既知の物理ダイナミクスを回帰型の数値積分器に組み込み、ニューラル成分が残差ダイナミクスのみを学習するように制限するものである。マルチレイヤーパーセプトロン(MLP)に代わるパラメータ効率の高い手法としてKolmogorov–Arnoldネットワーク(KAN)が提案されているが、学習可能なB-スプライン活性化関数を持つため、その実行プロファイルは大きく異なる。先行研究では、KANが発見精度においてMLPと同等または下回る可能性があることは示されたが、その計算効率や信頼性の展開に関する評価は行われていない。本論文では、KANのパラメータ効率が、スカラー埋め込みコアにおける展開コストにどのように反映されるかを調査し、以下の3つの仮説(H1〜H3)を検証する。(H1) KANは、精度が同等のMLPよりもステップあたりの実行レイテンシが高くなる。(H2) このレイテンシの差により、積分ステップあたりのエネルギー消費量が増大する。(H3) 閉ループ回帰内での学習後量子化において、KANはMLPよりも早く軌道の忠実度を失う。
手法
本研究では、ベクトル拡張を持たないRISC-VコアであるStarFive VisionFive 2プラットフォーム(SiFive U74, RV64GC)上で、同一の学習済み重みを持つMLPおよびKANの残差ブランチの展開を評価する。このハードウェアの選択により、両アーキテクチャがスカラー命令シーケンスにコンパイルされることを保証し、性能の差をトポロジー自体の演算ミックスとメモリアクセスパターンに分離して抽出する。
- モデルとベンチマーク: 評価には、Duffing振動子(加法的分離残差)とVan der-Pol振動子(乗法的結合残師)の2つのベンチマークシステムを使用する。HRPINNアーキテクチャには、陽的オイラー積分器を用いる。
- 実装: C++17を用いた、メモリ割り当てフリーのスカラー推論エンジンを開発した。このエンジンは、FP32および学習後静的量子化(INT16, INT8, INT6, INT4)をサポートする。KANのバリアントとして、PyTorchの数値計算に一致するデフォルト実装と、ノット間差の逆数を事前計算する最適化版の2種類をテストした。
- 指標:
- レイテンシ: 残差ブランチおよびフルHRPINNステップの呼び出しごとの中央値として測定。
- エネルギー: 120秒間の実行ウィンドウにおけるインラインUSB電流計を介して測定し、ステップあたりの差分エネルギー(Estep=(Pload−Pidle)/steps/s)を算出。
- 信頼性: 20個の初期条件からの2,000ステップの閉ループロールアウトによって評価。発散は、量子化されたロールアウトとFP32ベースラインとの間のユークリッド距離が0.1を超えたステップとして定義される。
- 属性解析: 量子化の影響を特定するため、特定のコンポーネント(重み、活性化、状態、または入力)を個別に量子化して影響を分離した。
主な結果
実験の結果、以下の3つの仮説がすべて確認された。
- レイテンシ (H1): KANはMLPよりも大幅に遅い。精度が同等のペアにおいて、KANの残差ブライアンはMLPの対応物よりもそれぞれ13.5倍および8.0倍遅く実行された。全4種類のパラメータ一致サイズ層において、レイテンシ比は4.7倍から14.5倍の範囲であった。パラメータあたりの正規化された値では、MLPが6.2〜8.0 nsであるのに対し、KANは41〜93 nsを要した。最適化された逆数バリアントは、このレイテンシの6〜18%しか回復できず、依然として大きな差が残った。
- エネルギー (H2): エネルギー消費量はレイテンシに直接比例する。KANのペアは、MLPよりもステップあたりに11.3倍および5.6倍多くのエネルギーを消費した(例:最小のペアで3.7 µJ対0.33 µJ)。アーキテクチャ間の増分アクティブ電力の差はゼロと区別がつかず、エネルギーのペナルティはサイクルあたりの高い電力消費ではなく、実行時間に起因することが確認された。
- 量子化下での信頼性 (H3): 量子化下において、KANはMLPよりもはるかに早く発散する。フルINT8量子化モードにおいて、Duffing KAN Very Smallは中央値6.5ステップで発散したが、一致するMLP Tinyは282ステップで発散した(43倍の差)。
- 属性解析: 発散の主な原因は、入力側のノット間隔の誤設定ではなく、重みの量子化であった。入力のみを量子化した場合は影響がほとんどなかった。しかし、重みを量子化すると、KANの発見精度に深刻な低下が生じた(例:DuffingのR2がINT8で0.90から-0.10へ低下)。これは、KANのスプライン係数の不均一な分布が、テンソルごとのスケーリングに対して非常に敏感であり、小さな係数が不釣り合いに圧縮されてしまうためである。
意義と結論
本論文は、分離可能な残差に対して報告されているKANのパラメータ効率は、スカラー埋め込みコアへの展開コストには転移しないと結論付けている。B-スプラインの定式化は、パラメータの節約を相殺する実行および精度のコストをもたらす。
- 展開ガイダンス: 埋め込み型HRPINNの展開においては、特定の量子化共同設計が行われない限り、MLP残差ブランチがより信頼できるデフォルトである。
- 最適化の限界: 古典的なカーネルエンジニアリング(超越関数のルックアップテーブルや事前計算された逆数など)は、レイテンシの差のわずかな部分しか埋めることができない。高度に最適化されたスカラーカーネルであっても、依然としてMLPより1桁遅れる。
- 今後の方向性: 著者らは、将来の研究として、共同設計された量子化スキーム(スプライン重みのエッジごと、またはチャンネルごとのスケーリングなど)に焦点を当てることや、ベクトル能力を持つコアでの評価を提案している。ただし、KANのgather-heavy(集約処理が多い)で分岐の多い再帰構造は、密な行列積よりも本質的にベクトル化が困難である。
本研究は、メモリフットプリントが制約条件であり、実行がFP32またはINT16で維持される場合にはKANは正当化される可能性があるものの、標準的な学習後量子化を用いた一般的な組込みCPS(サイバー物理システム)の展開には、現在のところ堅牢性と効率性が不足していることを強調している。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録