From Physics to Attention: Building Vision Transformers from Oscillatory Neural Network Hardware
本論文は、蔵本モデルに基づく畳み込み層とホップフィールド・モデルに基づく線形層を振動型ニューラルネットワーク(ONN)アーキテクチャへと統合した、スケーラブルな畳み込みビジョン・トランスフォーマーであるHoKuVitを紹介し、CIFAR-10において最先端の性能を達成すると同時に、ONNをディープAIパイプラインへとスケールアップさせるための実行可能な経路を示すものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代のコンピュータは驚異的な速さを誇りますが、同時に電気を大量に消費します。人工知能が複雑さを増すにつれ、これらのシステムを動かすために必要なエネルギーが重大なボトルネックとなっています。科学者たちは、ニューロンが情報を処理する方法、すなわち低電力で高効率な方法で情報を処理するマシンを構築することを目指し、長らく人間の脳からインスピレーションを得ようとしてきました。有望な道の一つに、「振動型ニューラルネットワーク」があります。これは、微小な電子回路のリズミカルな脈動を利用してデータを保存・処理するタイプのコンピューティングです。従来のチップのような安定したバイナリ(二進法)のオン・オフ・スイッチに頼る代わりに、これらのシステムは波のタイミングと同期を利用します。研究者たちは、単純なパズルを解くための小さなバージョンのネットワークの構築には成功していますが、それらをスケールアップさせることには苦労してきました。課題は、これらのリズムを持つ回路を、今日の最先端のビジョンシステム(写真の中の物体を人間のような正確さで認識できるもの)を支えているような、深く層状のアーキテクチャへと結合することでした。
ハンガリーのパズマーニー・ペーテル・カトリック大学の研究チームは、このスケーリングの問題を解決するための重要な一歩を踏み出しました。彼らは「HoKuVit」と呼ばれる新しいタイプの人工知能モデルを設計しましたが、これはほぼすべてがこれらのリズムを持つ振動成分から構成されています。研究者たちは、2つの特定の物理的原理を単一の動作するシステムへと統合することに成功しました。第一の原理は、画像の異なる部分が互いにどれだけよく同期するかによって視覚情報をフィルタリングするフィルターとして機能する、結合された振動子のネットワークです。第二の原理は、システムが認識されたパターンを表す安定した状態に落ち着くメモリとして機能するネットワークを使用します。これら2つの物理的挙動を階層構造の中に織り交ぜることで、チームは、単なるデジタル論理ではなく物理法則に基づいて動作するビジョントランスフォーマー(画像を分析できる現代のAIアーキテクチャ)を作り上げました。
研究者たちは、飛行機、猫、トラックなど10種類の異なるカテゴリーを含む6万枚のカラー画像を集めた標準的なデータセットであるCIFAR-10を用いて、この創造物をテストしました。これは、振動型ネットワークのテストによく使われる単純な数字認識の実験よりもはるかに困難なタスクです。HoKu中Vitモデルは、80パーセント近い精度を達成しましたが、これは振動力学に基づいたアーキテクチャの中で報告された最高の結果です。これは、同じアーキテクチャの標準的なデジタル版が達成した92パーセントの精度よりは低いものの、このトレードオフは意図的なものです。目標は、現在のデジタルチップの生の速度に追いつくことではなく、これらの物理回路が複雑な現実世界の視覚的タスクを扱うように訓練できることを証明することにあります。モデルは約87万個のパラメータを含んでおり、その約88パーセントが振動成分によって実装され、最終的な意思決定レイヤーのみがデジタルとして残っています。
この研究が特に注目に値するのは、研究者がどのようにシステムを訓練したかという点です。伝統的に、振動型ネットワークは固定されたルールや、複雑なデータに適応することを許さない単純な学習法を用いて設計されてきました。本研究において、チームは現代のディープラーニングモデルの訓練における標準的な手法である「バックプロパゲーション(誤差逆伝播法)」を用いました。彼らは、振動回路が内部の接続やリズムを自ら調整してエラーを最小化するように教え込み、システムが画像から直接学習できるようにしました。「メモリ」部分のネットワークは、各オブジェクトのカテゴリーに対して明確で安定したパターンに落ち着くことを学習し、「フィルター」部分のネットワークは、画像の重要な特徴を強調するためにそのリズムを同期させることを学習しました。研究者たちは、これらのデジタルシミュレーションが、物理デバイスにおいて実際にどのように振る舞うかを検証しました。つまり、正しい答えを見つけるにつれてシステムのエネルギーが減少していく様子は、まるでボールが最も低い地点を見つけるために丘を転がり落ちていくかのようです。
また、この研究では、もしこれらが実際の不完全なハードウェアで構築された場合に、これらのシステムがどの程度堅牢であるかについても調査されました。物理回路はしばしば、コンポーネントの微細なばらつきや信号のノイズに悩まされます。研究者たちは、モデルの計算にランダムなノイズを加え、メモリの重みの精度を下げることで、これらの不完全性をシミュレートしました。システムは驚くほど高い回復力を示しました。メモリの重みが非常に低い精度まで低下したり、かなりのノイズが導入されたりしても、精度は1パーセント未満しか低下しませんでした。これは、このアーキテクチャが物理的な実装に適していることを示唆しています。なぜなら、デジタルコンピュータが要求するような完璧な精度を必要としないからです。研究者たちは、もし振動部分が無視できるほどの電力を消費するならば、専用のハードウェア上に構築された場合、エネルギー節約効果は相当なものになり、完全にデジタルなシステムと比較して4倍の効率向上を実現できる可能性があると推定しています。
この研究は、理論物理学と実用的な人工知能の間の溝が狭まっていることを示しています。電子回路のリズミカルな振る舞いを制限としてではなく、計算の核となるエンジンとして扱うことで、研究者たちは、今日私たちが使用しているものとは根本的に異なるディープラーニングモデルを構築することが可能であることを示しました。HoKuVitモデルは、人工知能が物理システムの自然なダイナミクス上で動作する未来へのブループリントであり、よりスマートであるだけでなく、よりエネルギー効率の高いマシンへの道を提示しています。現在のモデルはまだシミュレーション段階ではありますが、概念実証は明確です。すなわち、振動子のリズミカルな鼓動は、確かに世界を見、理解するために活用できるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。