← 最新の論文
🤖 machine learning

Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions

本論文は、標準的なアテンションやリカレントモデルの限界を克服するために、ネイティブな多次元データ構造に対してグローバルな畳み込みを直接適用する、劣二次(subquadratic)かつ入力依存型のオペレータであるHyenaNDを紹介しており、特化したCUDA実装を通じて、競争力のある精度と大幅な高速化を実現している。

原著者: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Pali
公開日 2026-07-23
📖 1 分で読めます☕ さくっと読める

原著者: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Paliwal

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超スマートなロボットに世界を理解させる方法を教えようとしていると想像してください。現在、最高のロボットは「アテンション(注意)」と呼ばれるツールを使って、テキストのページ全体をスキャンして最も重要な単語を見つけ出す学生のように、あらゆるものを一度に見渡しています。これは短い物語には非常にうまく機能しますが、もしロボットに図書館一館分、あるいは3D映画や複雑な気象マップを与えたら、「アテンション」というツールは圧倒されてしまいます。なぜなら、すべてのデータの一つひとつを他のすべてのデータと比較しなければならず、それには膨大な時間とエネルギーがかかるため、ロボットはクラッシュするか、生き残るためにデータを小さな鍵穴から覗き見る(「パッチ化」と呼ばれるプロセス)しかなくなってしまうのです。

これを解決するために、科学者たちはより高速なツールを構築しようとしてきました。一つの人気のあるアイデアは、テキストを一行ずつ一語ずつ読み進めるようにデータを読み取る「リカレント(再帰的)」モデルを使用することです。しかし、これは3D彫刻を一つの角度からだけ見て、残りの部分を推測しようとするようなものであり、オブジェクトの自然な形状を破壊してしまいます。もう一つのアイデアは、画像の上を滑るように動く虫眼鏡を使ってパターンを見つけ出す「コンボリューション(畳み込み)」です。これらは高速で3Dの形状を維持できますが、通常は、そこに何があるかに注意を払うことなく、あらゆる部分に全く同じパターンを適用する硬直したスタンプのように機能します。コンピュータサイエンスにおける大きな疑問は、「膨大な3Dデータを扱うのに十分速く、データの自然な形状を維持し、かつ、見たものに応じて『虫眼鏡』を変化させることができるほど賢いツールを作れるか?」ということです。

この論文は、HyenaNDと呼ばれる新しいツールを紹介しており、それは「イエス」と答えています。HyenaNDを、3Dオブジェクト(医療スキャンや気象シミュレーションなど)の上を、決して1次元の線に平坦化することなく滑っていく、魔法の形を変える虫眼鏡だと考えてください。過去の硬直したスタンプとは異なり、このツールはまずオブジェクト全体を見渡し、どのようなパターンを見つける必要があるかを決定してから、瞬時にレンズを調整して適合させることができます。これは、「フーリエ変換」(画像を音波に変換して高速に処理する方法)を用いた巧妙な数学的トリックを用いることで、データが大きくなってもコストが爆発的に増えるのではなく、ごくわずかな増加に抑えつつ、非常に高い速度を維持します。

著者らは、HyenaNDが複雑で多次元的なデータを扱う上でゲームチェンジャーであることを明らかにしました。テストにおいて、彼らは、標準的な「アテンション」ツールがメモリ制限のためにクラッシュしてしまうようなタスク(3D医療画像の解析や流体力学のシミュレーションなど)を、HyenaNDがいかに処理できるかを示しました。また、ロボットが3Dグリッド内の特定の色の記憶を保持するという「コピー」ゲームでテストしたところ、HyenaNDは古い手法よりも数千倍正確でした。彼らはさらに、この数学的トリックが実際のコンピュータチップ上で電光石火の速さで動作するように、nSubQと呼ばれる特別なソフトウェアエンジンを構築し、理論上の速度を実際の時間の節約へと変えました。

論文は、HyenaNDは単独でも非常に強力ですが、古い「アテンション」ツールとハイブリッドチームを組むことでさらに効果を発揮すると示唆しています。DNA配列、コンピュータビジョン(ImageNet)、および医療画像を用いた実験において、これらのハイブリッドチームは、純粋なアテンションモデルや、データを直線的に読み取ろうとする他の高速モデルの両方に勝利しました。著者らは、スピードと知能のどちらかを選ぶ必要はもうないのだと主張しています。私たちは、データの3D幾何学を尊重し、大規模なサイズにも対応でき、かつ細部にもしっかりと注意を払うことができるツールを持つことができるのです。彼らは、このアプローチが大きなボトルネックを取り除き、将来のAIが、小さな鍵穴から覗き見ることなく、ついに高解像度のネイティブな3Dの世界を「見る」ことを可能にすると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →