← 最新の論文
🤖 AI

DeVIT: Low-Power Vision Transformer Acceleration Using Delta Computation

本論文は、量子化モデルにおける値の局所性を利用して差分演算による乗算器レスの行列演算を可能にする、Vision Transformerのための低電力加速手法であるDeVITを提案する。

原著者: Reyhaneh Hosseinzadeh, Parham Zilouchian Moghaddam, Mehdi Modarressi

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Reyhaneh Hosseinzadeh, Parham Zilouchian Moghaddam, Mehdi Modarressi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに写真の認識方法(例えば、木の中にいる猫や、通りにある車を見つけることなど)を教えようとしていると想像してください。これを行うために、私たちは「Vision Transformer(ビジョン・トランスフォーマー)」と呼ばれる、脳のような特別なコンピュータ・プログラムを使用します。これらのプログラムは非常に強力ですが、巨大で、食欲旺盛な獣のようです。写真を一度見るたびに、数十億回もの微細な数学的計算を行う必要があり、膨大な量のメモリとバッテリー電力を消費します。このため、スマートフォンやドローンのような小型デバイスにこれらを搭載することは、オーバーヒートしたり電力が切れたりする恐れがあるため、非常に困難です。

この食欲旺盛な獣を飼いならすために、科学者たちは数学をより単純にする方法を試してきました。一つの人気のあるトリックは「量子化(クオンタイゼーション)」であり、これはロボットが使用する数値を丸めることに似ています。精密な小数を使う代わりに、ロボットは0、1、2、最大255といった、限られた整数のセットのみを使用します。これによりスペースは節約できますが、ロボットが数十億回の掛け算を行うことを止めることはできません。しかし、この丸め処理には隠れたボーナスがあります。ロボットは限られた特定の数値しか使えないように強制されるため、同じ数値を何度も繰り返し使うことになるのです。これは、もしシェフが5つの食材しか持っていなければ、同じスパイスの瓶を繰り返し使うようなものです。大きな疑問は、ロボットが次に同じスパイスを使おうとしていることに気づき、その作業をスキップしてエネルギーを節約できる仕組みを作れるか、ということです。

これこそが、DeVIT(Delta-coded Vision Transformer)の開発者たちが解決しようとした問題です。彼らは、これらの「Vision Transformer」は限られた数値の使用を強制されるため、重み(ロボットに何を探すべきかを伝える数値)が値として隣り合っていることが多いということに気づきました。例えば、ロボットが数値を5、次に6、次に7と掛ける必要がある場合、3つの別々の難しい計算を行う必要はありません。最初の計算を行い、次に少しだけ足し、さらに少しだけ足していくという方法で済ませることができます。

DeVITチームは、ロボットがこの「少しずつ足していく」トリックを行えるように、数値を整理する巧妙な方法を考案しました。彼らは数値を小さい順に並べて保存し、それらの間の「差分(デルタ)」のみを保存します。もし差が小さければ、ロボットは複雑な掛け算を行う代わりに、数値を「シフト(2や4を掛けるような操作)」して足すことができます。もし差がゼロ(つまり、前の数と同じ)であれば、ロボットは何もしなくて済みます。単に前の答えを再利用するだけです。

この手法を用いることで、研究者たちは、ロボットが行うべき計算量を最適化されていないバージョンのわずか0.53倍にまで削減できることを示しました。つまり、ロボットは半分以下の仕事量で済むのです。彼らのテストでは、この新しい設計は、一つの主要な計算ステップに対して159.57 nJ(ナノジュール)のエネルギーを使用しました。これは、彼らが比較対象とした既存の最高の「シフト・アンド・アド(シフトして足す)」手法よりも、約**5.5%**エネルギーが少ない数値です。

しかし、落とし穴もあります。これを機能させるために、研究者は数値を並べ替え、それらがどこに属するかについての追加情報を保存する必要があり、これが少し余分なメモリ空間を消費します。また、差分を近似しているため、精度にわずかなトレードオフが生じます。彼らの実験における異なるモデルでは、画像分類で最大3.11パーセントポイント、物体検出で2.53 mAPポイントの精度低下が見られました。これほど大きなエネルギー節約ができる一方で、これは非常に小さな代償ではありますが、この手法がまだあらゆる状況において完璧であるわけではないことを意味しています。

要するに、DeVITはロボットに「参照シート」を与えるようなものです。毎回数学の問題を一から計算し直す代わりに、ロボットはソートされた数値のリストを見て、次の数値がほんの少し先にあることを確認し、ショートカットを利用します。これにより、ロボットはより速く、よりエネルギー効率よく動作できるようになり、強力なAIをバッテリーを消耗させることなく日常的なデバイスで動かすという目標に一歩近づきました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →