MergeOver: Post-Training Token Merging for Recursive Vision Transformers
MergeOverは、トークン・マージングを再帰的に重み共有されたVision Transformerに統合することで、高精度を維持したまま、コストのかかる再学習を必要とせずにエッジデバイスにおけるメモリ使用量とレイテンシを大幅に削減するポストトレーニング手法である。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、写真を見るだけで猫、犬、車を識別できるように、超スマートなロボットに教えようとしていると想像してください。これを行うために、ロボットは「ビジョン・トランスフォーマー(Vision Transformer)」と呼ばれる特別な種類の脳を使用します。この脳は、写真のあらゆるピクセルごとに一人の小さな探偵がいるような、小さな探偵たちのチームだと考えてください。ピクセルが増えれば増えるほど、より多くの探偵が必要になり、彼らが何を見ているのかを突き止めるために、より多くの会話を交わさなければなりません。これは精度を高めるには素晴らしいことですが、スマートウォッチやRaspberry Piのような小さなコンピュータにとっては大きな問題です。なぜなら、何千人もの探偵が一度にチャットをするのを処理するためのメモリやバッテリーパワーが足りないからです。
これを解決するために、科学者たちは主に2つのトリックを試してきました。1つ目は「再帰的な重み共有(recursive weight-sharing)」です。これは、ステップごとに新しいチームを雇う代わりに、同じ仕事を行う一人のスーパー探偵が、自分のメモを何度も再利用するようなものです。これはスペースを節約できますが、探偵の仕事がより遅く、重くなります。2つ目のトリックは「トークン・マージング(token merging)」です。これは、いくつかの探偵が同じものを見ていることに気づき、時間を節約するために彼らを一つの大きな探偵へと統合してしまう手法です。大きな疑問は、もしこれら2つのトリックを同時に、しかもロボット全体を最初から訓練し直すことなく使おうとしたらどうなるか、ということです。それは、まるで、単一の探偵が、彼らが従っている地図を台無しにすることなく、作業中に自分のクローンと合体する方法を教えようとするようなものです。
この論文の著者である、トゥエンテ大学のJunseo Kim氏とそのチームは、これら2つの方法を混ぜ合わせようとすると、通常はゲームのルールが壊れてしまうため、災難をもたらすと述べています。彼らは、このパズルを解くために「MergeOver」と呼ばれる新しい手法を提案しています。ロボットの脳を、探偵が上の階へと移動していく多層ビルのようなものだと想像してください。階が変わるたびに、ビルの構造上、彼らは完璧な正方形のグリッドの中に立っていなければなりません。しかし、探偵をマージ(統合)することは、通常この正方形のグリッドを乱してしまい、エレベーターを故障させる空席を作ってしまいます。MergeOverは、巧妙な「アンマージ(Unmerge)」というトリックを導入しています。それは、エレベーターを通るためだけに、マージされた探偵たちを一時的に元のグリッド位置へと分割し、次の階に安全に到着した後に再びマージするというものです。これにより、ロボットは再学習することなく、メモリ使用量を低く抑えることができます。
チームは、強力なグラフィックスカードから非常に小さなRaspberry Pi 5に至るまで、さまざまなコンピュータを用いて、有名な画像データセットであるImageNet-1Kでテストを行いました。彼らは、MergeOverが機能することを発見しましたが、その結果はロボットに一度にどれだけの写真を処理させるか(バッチサイズ)に大きく依存します。ロボットが一度に1枚の画像だけを見る場合、マージとアンマージの追加作業が実際には処理を遅らせてしまいます。しかし、ロボットが一度に16枚の画像を見ると、魔法が起こります。強力なGPUを使用した場合、このセットアップによりメモリ使用量が38.4%削減され、実際にロボットの速度が21.7%向上しました。小さなRaspberry Piでは、バッチサイズ16において、ロボットが17.6%高速化されました。最も素晴らしいことは、ロボットがそれほど賢くなくなるわけではないということです。精度はわずか1.47パーセントポイントしか低下しておらず、著者らはこれを、これほどのスピードアップを得るための小さな代償であると述べています。
しかし、論文は、これがすべてを即座に解決する魔法の杖ではないことにも注意深く言及しています。著者らは、この手法をどんなモデルにも貼り付けて、どこでも完璧に動作することを期待してはいけないという考えに対し、明確に反論しています。彼らは、単一画像タスク(バッチサイズ1)の場合、「アンマージ」のオーバーヘッドが、たった1枚の画像に対しては割に合わないため、強力なコンピュータ上で処理を遅らせてしまうことを発見しました。また、彼らの手法はメモリを節約しバッチ処理を高速化しますが、最初から高速になるように設計された他のタイプの効率的なAIモデルを必ずしも打ち負かすものではないことも指摘しています。結果は測定に基づいた現実的なものですが、彼らはこれが、これらの技術を組み合わせるための有望な出発点、つまり「ベースライン」であり、最終的で完璧な解決策ではないことを示唆しています。著者らは、将来の研究において、特に小型デバイスでの単一画像タスクのために、MergeOverをより優れたソフトウェア最適化などの他のトリックと組み合わせる必要があるかもしれないと示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。