Kaczmarz Linear Attention
本論文は、経験的に学習された更新係数を理論的に導出されたキーノルム正規化カチャマツステップサイズに置き換えた修正版ゲートドデルタネットであるカチャマツ線形アテンション(KLA)を導入し、モデルのアーキテクチャや状態形状を変更することなく、優れたパープレキシティ、長文脈安定性、およびデコーディング効率を実現する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに非常に長い本を読ませることを想像してください。ロボットは現在の文を理解するために、以前読んだ内容を記憶しておく必要があります。
問題:「二次関数的」なボトルネック
従来の AI モデル(トランスフォーマー)は、新しい単語を読むたびに、すべての過去の単語とのつながりを確認するために、全体の本を振り返って調べる学生のように動作します。本が短ければ問題ありません。しかし、本が 10 万ページもある場合、学生は単語一つ一つに対して膨大な作業を強いられます。これはあまりにも遅く、高価になり、実質的に拡張することが不可能になります。
解決策:「再帰的状態」
新しいモデルは、この問題を修正するために、固定サイズの小さなノートを持つ学生のように動作しようとします。本全体を振り返る代わりに、読むにつれてノートを更新します。最も重要な部分を書き留め、それ以外は忘れ、動き続けます。これは高速(線形時間)ですが、正しく行うのは困難です:何を書き留めるべきか?どれくらい消すべきか?そして、同じトピックが再び現れた場合、どのようにノートを更新すべきか?
以前の試み:ゲート付きデルタネット(GDN)
ゲート付きデルタネット(GDN)と呼ばれる人気のあるモデルは、「ノート」アプローチを使用します。新しい情報を見ると、自分が知っていると思っていることと、実際に見ていることとの差を計算し、その差をノートに書き込みます。
しかし、GDN には欠点があります。それは「学習された推測」(トレーニング中に導き出される数値)を使用して、どの程度の大きさの変更を行うかを決定することです。まるで学生が、「うーん、この内容は 5 号のマーカーで書き留めるべきかな」と推測しているようなものです。時にはページを滲ませるほどマーカーが大きすぎたり、逆に文字が薄くて見失われるほど小さすぎたりします。この推測は、モデルが学習した習慣に過ぎず、数学的な規則ではありません。
新しいアイデア:カチャマールツ線形アテンション(KLA)
この論文の著者、Jiaxuan Zou とその同僚たちは、「推測を止めて、変更の大きさを正確に決定するために数学を使えないか?」と問いかけました。
彼らは、カチャマールツ射影と呼ばれる古い数学的手法に注目しました。
- アナロジー: 紙の上に特定の点を通る線を引こうとしていると想像してください。あなたは定規(現在の状態)を持っています。定規がその点に当たらない場合、定規を少しずらす必要があります。
- 洞察: カチャマールツ法によれば、定規をずらす最良の方法は、その点の「強さ」や「大きさ」を測定することです。点が非常に「大きい」(強い信号)場合、その点に合わせるためにはわずかなずらしで済みます。点が「小さい」(弱い信号)場合、大きなずらしが必要です。
論文の用語では、「キー」(信号)を見て、その強さ(ノルム)を測定します。そして、正確なステップサイズを計算します:
ステップサイズ = (学習率)/(信号の強さ)
これがカチャマールツ係数です。
何が変わったのか?
著者たちは新しいロボットや新しいノートを作ったわけではありません。ハードウェアも変更していません。単に、GDN モデル内の「推測」の数値を、この正確で数学的に導き出された数値に置き換えただけです。
- 旧方式: 「トレーニングデータがそう指示しているので、この内容は 0.5 のマーカーサイズで書き留めます」
- 新方式(KLA): 「この信号の大きさで割った 0.5 のマーカーサイズで書き留めます」
結果
この新しい規則は、メモリ更新という特定の作業に対して数学的に完璧であるため、モデルのパフォーマンスが向上しました:
- より賢い: 前の文の次の単語を、以前の最高性能モデルよりも正確に予測します(「パープレキシティ」が低い)。
- より長い記憶: 以前のモデルが混乱し始めたり忘れ始めたりするのに対し、65,000 語までの非常に長いコンテキストを処理できます。
- タスクへの優位性: 巨大な「干し草の山」の中から特定の「針」を見つけるテストでは、KLA は 100% 正解し、他のモデルは見逃しました。
- 同等の速度: ノートの構造ではなく、更新の数学式のみを変更したため、モデルは以前と同じ速度で動作します。実際、長い長さでのデコード(テキスト生成)は 2.1 倍高速です。
まとめ
この論文は、KLAを紹介しています。これは、先行モデルと同じ高速で効率的な構造を維持しつつ、「推測」に基づく更新規則を、正確で数学的に導き出されたものに置き換えたモデルです。これは、すでに良く走る車を運転手の推測から、完璧な GPS 航法システムに乗り換えるようなものです。車は同じですが、目的地への到達がより正確かつ効率的になります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。