← 最新の論文
🤖 machine learning

TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling

本論文は、標準的なTransformerのサブレイヤーをクロス・トークン・ゲート付き残差更新に置き換えることで、数学および教育データセットにおいて優れた性能を実現する新しい言語モデルアーキテクチャであるTANGOと、既存の線形時間モデルを凌駕するその線形計算量バリアントであるWANGOを紹介するものである。

原著者: Joshua Nunley

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Joshua Nunley

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界において、言語を理解するための最も強力なツールは、トランスフォーマーと呼ばれる構造に基づいています。長い文書をスキャンする読者を想像してみてください。特定の単語を理解するために、その読者は文脈を把握できるよう、その前に来た単語を振り返って確認しなければなりません。標準的なAIモデルは、2つの異なるステップを用いてこれを行います。まず、テキストの全履歴をスキャンして、過去の単語から関連する情報を収集します。これは、司書が特定のトピックに関連するあらゆる本を素早く探し出す作業に似ています。次に、集められた情報を、文章内のあらゆる位置において、個別の独立したフィルターを通して処理し、意味を洗練させます。この2ステップのダンスは、この分野でうまく機能してきましたが、計算負荷が高く、特にテキストが長くなるにつれて、新しい単語を生成するたびにモデルが膨大な量の計算を行う必要があります。研究者たちは、これらのステップを組み合わせるか、あるいは合理化する方法を長らく模索してきました。それは、膨大な情報の処理に必要な数学的重圧によって足止めされることなく、よりスマートで効率的なモデルを構築することを目的としています。

インディアナ大学ブルーミントン校の研究者が、これらのモデルと言語との関わり方を根本的に変える新しいアプローチを導入しました。彼らはその創造物を、トークン集約型非線形ゲーティング・オペレーター(Token-Aggregated Nonlinear Gating Operators)を意味するTANGOと呼んでいます。情報収集と情報洗練のステップを別々に保つ代わりに、TANGOはそれらを単一の統一されたアクションへと融合させます。この新しい設計では、文章内のすべての単語が制御の源として機能します。モデルが文章を読み進める際、各単語は、テキストのさまざまな特徴に対してどの程度の重要性を置くかを決定する、特定の指示のセット、すなわち「ゲート」を生成します。モデルが新しい単語に到達したとき、単に過去の最も関連する単語を探すだけでなく、それらの過去の単語がどのような指示を準備してきたかを確認します。そして、それらの指示を平均化し、それを用いて現在の単語の特徴をスケール(調整)してから、モデルのメモリに追加します。これは、過去の単語の影響力が、単にそれが何を言っているかだけでなく、それが現在の単語に対してどのように自身を解釈すべきかをどのように指示するかにあることを意味しています。

研究者は、精度と速度のトレードオフをテストするために、2つのバージョンのシステムを開発しました。最初のTANGOは、テキストの中でどれほど遡ったとしても、現在に至るまでのあらゆる単語を注視します。この「フル・プレフィックス(完全接頭辞)」アプローチにより、モデルは会話や文書の全履歴から情報を引き出すことができ、非常に精度の高い文脈理解をもたらします。しかし、現在の単語を以前のあらゆる単語と比較しなければならないため、テキストが長くなるにつれて、その作業量は急速に増大します。2つ目のバージョンであるWANGOは、非常に長いテキストに対してより実用的なアプローチを取ります。それは直近の単語に細心の注意を払い、それらを最初のモデルと同じ詳細な全履歴ケアで扱います。一方で、直近のウィンドウの外にある古い単語については、WANGOはより効率的な方法を用いて、それらの影響力を要約します。それは、それらの古い単語が生成した指示の経過的な集計値を維持することで、個々の単語との関係を再計算することなく、それらの知恵を取り入れることができるようにしています。この修正により、WANGOの作業量は、テキストが長くなるにつれて複雑さが爆発するのではなく、直線的に増加するようになり、長いシーケンスに対してもはるかに高速になります。

これらの新しい設計が既存のテクノロジーに対してどのように通用するかを確認するため、研究者は全く同じ量のデータ、同じ数のパラメータ、および同じトレーニング・スケジュールを使用して、6つの異なるモデルを訓練しました。彼らは、教育的なウェブテキストの膨大なコレクション、Leanと呼ばれるプログラミング言語で書かれた形式的な数学的証明のライブラリ、およびDeepMindの数学問題のスイートという、3つの非常に異なる課題に対してこれらのモデルをテストしました。結果は、全履歴ビューを持つTANGOモデルが、これら3つのテストすべてにおいて最高の精度を達成し、シーケンスの次の単語に対して最も信頼性の高い予測を行ったことを示しました。TANGOは、層間でパラメータを共有する従来の手法を用いるモデルを含む、他のすべてのモデルを凌駕しました。WANGOモデルも、特に効率性を重視したモデルのカテゴリーにおいて、非常に優れた性能を発揮しました。計算コストが制御不能になることなく長いテキストを扱うことができるアーキテクチャの中で、WANGOは最も正確な結果を生み出しました。それは、同程度の計算量を用いながら、より古い標準的な手法に依存していたモデルをも上回りました。

この研究は、これらのシステムがどのように構築され得るかについての重要な転換を浮き彫りにしています。集約されたゲートを通じて、言葉が他の言葉の処理を制御できるようにすることで、研究者は、強力でありながら、かつWANGOの場合のように効率的なモデルを構築する方法を見出したのです。TANGOモデルは、情報の収集と洗練のための単一の統一されたステップが、たとえモデルに多くの数学的作業を強いたとしても、従来の2ステップのプロセスを上回ることができることを実証しました。一方で、WANGOモデルは、高いレベルのパフォーマンスが速度を犠牲にすることなく実現できることを証明しました。古い情報を知的に要約することにより、高い精度を維持しながら、計算コストを管理可能な状態に保ったのです。研究者は、これらの知見が、言語理解の標準的な尺度である「シーケンス内の次の単語を予測する能力」に基づいていることを慎重に注記しており、これらのモデルが必ずしも数学的問題を解決したり、証明を完璧に書いたりできると主張したわけではないことを述べています。しかし、結果は、この新しいゲーティングによる情報の集約方法が、より精密かつ効率的に複雑な言語と長い文脈を理解できるAIを構築するための、有望な道筋を提供していることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →