← 最新の論文
🤖 machine learning

LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining

本論文は、局所的なパターンを捉えるためのLocal Fusion Attentionと、明示的なグローバル知識の検索のための分離されたKnowledge Memory Moduleを統合することで、事前学習の効率と収束速度を向上させる新しい大規模言語モデルアーキテクチャであるLoKiFormerを提案する。

原著者: Qiuwu Chen, Zimo Liu, Yuchen Li, Ying Sun, Yifan Zhang, Zhijie Qiu, Zeng You, Ryan Dong, Simeng Ma, Yaofo Chen, Mingkui Tan

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Qiuwu Chen, Zimo Liu, Yuchen Li, Ying Sun, Yifan Zhang, Zhijie Qiu, Zeng You, Ryan Dong, Simeng Ma, Yaofo Chen, Mingkui Tan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、賢いロボットに読み書きを教えようとしているところだと想像してください。このロボットは「大規模言語モデル(LLM)」と呼ばれる、物語を書いたり数学の問題を解いたりすることに驚くほど長けた人工知能の一種です。しかし、そこには落とし穴があります。これらのロボットに教えることは、ティースプーンでスイミングプールを満たそうとするようなものです。膨大な時間とコンピュータの計算能力が必要であり、ロボットは時として、自分が実際に何を学んでいるのかについて混乱してしまうことがあります。

なぜそうなるのかを理解するために、人間が文章を読む方法を考えてみてください。私たちは、隣り合う単語(例えば「熱い」と「コーヒー」)が通常つながっていることを即座に理解しますが、同時に、数年前に学んだ事実(例えば「コーヒーは豆である」こと)も思い出す必要があります。現在のAIモデルは、「アテンション(注意)」と呼ばれるメカニズムを使用して、これら両方を同時に行おうとします。これは、文章内のあらゆる単語をすべて見て、それらがどのように関連しているかを確認する仕組みです。問題は、これがまるでページのすべての文字を一度に凝視しながら本を読もうとしているようなものであり、局所的な接続にとっては非常に疲れやすく、非効率的だということです。また、ロボットが一般的な知識(歴史や科学に関する事実など)を蓄えようとするとき、その知識を脳の奥深くに乱雑な形で隠してしまい、必要なときに正しい事実を取り出すのが難しくなります。科学者たちは、より速く学習し、より少ないエネルギーを使い、情報を正確に見つけ出せるロボットを構築したいと考えています。

そこで、AIの脳の優れたアップグレードとして、ロボット用の「賢い眼鏡」と「メモリバンク」の役割を果たす新しい設計、LoKiFormerが登場しました。Qiuwu ChenとZimo Liuが率いる研究チームは、従来の方法ではエネルギーが浪費されていることに気づきました。彼らは、ロボットの学習プロセスを修正するために、2つの新しいツールを提案しました。一つは「局所的な(ローカルな)」事柄(隣り合う単語同士の関係)を扱うためのもので、もう一つは「全域的な(グローバルな)」事柄(現実世界の大きな事実)を扱うためのものです。

まず、彼らは局所的な問題に対して、Local Fusion Attention (LFA) と呼ばれるものに取り組みました。あなたが文章を読んでいる場面を想像してください。ロボットが、段落内の「猫」という単語が他のすべての単語とどのように関係するかをすぐに理解しようとする代わりに、LFAはロボットに特別な「局所用双眼鏡」を与えます。この双眼鏡は、すぐ隣にある数個の単語だけにズームインし、それらを最初に混ぜ合わせます。それは、ロボットが街全体を理解しようとする前に、まず近所の様子を素早く簡単に要約するようなものです。これにより、ロボットは不必要な作業を回避できます。論文によれば、このシンプルなステップを加えることで、ロボットは局所的なパターンをはるかに速く理解できるようになり、後でより複雑で大きな関係性に脳のパワーを集中させることができるようになります。

次に、彼らはメモリの問題を解決するために、Knowledge Memory Module (KMM) を導入しました。古いモデルでは、ロボットの知識は、本が棚に接着され、読み方の指示書と混ざり合っている図書館のような状態でした。もしロボットが「物理学」についての事実を探したいと思ったら、乱雑な図書館全体をかき回さなければなりませんでした。LoKiFormerのKMMは、読み方の指示とは別に、完璧に整理されラベルが貼られた「ファイルキャビネット」のようなものです。これは、事実を特定の、アドレス指定可能なスロットに保存します。ロボットが「化学」について知る必要があるとき、注意が散漫になることなく、直接「化学」の引き出しへと歩いていき、正しいファイルを取り出すことができます。これにより、知識の「保存」と「使用」を分離し、プロセスをより明確で柔軟なものにしています。

これら2つのツールを組み合わせた結果は、目覚ましいものでした。研究者たちがこの新しいLoKiFormerモデルを訓練したところ、標準的なモデルよりも1.33倍速く学習することがわかりました。これを換算すると、標準的なモデルがある理解レベルに達するのに10,000ステップの訓練が必要だったのに対し、LoKiFormerはその同じレベルにわずか7,500ステップで到達したのです。これは、時間とエネルギーの巨大な節約です。さらにエキサイティングなことに、彼らのモデルの小型版(70億パラメータ)は、他社のより大規模で有名なモデルよりも優れた性能を発揮し、言語理解、推論、さらにはコーディングのテストにおいてそれらを打ち負かしました。

この論文は、この新しいアーキテクチャが単にロボットを速くするだけでなく、ロボットが持っている知識を使う能力をより賢くすることを提案しています。「局所的な」読解と「全域的な」メモリを分離することで、モデルは複雑なタスクをより効果的に処理できるようになります。研究者たちはまた、「ファイルキャビネット(KMM)」が訓練中に実際に自己組織化され、異なる引き出しが歴史、物理、代数といった異なる主題のエキスパートへと自然に変化していったことも示しました。これは、ロボットが単に暗記しているのではなく、人間が自身の知識にアクセスする方法に似た方法で情報を検索することを学んでいることを意味します。

要するに、LoKiFormerは、AIモデルをより良くするために、モデルをより大きく、より高価にする必要はないことを示唆しています。細部を見るためのより良いツールと、大きな事実を保管するためのよりクリーンな方法を与えることで、より速く学習し、訓練コストが低く、世界をより明確に理解できるAIを構築できるのです。これは、超知能マシンを構築するための最善の方法は、時として、そのデスクを整理整頓させる手助けをすることである、ということを思い出させてくれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →