PERK: Long-Context Reasoning as Test-Time Learning
本論文は、入れ子状のメタ学習ループによるテスト時勾配更新を利用して、長いコンテキストを低ランクアダプターへとエンコードするパラメータ効率の高いフレームワークであるPERKを紹介しており、これは様々なモデルスケールにおける長文脈推論タスクにおいて、標準的なファインチューニングや特化型モデルを大幅に上回る性能を示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルは、膨大な量のテキストを学習することで、読み書きを習得した強力なツールです。これらのモデルは、目の前に情報がある場合には、パターンの発見や質問への回答に長けています。しかし、情報が必要な場所が、書籍一冊分に相当する文書や長いトランスクリプトのような、膨大なテキストの壁の中に埋もれている場合、モデルは重大な障壁に直面します。テキストが長くなるにつれて、モデルは無関係なノイズを無視し、問題を解決するために必要な特定の事実を見つけ出すことに苦慮することがよくあります。この困難さは、多くのモデルがテキストの最初または最後に強く焦点を当て、中間に隠れた詳細を見失う傾向があることによってさらに増幅されます。研究者たちは、ゼロから再学習させるという、しばしば禁止的なほど高価で時間がかかるプロセスを必要とせずに、これらのモデルがこのような「ロングコンテキスト(長文脈)」のタスクを処理できるようにする方法を長年模索してきました。
ICLR 2026カンファレンスで発表された新しい研究において、EPFLの研究者たちは、PERK(Parameter Efficient Reasoning over Knowledge:知識に基づくパラメータ効率的な推論)と呼ばれるソリューションを提案しています。巨大な文書を一度にすべて読ませようとするのではなく、PERKは、読書という行為を、質問が投げかけられた瞬間に発生する学習プロセスとして扱います。厚い教科書を受け取り、特定の質問をされた学生が、簡潔なメモをノートに書き留めるためにページを素早くスキャンする様子を想像してみてください。一度そのメモを書き終えると、学生は教科書を片付けて、そのメモだけを使って質問に答えることができます。PERKも同様の仕組みで動作します。長い文書が提示されたとき、モデルはそのテキスト全体をアクティブなメモリに保持しません。代わりに、モデルは短時間の内部学習フェーズを使用して、そのテキストの最も重要な部分を、自身の内部設定への小さく効率的な調整へと圧縮します。これらの調整は、長大な文書のエッセンスを保存する、特化したメモリモジュールとして機能します。この「メモ帳」が作成されると、元のテキストは破棄され、モデルは更新された新しい設定を使用して、コンテンツに関する質問に答えます。
研究者たちは、モデルにこの圧縮と検索を効果的に行う方法を教えるトレーニング手法を開発しました。彼らは、二層の学習を含む手法を用いました。第一層では、モデルはテキストの塊を自身のメモリ設定へと迅速にエンコードすることを学びます。第二層では、モデルはそれらの設定を使用して質問に正確に答える方法を学びます。このプロセスを効率的に保ち、コンピュータのメモリ不足を防ぐために、モデルは全パラメータのごく一部、具体的には「ローランクアダプター(low-rank adapter)」として知られる軽量なアドオンコンポーネントのみを更新します。これにより、モデルはコアとなる知識ベースを変更することなく、コンテキストから学習することができます。研究者たちは、数千ページの中に隠された単一の特定の事実を見つけること、複数の情報を結びつける必要がある複雑な質問に答えること、そして似通ったレコードの長いリストからデータを抽出することを含む、さまざまな困難なタスクを用いてこのアプローチをテストしました。
結果は、モデルが後で質問に答えるために長いテキストに対して単に学習される標準的な手法と比較して、PERKが大幅に優れた性能を示したことを明らかにしました。Qwen-2.5モデルを用いたテストでは、PERKはこれらの標準的なアプローチと比較して、精度を最大20パーセント向上させました。この手法は、モデルが学習中に見てきたよりもはるかに長いテキストを扱うよう求められた場合でも堅牢であることを証明し、64,000トークン、さらには128,000トークンのコンテキストに対しても正常に汎用化できました。さらに、PERKは情報の位置を無視するという独自の能力を示しました。他のモデルは、関連する事実がテキストの最初や最後から中間へと移動されると失敗することが多い一方で、PERKは情報がどこに現れても高い精度を維持しました。これは、情報を固定された位置に依存するのではなく、柔軟なメモリ構造へとエンコードすることで、モデルがより確実に推論できることを示唆しています。このアプローチは、0.5億パラメータの非常に小さなモデルから80億パラメータの大きなモデルに至るまで、異なるモデルサイズ間で一貫して機能し、長文脈のために特別に設計された大規模な専用モデルの性能に匹く、あるいはそれを上回りました。
精度を超えて、この研究は、この手法の効率性を強調しました。モデルはテキストを扱いやすい小さな塊として処理し、エンコード後に元のテキストを破棄するため、極めて長い文書を扱う際に大幅に少ないコンピュータメモリを必要とします。標準的な手法が128,000トークンでメモリ制限によりクラッシュしたテストにおいて、PERKは機能し続け、情報の処理にかかる時間はわずかであり、使用するメモリもごくわずかでした。研究者たちは、長文脈の推論を、モデルが即座に自身のメモリを適応させる「テスト時学習(test-time learning)」タスクとして再定義することで、従来のトレーニングに伴う重い計算コストをかけることなく、優れた性能を達成できると結論付けました。このアプローチは、大規模言語モデルが現実世界に見られる膨大かつ複雑な情報を扱う能力を高めるための、有望な道筋を提供しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。