← 最新の論文
🤖 AI

Context as an Environment: Programmatic Context Management for Long-Horizon Agents

本論文は、エージェントのセッションを、追記専用のイベントログと永続的なPythonカーネルを備えた実行可能な環境として扱うプログラムによるコンテキスト管理システムであるScrollを紹介しており、これによりLLMがコードを通じて長期的な状態を動的に管理することを可能にし、長文脈ベンチマークにおいて最先端の性能を達成している。

原著者: Yin Lin, Elaine Ang, Erkang Zhu, Bolin Ding, Jingren Zhou

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Yin Lin, Elaine Ang, Erkang Zhu, Bolin Ding, Jingren Zhou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

終わることのない会話を想像してみてください。あなたは、コードを書いたり、複雑な旅行の計画を立てたり、深いトピックを調査したりすることを手助けることができる、非常に賢いコンピュータプログラムと話をしています。最初は、会話は簡単です。プログラムは、あなたがここ数分間に言ったことをすべて覚えています。しかし、会話が数時間、あるいは数日間にわたって長引くと、情報の量が増えていきます。最終的に、それはプログラムが即座に保持できるメモリの容量を超えてしまいます。人工知能の世界では、この即座のメモリを「コンテキストウィンドウ」と呼びます。それは、一定の数の書類しか置けない机のように、決まったサイズを持っています。書類の山が高くなりすぎると、プログラムは新しい書類のためのスペースを作るために、いくつかの書類を捨てなければなりません。

問題は、プログラムはいつまで経っても、どの書類が重要であるかを判断できないということです。もしあなたが3日前に話したことについて質問した場合、プログラムはその書類をすでに捨ててしまっているかもしれません。従来の解決策は、古い書類を短いメモに要約したり、いくつかの事実を抽出して別のノートに保管したりすることで、この問題に対処しようとします。しかし、これらの方法はリスクを伴います。もしプログラムが特定の詳細、例えば日付や数字を捨ててしまった場合、その詳細は永遠に失われます。二度と取り戻すことはできません。長い履歴を参照して正確な事実を見つけたり、状況がどのように変化したかを追跡したりする必要があるタスクにおいて、たとえ一つの詳細を失っただけでも、プログラムは失敗する可能性があります。

ある研究者チームが、この増え続ける会話を扱うための異なる方法を提案しました。彼らはそのシステムを「Scroll」と呼んでいます。履歴全体をプログラムの即座のメモリに詰め込もうとする代わりに、彼らは履歴を、プログラムが必要な時にいつでも訪れることができる、独立した永続的な環境として扱います。これは、プログラムの机のすぐ外側に置かれた、広大で整理されたアーカイブ(記録保管庫)のようなものです。プログラムはアーカイブ全体を一度に読むのではありません。その代わりに、検索クエリやコマンドのような小さな指示を書き、アーカイブの中に入り、必要な特定のページを見つけ出し、そのページだけを机に持ち帰ります。

このシステムの核となるのは、あらゆるやり取りの永続的な記録である「イベントログ」です。このログは、メッセージ、ツールの実行結果、そして決定事項のすべてを正確な詳細とともに捉え続ける、決して止まることのないテープレコーダーのようなものです。これはプログラムの即座のメモリの外側に安全に保存されているため、何一つ失われることはありません。このログと並行して、プログラムが現在の思考や計算を保持するための、一種のデジタル・サンドボックスである「持続的なワークスペース」が存在します。プログラムが過去の何かを思い出す必要があるとき、それは要約に頼るのではなく、イベントログを検索するためのコードを書き、探している正確な瞬間を見つけ出し、その情報をワークスペースにロードします。

このアプローチは、プログラムが自身のメモリをどのように考えるかを変えます。何を保持するかを推測する代わりに、プログラムは必要な瞬間に、何を検索するかを自ら決定します。もしプログラムが旅行の計画を立てていて、ユーザーが数週間前に述べた好みを思い出す必要があるなら、その特定の好みを検索するためのコマンドを書きます。そして、ユーザーが使った正確な言葉を読み込み、それを使って意思決定を行います。プログラムは、必要な情報だけを即座の視野に取り入れます。残りの会話の履歴は、アーカイブの中に安全に保管され、後で必要になった時のために待機しています。

即座の視野が混雑しないように、システムには、現在使用されていない古い情報を整理する方法が備わっています。ワークスペースが満杯になると、システムは会話の最も古い部分をアーカイブへと戻します。しかし、他のシステムがこれらの古い部分を削除したり要約したりするのとは異なり、Scrollはそれらをそのままの状態で保持します。システムは小さな地図である「インデックス」を作成し、アーカイブ内のどこにそれらの古い部分が格納されているかをプログラムに教えます。もしプログラムが後で古い会話を確認する必要があると気づいた場合、そのマップを使用して直接正しい場所に飛び、元のテキストを回収することができます。これにより、情報はもはや即座の視野に入っていなくても、プログラムは常にソース(情報源)に戻ることができるのです。

研究者たちは、人工知能がいかに長い会話を扱えるかを検証するために設計された、いくつかの困難な課題を用いてこのシステムをテストしました。あるテストでは、システムは100万語を超える会話の履歴に基づいて質問に答えなければなりませんでした。別のテストでは、ツールを使用して情報を収集し問題を解決しながら、長期間にわたって意思決定を行うエージェントとして機能しなければなりませんでした。結果は、この新しい手法が非常に効果的であることを示しました。長い履歴を記憶し、推論する能力を測定するテストにおいて、システムは94.8パーセントのスコアを達成しました。また、1,000万語の履歴を含む別のテストでは、73.1パーセントを記録し、これはこれまでに発表された他のどのシステムよりも高い数値でした。システムが増大する環境を管理しながら複雑なタスクを解決するテストでは、86.7パーセントに達し、従来の最高の結果を大きく上回りました。

このシステムの成功は、メモリを「プログラミングのタスク」として扱う能力に由来しています。プログラム自身に、情報を探し出し使用するための指示を書かせることで、システムはプログラムの進化し続けるコード作成能力を活用しています。歴史を要約へと圧縮して重要な詳細を失わせるのではなく、必要な時にいつでも完全で編集されていない履歴にアクセスするためのツールをプログラムに与えているのです。研究者たちは、この方法がさまざまな種類の強力なプログラムにおいてうまく機能することを発見し、コードを通じて長期的なメモリを管理する能力は、さまざまなシステムが学習できる一般的なスキルであることを示唆しました。

この研究は、インテリジェント・エージェントの構築方法における転換を示唆しています。プログラムの即座のメモリをより大きくしたり、要約能力を高めたりしようとするのではなく、プログラムに自身の人生の、検索可能な永続的な記録へのアクセス権を与えるのです。プログラムは、何を前方に持ち出し、何を後ろに残すかを決定しながら、この記録をナビゲートすることを学びます。これにより、即座の視野をクリアで集中したものに保ちつつ、過去の真実のすべてが常に利用可能であることを保証します。研究者たちは、このアプローチが、人工知能が将来さらに長く複雑なタスクを処理することを可能にし、重要な詳細を失うことなく、より深い歴史から学ぶことを可能にすると信じています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →