← 最新の論文
🤖 AI

Workspace Optimization: How to Train Your Agent

本論文は、エージェントの重みではなく構造化された外部基盤を進化させるトレーニングパラダイムである「ワークスペース最適化」を導入し、DreamTeam(ARC-AGI-3 ベンチマークにおいてより少ないアクションで 38.4% という新たな最先端スコアを達成するマルチエージェントシステム)を通じてその有効性を示す。

原著者: Elad Sarafian, Gal Kaplun, Ron Banner, Daniel Soudry, Boris Ginsburg

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Elad Sarafian, Gal Kaplun, Ron Banner, Daniel Soudry, Boris Ginsburg

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、論文「Workspace Optimization: How to Train Your Agent(作業空間の最適化:エージェントの訓練方法)」を、平易な言葉と創造的な比喩を用いて解説したものです。

大きな問題:「凍りついた脳」

新しいビデオゲームに人を放り込んだと想像してください。指示も、地図も、ボタンの機能も何もわかりません。

  • 罠: この人は「凍りついた脳」を持っています。標準的な AI 訓練のようにニューロンを再接続して新しいことを教えることはできません。内部コードを変更して学習することもできません。
  • 課題: それでもゲームに勝つ必要があります。ルール、目標、戦略を、プレイするだけで見つけ出さなければなりません。

ほとんどの AI エージェントは、教科書を暗記する学生のように、内部の重みを変更することで「学習」しようとします。しかし、AI がチャットボットのように API の背後にロックされている場合、あるいはコードに触れられない場合、その脳を変えることはできません。では、どのように学習するのでしょうか?

解決策:「作業台」(作業空間の最適化)

著者たちは、エージェントのを変えるのではなく、その作業台を変えるべきだと主張しています。

スキルセット(脳)が凍りついた大工を想像してください。

  • 標準的な訓練: 大工の手に電線を引き、ハンマーの持ち方を異ならせようとします。(ここでは不可能です)。
  • 作業空間の最適化: 大工に作業台を与えます。そこではメモを書き、図を描き、プロトタイプを作り、未来の自分への付箋を残すことができます。

エージェントは「自分が誰であるか」を変えるのではなく、「書き留めたもの」を変えます。メモを読み、手を試し、結果を見て、新しい現実を反映させるためにメモを編集します。

仕組み:「夢のチーム」

これを検証するために、研究者たちはDREAMTEAMと呼ばれるマルチエージェントシステムを構築しました。特定の役割と特定のノートを持った、単一プロジェクトに取り組む建設チームを想像してください。

  1. 観察者(目): ゲーム画面を見て、構造化された形式(例:「座標 5,5 に赤いブロックがある」)で見たものをメモします。
  2. シミュレーター(脳の予測エンジン): 観察者のメモを受け取り、次に何が起こるかを予測します。「左に動けば、赤いブロックは左に動くだろう」。
  3. 探検家(テスト担当):
    • 帰納的探検家: 再利用可能な戦略を見つけようとします(例:「常に赤いブロックを避ける」)。
    • 演繹的探検家: 未知のルールを学ぶために特定の実験を行います(例:「青いタイルに触れて、何が起こるか見てみよう」)。
  4. 批評家(品質管理): 皆の作業をチェックします。「待てよ、シミュレーターはブロックが動くと言ったが、動かなかった。誰が間違ったルールを書いた?」
  5. チームリーダー(ボス): すべてのメモと予測に基づき、最終的な動きを決定します。

学習ループ:「コミット、実行、比較、修復」

チームが踏むサイクルをステップごとに示します。

  1. コミット: チームリーダーが現在のメモに基づいて動きを決めます。
  2. 実行: ゲーム内でその動きが発生します。
  3. 比較: チームは結果を確認します。シミュレーターの予測は現実と一致しましたか?
    • 一致した場合: 素晴らしい!メモは確認されました。
    • 不一致の場合: これは反例です。予測が間違っていました。
  4. 修復: 批評家は、が間違ったメモを書いたかを特定します。
    • 観察者が物体を誤認した場合、観察者はメモを編集します。
    • シミュレーターが間違った物理法則を予測した場合、シミュレーターはルールを書き換えます。
  5. 回帰テスト(安全網): 新しいメモが受け入れられる前に、チームは過去の動きに対して素早いチェックを行います。「今このルールを変えたら、10 ステップ前に使ったロジックを壊してしまわないか?」もし古いロジックを壊すなら、チームはより慎重になる必要があります。

比喩:探偵の事件ファイル

毎日犯罪のルールが変わる謎を解く探偵を想像してください。

  • 探偵(AI モデル): 固定された性格と知識ベースを持っています。突然別人になることはできません。
  • 事件ファイル(作業空間): ホワイトボード、付箋、図表のフォルダーです。
  • プロセス:
    • 探偵は仮説を立てます。「執事がやった」。
    • それを試します。失敗しました。
    • 性格を変えるのではなく、事件ファイルに行きます。「執事」を消し、「火曜日のみなら庭師」と書き換えます。
    • 昨日書き留めたアリバイと矛盾しないか、ファイルを確認します。
    • 探偵は同じ人物のままですが、ファイルはより賢くなります。

結果

研究者たちは、ルールが隠された抽象的な推論ゲームの非常に難しいベンチマークであるARC-AGI-3でこれをテストしました。

  • スコア: 彼らの「作業台」アプローチは、従来の最良の方法と比較して、スコアを**36% から 38.4%**に向上させました。
  • 効率性: 単にスコアが上がっただけでなく、31% 少ない手数で達成しました。つまり、エージェントは「不器用」ではなく、無作為に推測して時間を浪費しませんでした。メモをよりよく整理することで、より速く学習しました。

なぜこれが重要なのか

この論文は、特定の状況で AI をより賢くするために、巨大な AI モデルを再訓練する必要がないことを証明しています。必要なのは、学習を蓄積し、仮説を検証し、リアルタイムで誤りを修正するための、より良い構造化された作業空間を与えることです。

これは、ではなく、メモとコードを訓練対象とすることで、「凍りついた」AI を動的な学習者へと変えるものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →