Sandboxed Coding Agents are Competitive Omni-modal Task Solvers
本論文は、サンドボックス化されたツールを備えたテキストのみのコーディングエージェントが、マルチモーダルな問題を情報処理ワークフローへと変換することによって複雑な音声・ビデオタスクを効果的に解決できることを示し、多くの場合においてネイティブなオムニモーダルモデルを凌駕するとともに、オープンソースの多モーダル処理を前進させるためのCode-X学習レシピおよびTerminalBench-Oベンチマークを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大きなアイデア: 「賢いインターン」 vs 「超天才」
膨大なビデオクリップ、音声録音、ドキュメントで構成された、非常に複雑で巨大なパズルがあると想像してください。あなたはそのパズルを解かなければなりません。
長い間、テクノロジーの世界では、これを解くためには**「超天才」**(ネイティブ・オムニモーダルAI)が必要だと想定されてきました。この超天才は、ビデオや音声ファイル全体を丸ごと「食べて」しまい、その脳内で全てのフレームや音波を一度に理解しようとするモデルです。
しかし、この論文は、これに必ずしも超天才は必要ではないと主張しています。代わりに、「賢いインターン」(コーディング・エージェント)を使うことができるのです。
賢いインターンは、ビデオ全体を飲み込もうとはしません。その代わりに、ツールボックスを持っています。ファイルを確認し、特定のツール(ビデオエディターや音声文字起こしマシンなど)を取り上げ、必要な最小限の情報(トランスクリプトや特定のフレームなど)だけを抽出し、その小さな証拠を使ってパズルを解きます。
この論文の主な主張: ツールを使う「賢いインターン」は、一度にすべてを暗記しようとする「超天才」よりも、実際にはより速く、より安く、そして多くの場合、これらのパズルを解くのが上手であるということです。
「賢いインターン」の仕組み
賢いインターンを、図書館にいる探偵だと考えてください。
- 従来の方法(ネイティブモデル): 超天才が図書館に入ってきて、棚にあるすべての本を読み、すべてのオーディオテープを聴き、すべての映画を同時に見ようとします。すると、情報過多になり、大量のエネルギー(トークン)を消費し、一度に処理しようとしすぎるために細部を見落としてしまうことがあります。
- 新しい方法(サンドボックス型エージェント): 賢いインターンは図書館に入りますが、必要な特定の書籍やテープだけを持ち出します。
- 誰が何を言ったかを知る必要がある場合は、音声文字起こしツールを使用して、音声をテキスト形式のトランスクリプトに変換します。
- ビデオの中に何があるかを知る必要がある場合は、フレーム抽出ツールを使用して、いくつかの重要な場面の画像を抜き出します。
- その後、そのトランスクリプトを読んだり、画像を見たりして質問に答えます。
結果: 賢いインターンは、図書館全体を頭の中に持ち歩く必要がないため、はるかに少ないエネルギー(より少ない「トークン」)で済みます。必要な証拠だけを持ち運ぶのです。
エビデンス:どちらがレースに勝つのか?
研究者たちは、ビデオと音声に関する4つの異なる「パズル競技」(ベンチマーク)でテストを行いました。
- 結果: 賢いインターン(GPT-5.4やClaude Opusなどのモデルを使用)は、いくつかのカテゴリーにおいて、最高の超天才モデル(Gemini 3.1 Proなど)を打ち負かしました。
- 例え: これは、トリビアの質問に答えるために百科事典全体を暗記しようとする人と、図書館の索引を使ってどのページを見るべきかを正確に知っている人のレースのようなものです。索引を持っている人が、効率的かつ正確であるため、勝利します。
なぜ彼らは勝つのか?(「ツール」の優位性)
論文によると、賢いインターンが勝つ理由は、ビデオや音声を「記憶」として保存するのではなく、処理すべき**「原材料」**として扱うからです。
- 選択的な検索: 90分間のサッカーの試合を見て一つのゴールを見つける代わりに、インターンはビデオをスキャンして「ゴール」のイベントを探すツールを使い、その30秒間だけを見ます。
- エラー訂正: もしツールが失敗した場合(例:音声文字起こしマシンがノイズで混乱した場合)、インターンは別のツールを試したり、問題を修正するための小さなスクリプトを書いたりすることができます。超天才は、ノイズに直面すると行き詰まってしまうことがよくあります。
何がうまくいかないのか?(失敗の分類学)
賢いインターンでも間違いを犯します。研究者たちは、なぜ失敗するのかを説明するために「失敗メニュー」を作成しました。
- 聞き間違い: 音声文字起こしツールが音声を聞き間違えた。
- 見間違い: ツールが間違ったビデオフレームを選択した。
- 早すぎる諦め: エージェントが答えを見つける前に探索を止めてしまった。
- 事実の誤認: 正しいビデオは見つけたが、データベース内の誤った情報を参照した。
- 計算ミス: 正しい事実は持っていたが、計算を間違えた。
- ツールの故障: コンピュータにツールを実行するための適切なソフトウェアがインストールされていなかった。
インターンをより賢くできるか?(スキル注入)
研究者たちはこう問いかけました。「脳を作り直すことなく、インターンをさらに賢くできるだろうか?」
彼らは3つの方法を試しました。
- 人間によるコーチング: 専門家が書いたマニュアルを与える。
- 自己練習: インターンに試行錯誤させ、単純な「正解/不正解」のチェックに基づいて独自のルールを調整させる。
- ログからの学習: 第二のAIにインターンの作業ログを監視させ、何がうまくいき、何がうまくいかなかったかのパターンを見つけさせ、新しい「ベストプラクティス」ガイドを書かせる。
勝者: 「ログ駆動型自己蒸留(Log-driven Self-Distillation)」(ログからの学習)が最も効果的でした。これは、コーチがインターンの試合映像をレビューして、「君は時間を推測する前に、いつもタイムスタンプを確認するのを忘れているよ」とアドバイスするようなものです。これにより、インターンの正確性は大幅に向上しました。
未来: 「理解」から 「実行」へ
この論文は、私たちがメディアを単に「理解」する(ビデオについて質問に答える)時代から、メディアを「処理」する(ビデオを編集し、音声をカットし、新しいファイルを作成する)時代へと移行していると主張しています。
彼らは、このプロセスを測定するための新しいテストである TerminalBench-O を導入しました。
- タスク: 「このビデオには誰が映っていますか?」と聞く代わりに、AIはハイライト映像を作成し、キャプションを書き、ファイルを保存しなければなりません。
- 挑戦: これは非常に困難です。最高のAIでさえ、これらのタスクの約24%しかクリアできていません。これには長期的な計画と信頼性の高いツール使用が必要であり、これこそが「賢いインターン」にとっての次のフロンティアです。
まとめ
複雑な問題を解決するために、あらゆるビデオや音声を暗記する巨大で高価な脳は必要ありません。必要なのは、特定の証拠を抽出するためにツールを使いこなす、賢くて効率的なエージェントです。このアプローチは、一度にすべてを「理解」しようとするよりも、安価で、速く、そして多くの場合、より正確です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。