ContractBench: Can LLM Agents Preserve Observation Contracts?
本論文は、現在の最先端 LLM エージェントがセッショントークンや URL などの観測契約の時間的妥当性とバイトレベルの完全性を頻繁に維持できないことを明らかにする決定論的ベンチマーク「ContractBench」を導入し、この能力はモデルサイズと単調にスケーリングせず、改善には特定の失敗を意識したトレーニングを必要とするものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、論文「CONTRACTBENCH: Can LLM Agents Preserve Observation Contracts?」の解説を、平易な言葉と創造的な比喩を用いて説明したものです。
大きなアイデア:「デジタル引継ぎ」の問題
あなたが非常に賢いものの、少し不器用なロボット助手を雇って、あなたの代わりに用事を頼むと想像してください。あなたはロボットにこう伝えます。「銀行に行って、一時的な鍵を取得し、その鍵を使って金庫を開けてください」と。
現実の世界では、ロボットが鍵を落とし、鍵の形を変えてしまったり、期限切れになった鍵を使おうとしたりすれば、金庫は開きません。ロボットが失敗したのは、何をするべきかを知っていなかったからではなく、引継ぎの具体的な詳細を処理しきれなかったからです。
この論文では、これらの詳細を「観測契約(Observation Contracts)」と呼んでいます。
- 契約: ツール(銀行の API など)がロボットにデータ(一時的なパスワードや署名付きリンクなど)を提供する際、そのデータには二つの見えないルールが伴います。
- 有効期限: 今すぐ使わなければ、無効になります。
- 「触らない」ルール: 文字通り一字一句、正確にコピーしなければなりません。コンマ一つやスペース一つでも変えれば、それは破綻します。
著者たちは、今日の最も賢い AI エージェントでさえ、これらのルールに従うのが極めて苦手であることを発見しました。彼らはしばしば鍵を落とし、溶かしたり、翌日になっても使おうとしたりします。
新しいテスト:CONTRACTBENCH
これを証明するために、研究者たちは「CONTRACTBENCH」と呼ばれる新しいテストを構築しました。これは AI エージェント向けの「運転免許試験」のようなものですが、車を運転する代わりに、脆く時間制限のあるパッケージを次の人に渡す必要があるデジタルの障害物コースを navigate する必要があります。
- コース: 10 秒で無効になるリンクでファイルをダウンロードする、正確に入力しなければならないコードでログインするなど、33 の異なるシナリオがあります。
- ルール: このテストは厳格なコンピュータプログラム(人間の審査員なし)によって実行されます。「仮想時計」を使ってエージェントが遅すぎないかを確認し、「デジタル指紋スキャナー」を使ってコードの文字を一つでも変更したかを確認します。
- スコア: エージェントが時間制限を超えたり、コードの綴りを間違えたりすれば、不合格となります。
彼らが発見したこと(調査結果)
研究者たちは、OpenAI、Anthropic、Google、オープンソースチームから提供された最新で最も有名なものを含む、38 の異なる AI モデルをテストしました。彼らが発見したことを、日常用語に翻訳して以下に示します。
1. 最も「賢い」ロボットでさえ失敗する
発見: どのモデルもテストの 80% を合格しませんでした。最高成績を収めたのは Claude Opus 4.6 で、約 78% でした。
比喩: 世界で最も賢い学生が数学の試験を受けると想像してください。複雑な微積分の問題を解くことはできても、10 桁の数字をタイプミスなく正確にコピーするように頼むと、それでも 22% の確率で間違えてしまいます。「賢い」ことは「慎重である」ことを意味しないのです。
2. 「魔法の崖」(Qwen 3.5)
発見: 特定のモデルファミリー(Qwen 3.5)において、能力に突然の跳躍が見られました。40 億パラメータの小さなモデルは**0%の正解率でしたが、わずかに大きな 90 億パラメータのモデルは56%**まで跳ね上がりました。
比喩: レベル 9 に達するまで無用だったビデオゲームのキャラクターのようなものです。レベル 8 では、彼らは鍵さえ持てません。レベル 9 に達すると、突然優しく鍵を持つ方法を学びます。これは緩やかな改善ではなく、抑制(データを変えないことを知っていること)という特定の技能の突然の「目覚め」でした。
3. 大きいことが常に良いわけではない(GPT-5 のジェットコースター)
発見: GPT-5 ファミリーのモデルが進化するにつれ、その性能は上昇し、その後急落し、再び上昇しました。
比喩: 料理人が新しいレシピブックを受け取ると想像してください。
- 料理人 A(GPT-5): 完璧なケーキを作ります。
- 料理人 B(GPT-5.1): 「より賢い」バージョンのレシピブックを手に入れますが、砂糖を入れすぎてレシピを台無しにします(具体的には、コピーする代わりに材料を変更し始めてしまいました)。
- 料理人 C(GPT-5.2): レシピを修正し、再び完璧なケーキを作るに戻ります。
この論文は、AI を「より賢く」したり「より会話的」にしたりすることが、厳格で退屈なルールに従う能力を低下させることがあると示唆しています。
4. 「ベース」モデルにはできません
発見: チャットや指示に従うように「訓練」されていないモデル(ベースモデル)は、テストで 0% でした。指示に従う方法を教わったモデル(インストラクトモデル)だけが合格できました。
比喩: 生のコマ(ベースモデル)は形を保つことができません。カップに水を保持できるようにするには、それを彫刻(ポストトレーニング)する必要があります。これらの契約に従う能力は自然なものではなく、教え込まなければならないものです。
5. 「ヒント」は機能する
発見: 研究者が AI に「コードの文字を変更した」など、何が悪かったかを正確に伝えたとき、AI は間違いを修正してテストに合格できました。
比喩: あなたが子供に「ボールを落としたよ」と伝えれば、彼らはもう一度挑戦してキャッチするかもしれません。しかし、「もう一度やってみて」とだけ言えば、彼らはまた落としてしまうかもしれません。具体的なフィードバックがエラーを修正する鍵でした。
なぜこれが重要なのか(論文によると)
この論文は、私たちは AI を「パズルを解けるか」や「物語を書けるか」でテストしてきたと主張しています。しかし、現実の世界では、AI エージェントは正確性がすべてである仕事にしばしば使用されます。
もし AI エージェントがあなたの銀行口座を管理しているなら、取引コードの数字を一つも変える余裕はありません。もしサーバーを管理しているなら、期限切れのパスワードを使う余裕はありません。
結論: 現在の AI エージェントは、 brilliant だが不器用なインターンのようなものです。彼らは全体像を理解していますが、手渡された脆いツールを落とし続けています。彼らを現実世界の仕事で信頼できるものにするためには、彼らを単に「賢く」することをやめ、受け取ったデジタル契約に対してより慎重に、より正確であるように教える必要があります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。