← 最新の論文
🤖 AI

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

Harness-R1は、オンライン強化学習を用いて、エージェントの失敗軌跡から実行可能なランタイムパッチを自動生成する専用の「ハーネスエンジニア」を訓練する斬新な手法を導入しており、ターゲットエージェントのモデル重みの更新を必要とせずに、複数のベンチマークにおけるタスク成功率を大幅に向上させます。

原著者: Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたには、非常に賢くて優秀なロボットの助手がいるとします。あなたは「20ドル以下で完璧な赤いシャツを見つけて」といった仕事を依頼します。すると、ロボットは作業を開始します。しかし、時としてロボットは混乱してしまうことがあります。例えば、間違ったボタンをクリックしたり、何を探していたのかを忘れてしまったり、あるいは同じアイテムを何度も購入しようとするループに陥ってしまったりすることがあります。人工知能の世界では、このロボットは「エージェント」と呼ばれ、その思考、行動、そして失敗の入り混じった乱雑な軌跡は「トラジェクトリー(軌跡)」と呼ばれます。

通常、ロボットがミスをした場合、それを修正する唯一の方法は、設計図に戻って脳全体を再学習させることです。これには膨大な時間とエネルギーがかかります。しかし、もう一つの方法があります。ロボットの脳を作り直す代わりに、そのロボットが身に着けている「ハーネス(装着具)」を変更するという方法です。ハーネスを、ロボットの安全装備であり、チェックリストであり、そしてコミュニケーションのガイドであると考えてみてください。それは、ロボットに対して、世界とどのように対話し、どのように自分の仕事を検証し、そして躓いたときにどのように立ち直るべきかを伝えるコードなのです。研究者たちが問いかけている大きな疑問は、「ロボットの脳を毎回再学習させることなく、過去の失敗に基づいて自分自身のハーネスを修正する方法を、ロボットに教えることはできるだろうか?」ということです。

これこそが、「Harness-R1」という論文が探求している内容です。研究者たちは、特別な「エンジニア(技師)」AIが、過去の失敗を研究することによってロボットのハーネスを書き換える方法を学ぶシステムを構築しました。その仕組みはこうです。まず、標準的なロボット(ターゲット)にタスクを解かせ、失敗させます。次に、エンジニアAIがそれらの失敗の物語を読み、ハーネスを修正するための新しい指示書――パッチ――を書き上げます。極めて重要なのは、彼らはパッチが良いかどうかを推測するだけでなく、実際にそのパッチをロボットに装着し、再びタスクに挑戦させるという点です。もしロボットがより頻繁に成功すれば、エンジニアは報酬を受け取り、より良いパッチを書くことを学びます。もしパッチによって状況が悪化すれば、エンジニアは二度とそのようなことはしないよう学びます。

結果は非常に素晴らしいものです。彼らが3つの異なる困難なゲーム(オンラインショッピング、テキストベースの家の中のナビゲーション、およびデータベース管理)でテストを行ったところ、標準的なロボットの成功率は約44.3%でした。Harness-R1のエンジニアがハーネスを修正する方法を学んだ後、成功率は53.6%へと跳ね上がりました。これは、脳を再学習させるのではなく、単にハーネスを微調整しただけで、9.3パーセントポイントの改善が見られたことを意味します。さらに優れたことに、彼らはすでに、より賢くなるよう訓練されたロボットに対しても実験を行いましたが、エンジニアは依然としてパフォーマンスをさらに5.0ポイント向上させることができました。

また、この論文は、これが特定のロボットに限った偶然ではないことも示しています。彼らが訓練したエンジニアは、見たことがない全く新しい別のロボットを見ても、その失敗を研究し、その新しいロボットを助けるためのカスタム修正案を書き上げることができました。このことは、「ハーネスを編集すること」がAIに教えることができるスキルであることを示唆しており、これにより、ロボットの核となる脳を一度も再学習させることなく、ロボットと共に進化し、彼らをより賢く、より信頼性の高いものにすることができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →