← 最新の論文
💬 NLP

CurateEvo: Data-Curation Evolving for Agentic Post-Training

CurateEvoは、データキュレーションを実行可能なコードとして表現し、大規模言語モデルエージェントのためのポストトレーニングデータの有効性と効率性の両方を最適化するために、エージェントの失敗の軌跡を用いてそれを反復的に書き換える、失敗駆動型の動的進化フレームワークである。

原著者: Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che

公開日 2026-07-08
📖 1 分で読めます☕ さくっと読める

原著者: Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いが経験の浅いロボットアシスタントに対し、予算内で航空券を予約するといった複雑な現実世界の課題を解決する方法を教えようとしていると想像してください。あなたには、人間や他のロボットがこれらのタスクに取り組んだ膨大な古いログのライブラリがあります。一部のログは完璧な成功を示していますが、多くはロボットが行き詰まったり、間違った動きをしたり、クラッシュしたりした様子を示しています。

この論文は、CURATEEVOと呼ばれる新しいシステムを紹介し、特定の課題を解決します。それは、**「この乱雑なログのライブラリを、いかにしてロボットにとって完璧なトレーニングマニュアルに変えるか?」**という問題です。

問題点:「静的なシェフ」対「スマートな編集者」

現在、これらのロボットアシスタントを訓練するほとんどの手法は、静的なシェフのように振る舞います。彼らは生のログライブラリを受け取り、「例題を増やす」「悪いものは捨てる」「すべてを保持する」といった固定されたルールを適用します。

  • 欠陥: ロボットが学習を試みて新しいテストで失敗しても、シェフはレシピを変更しません。彼らは、ロボットが(例えば天気をチェックすることを忘れたといった)特定の弱点のせいで失敗したことを無視し、その特定のギャップに対処するためにトレーニングデータを修正することはありません。

CURATEEVOは異なります。それは、単にデータを選ぶのではなく、データの選び方のための「ルール」を書き、書き換える、スマートで進化する編集者として機能します。

CURATEEVOの仕組み:「練習ループ」

CURATEEVOを、継続的なフィードバックループを実行するコーチと考えてください。

  1. 試運転: コーチは現在の「トレーニングマニュアル」(データキュレーションのルール)を取り出し、テスト問題のセット(保持された開発セット)を用いてロボットに練習させます。
  2. 失敗報告: ロボットが失敗したとき、コーチは単にスコアを記録するだけではありません。彼らは「なぜ」失敗したのかを分析します。道具の選択を間違えたのか? ステップを忘れたのか? 長い会話に混乱したのか?
  3. ルールの書き換え(進化): 次に、コーチはどのデータを使用するかを決定するコンピュータコードへと向かいます。彼らは、ステップ2で見つかった特定の問題を解決するために、そのコードを書き換えます。
    • もしロボットが特定のツールの使い方を知らなかったために失敗した場合、 コードはトレーニングデータにそのツールの例を追加するように更新されます。
    • もしロボットがノイズが多すぎて混乱した場合、 コードはそれらの乱雑な例を取り除くように更新されます。
    • もしロボットが無駄に長いステップに時間を費やしていた場合、 コードはトレーニングを高速化するために、それらのステップを削るように更新されます。
  4. 反復: これは何度も繰り返されます。ラウンドを重ねるごとに、「トレーニングマニュアル」はロボットの特定の弱点に合わせてより最適化されていきます。

2つの主要な目標:有効性と効率性

論文では、CURATEEVOが、料理を美味しく、かつ素早く作ることを試みるシェフのように、2つのことをバランスよく実現していると述べています。

  • 有効性(美味しさを作る): システムはロボットがどこで失敗するかを監視し、それらの特定の穴を埋めるためにデータを追加または洗練させます。これにより、ロボットが必要な知識を正確に学べるようにします。
  • 効率性(素早さを作る): システムはまた、トレーニングデータを見て、「これは必要か?」と問いかけます。もしロボットがすでに概念を学習している場合、あるいはトレーニングの例が長すぎたり冗長であったりする場合、CURATEEVOはそれを削ぎ落とします。これにより、ロボットのパフォーマンスを損なうことなく、時間と計算資源を節約します。

結果:より優れたロボット、より少ない無駄

研究者たちは、3種類の異なるロボットの課題(ベンチマーク)に対し、2種類のデータを使用してこのシステムをテストしました。

  1. ラベル付きデータ: きれいな、人間によって注釈が付いたログ(教科書のようなもの)。
  2. ワイルドデータ: 実際のユーザーとのやり取りから得られた、乱雑で現実世界のログ(混沌とした日記のようなもの)。

結果は明白でした:

  • より高いスコア: CURATEEVOで訓練されたロボットは、従来の静的な手法で訓練されたロボットよりも、有意に高いスコア(平均して約3〜4ポイント高い)を記録しました。
  • 乱雑なデータにも対応: 入力データが「ワイルド」でノイズが多くても、CURATEEVOはそれを高品質なトレーニング教材へとフィルタリングし、洗練させることができました。
  • 高速なトレーニング: 冗長なステップを削ぎ落とすことで、CURATEEVOはロボットの訓練に必要な時間と計算資源を、他の手法と比較して約50%削減しました。
  • 汎用性: それは、ロボット自体に使用される特定のトレーニングレシピ(アルゴリズム)が何であっても、うまく機能しました。

結論

この論文は、データの準備を一度限りの固定されたステップとして扱うのではなく、動的で進化するプロセスとして扱うべきであると主張しています。データキュレーション戦略に、ロボットの失敗から学び、自らのルールを書き換えさせることで、複雑な現実世界の課題をより良く解決できる、よりスマートで効率的なAIエージェントを構築できるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →