← 最新の論文
🤖 AI

AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning

本論文は、蒸留された軌跡を用いた教師あり微調整と、実環境における堅牢な報酬システムを用いた強化学習を組み合わせた2段階の学習パラダイムを通じて、クラウドコンソールのドキュメント検証において最先端に近い性能を実現する、コスト効率の高いウェブエージェントフレームワークであるAliyunConsoleAgentを紹介するものである。

原著者: Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大で絶えず変化し続けるテーマパーク(クラウドコンソール)のマネージャーだと想像してください。毎日、パークには新しいアトラクションが追加され、チケット売り場が変わり、安全ルールが更新されます。一方で、ガイドブック(ドキュメンテーション)は、別のチームが手作業でゆっくりと更新しています。

問題点:
パークの変化が非常に速いため、ガイドブックはすぐに時代遅れになってしまいます。本には「青いボタンをクリックしてください」と書いてあっても、実際のパークではそのボタンは赤色に変わっていたり、タッチパネルに置き換わっていたりすることがあります。
ガイドブックのすべての指示を実際のパークと照らし合わせてチェックするのは、悪夢のような作業です。人間のチームが行うには年間数百万時間もかかり、現在は指示のわずか1%しかチェックできていません。チェックが行われないと、顧客は迷い、不満を感じることになります。

旧来の解決策(およびその失敗の理由):
会社は、チェックを行うために「超知能ロボット(フロンティア・プロプライエトリー・モデル)」を雇おうとしました。これらのロボットは非常に賢く、ガイドブックを読み、パーク内を完璧にナビゲートできます。しかし、これらは高価であり(すべてのチェックに対して博士号を持つチームを雇うようなものです)、かつリスクもあります(プライベートなパークの地図を見せる必要があり、それはセキュリティ規則に抵触します)。必要な何百万回ものチェックを行うには、コストが見合いません。

新しい解決策:AliyunConsoleAgent
開発者は、自社のサーバーで安価かつ安全に実行できる、独自の「学習可能なロボット」(320億パラメータのAIモデル)を構築しました。しかし、標準的なロボットでは、混沌とした変化するテーマパークを扱うには不十分です。そこで、彼らは2段階のトレーニング手法を用いました。

1. 「シャドーイング」フェーズ(教師あり微調整 / Supervised Fine-Tuning)

まず、超知能ロボットに新しいロボットを**シャドーイング(影のように追跡)**させました。

  • 比喩: マスターシェフ(超高性能ロボット)が複雑な料理を作っている場面を想像してください。新しいロボットは、マスターの包丁さばき、混ぜ方、調味料の入れ方のひとつひとつを観察し、記憶します。
  • 結果: 新しいロボットは、パーク内をナビゲートする方法や指示に従うための基礎を学びました。かなり上手くなりましたが、まだ単なる「模倣」の段階です。パークが少しでも変化すると、目的を真に「理解」しているわけではなく、手順を「記憶」しているだけなので、混乱してしまいます。

2. 「試行錯誤」フェーズ(強化学習 / Reinforcement Learning)

次に、ロボットをシミュレーションされたバージョンのパークに放ち、実践を通じて学ばせました。

  • 課題: 本物のクラウド環境では、ロボットが失敗するのは、ロボットが愚かなせいではなく、多くの場合「パーク」の準備ができていないためです。例えば、ロボットがサーバーを削除しようとしたとき、そのサーバーがまだ存在しない場合があります。もしロボットがこの理由で罰を与えられると、「サーバーを削除するのが下手だ」という間違った教訓を学んでしまいます(正しくは「先にサーバーを構築する必要がある」という教訓です)。
  • 解決策(高決定論的ロールアウト / High-Determinism Rollout): チームは、Terraform(インフラをレゴのように構築するツール)を使用して、特別な「トレーニング場」を構築しました。ロボットがタスクを実行する前に、このシステムが自動的に前提条件(サーバーの構築やネットワークの設定など)を構築するため、ロボットは正しい手順を踏めば必ず成功できる環境になっています。
  • 報酬システム: 人間がロボットを採点する代わりに、**デュアルチャネル・ジャッジ(二系統の判定)**を使用しています。
    1. ルールチェッカー: これは公式の「監査ログ(パークの監視カメラ映像のようなもの)」を確認し、アクションが実際に実行されたかどうかを判断します。「サーバーが削除されたか? はい/いいえ」。これは100%客観的です。
    2. 判定パネル: 明確なログがない場合、2つの別のAIモデルが判定員として機能します。両方のモデルが「成功した」と同意した場合のみ「合格」を与えます。これにより、ロボットが1つの判定員を欺いたり、ズルをしたりすることを防ぎます。

結果

このトレーニングを経て、ロボットは単なる「盲目的なフォロワー」から、**「自律的な問題解決者」**へと進化しました。

  • 以前: ガイドに「自動更新をオフにする」と書かれていても、スイッチが既にオフの状態だった場合、ロボットは単に停止して「実行できません」と答えていました。
  • その後: ロボットは、「スイッチが既にオフなら、オフにすることはできない。まず『オン』にしてから、それから『オフ』にすることで、確かに実行したことを証明する必要がある」と考えるようになりました。ロボットは自ら論理を導き出したのです。

まとめ:

  • パフォーマンス: 彼らの新しいロボット(AliyunConsoleAgent-32B)は、高価な「超高性能ロボット」とほぼ同等の性能を実現しています(差はわずか1.8%以内)。
  • コスト: 実行コストを92%削減しました。
  • インパクト: このシステムを用いて54,000件以上の指示を監査し、製品チームが修正すべき4,400件近い実在のエラーを発見しました。

要するに、彼らは、天才の動きを模倣させ、さらに完璧に準備されたトレーニングジムで練習させることで、安価なローカルロボットに天才のように考える方法を教え込んだのです。これにより、ロボットは自分のコントロール外の理由で罰を受けることなく、失敗から学ぶことができるようになりました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →