Hera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM Agents
Hera は、タスクの成功と計算コストの間のトレードオフを最適化するために模倣学習とコスト意識型強化学習という 2 段階の訓練パラダイムを採用し、クラウドのみと同等の性能を達成しながらクラウド利用を大幅に削減する、長視野 LLM エージェント向けの新しいステップレベルのデバイス - クラウド協調システムである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢いが高価なアシスタント(クラウド)と、素早いが高価ではなく、時には忘れっぽいアシスタント(デバイス)がいると想像してください。あなたは、1 週間の休暇を計画したり迷路を解いたりするような、長く複雑なパズルを解決するために、これら 2 人が協力して働く必要があります。
問題は以下の通りです:
- デバイスにすべてを任せる場合、それは速く無料ですが、パズルの難しい部分で道に迷ったり、間違いを犯したりする可能性があります。
- クラウドにすべてを任せる場合、それは完璧ですが、非常に高額であり、遠く離れているため、会話に時間がかかります。
既存のシステムのほとんどは、「この全体のタスクにクラウドを使うべきか?」という決定を下そうとします。タスクが難しそうならクラウドに費用をかけ、簡単そうならデバイスを使います。しかし、これはメニューが複雑だからといって、難しい飾り付けだけを手伝ってもらう必要があるのに、1 週間分すべての野菜を切るためにマスターシェフを雇うようなものです。
Hera の登場です。
Hera は、全体のタスクについて決定を下すのではなく、一歩一歩作業を見守り、瞬時に判断を下す新しい「チームキャプテン」です。「この特定の動きは簡単か?ならデバイスに任せる。この動きは難しいか?ならクラウドに助けを求めよう。」
Hera が偉大なキャプテンになる方法
Hera は、スポーツコーチがアスリートを訓練するように、2 段階のトレーニングプロセスを通じてこのキャプテンとして学習します。
第 1 段階:「シャドーイング」フェーズ(模倣学習)
まず、Hera はクラウドがタスク全体を完璧に実行する様子を観察します。その後、クラウドの答えをガイドとして、デバイスに全く同じ手順を実行させます。
- デバイスがその手順を自力で正しく実行できれば、Hera は「よし、ここはデバイスが能力を発揮できる。高価なクラウドを呼ぶ必要はない」と学びます。
- デバイスが混乱したり、異なる選択をしたりすれば、Hera は「ああ、この手順はデバイスには難しすぎる。ここではクラウドの助けが必要だ」と学びます。
これにより、Hera はデバイスがどこでつまずくのかという基本的なルールブックを得ます。
第 2 段階:「戦略」フェーズ(強化学習)
次に、Hera は自らゲームをプレイします。デバイスとクラウドの手順を混ぜ合わせてタスクを解決しようと試みます。評価は以下の 2 つの要素に基づいて行われます:
- 勝てたか?(タスクは完了したか?)
- 使いすぎたか?(クラウドを呼びすぎたか?)
Hera は、すべての難しい手順にクラウドが必要ではないことを学びます。長い旅の途中にある1 つの重要な手順だけクラウドを呼ぶことで、全体の計画を軌道に乗せることができる場合があることを学びます。失敗を避けるために絶対に必要な時だけクラウドを呼び、コストを節約することを学びます。
結果:両者の最良の組み合わせ
研究者たちは、Hera を 3 つの異なる「パズル」でテストしました:
- ALFWorld:家を片付けようとするロボット。
- WebShop:ウェブサイト上で特定のアイテムを購入しようとするエージェント。
- AppWorld:アプリを管理するコードを書こうとするエージェント。
魔法の数値:
- 成功率:Hera は、常にクラウドを使用した場合の成功率の**92.5%**を達成しました。ほとんど失敗しません。
- コスト削減:高価なクラウドを使用したのは手順の**46.3%**のみでした。残りはデバイスが処理しました。
- 速度:ローカルのデバイスを非常に多く使用したため、毎回クラウドを待つのとは比較にならないほど、プロセス全体が高速になりました。
結論
Hera を、ルーチンワークはジュニア従業員(デバイス)に任せるべき時と、難しい問題にはシニア専門家(クラウド)を招くべき時を正確に知っている、賢いマネージャーだと考えてください。これにより、チームは専門家すべてを任せた場合とほぼ同じレベルで仕事を完了しますが、コストは半分、速度は 2 倍になります。
この論文は、複雑な問題を解決するためにすべての動きにスーパーコンピュータが必要ではないことを証明し、タスク全体ではなく一歩一歩でこれらの決定を下す最初のシステムであると主張しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。