← 最新の論文
💻 computer science

AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions

AutoRPA は、LLM ベースの非効率な ReAct エージェントと従来の RPA の間のギャップを埋めるフレームワークであり、インタラクションの軌跡を自動的に堅牢で再利用可能な RPA 関数に蒸留することで、タスク解決能力を維持しつつトークン使用量と実行コストを大幅に削減することを可能にします。

原著者: Minghao Chen, Xinyi Hu, Zhou Yu, Yufei Yin

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Minghao Chen, Xinyi Hu, Zhou Yu, Yufei Yin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いものの、やや高価な個人アシスタント「LLM(大規模言語モデル)」という名前を想像してみてください。このアシスタントは、初めてコンピューターやスマートフォンの画面を操作する方法を把握することに長けています。「フライトを予約する」や「メモを削除する」と頼めば、画面を見て、何をすべきか考え、正しいボタンをクリックして、仕事を完了させることができます。

しかし、一つ問題があります:反復作業には、彼らは遅く、かつ高価です。

フライトを予約するたびに、彼らはゼロから「思考」する必要があります。画面を読み、手順を計画し、クリックします。これを1日に100回行う必要がある場合、あなたは100時間分の「思考」にお金を支払うことになります。これは時間と金の無駄です。

一方、これらの賢いアシスタントが存在する以前、人々は「ロボティック・プロセス・オートメーション(RPA)」を使っていました。RPAとは、事前に録画されたスクリプトのようなものです。「ボタン3をクリックし、次に『Hello』と入力し、次に『保存』をクリックする」というように、ロボットが盲目的にクリックするのです。実行する際には信じられないほど高速で安価です。しかし、それは脆いという欠点もあります。アプリのデザイナーが「ボタン3」を別の場所へ移動させると、ロボットは適応する方法を知らないためクラッシュします。画面が変わるたびに、人間がスクリプトを手動で書き直す必要があります。

問題

私たちは、ロボット(RPA)の速度と安価さと、アシスタント(LLM)の賢い適応性の両方を望んでいます。アプリが更新されるたびに人間がコードを書き直す必要なく、(毎日フライトを予約するなど)反復作業に対応できる解決策が必要です。

解決策:AutoRPA

この論文は、乱れた料理の実演を完璧で再利用可能なレシピに変える料理人のようなシステム、AutoRPAを紹介しています。

以下に、その仕組みをステップバイステップで説明します。

1. 「探索」(料理人が見守る)

まず、AutoRPAは、スマートなLLMアシスタントを使って、タスク(例:フライトの予約)を1回、あるいは数回だけ実行させます。アシスタントは画面を見て、考え、クリックします。これが「ReAct」フェーズです。

  • 比喩: 料理人が、見習い料理人が初めて料理を作る様子を見守り、すべての動きをメモします。

2. 「翻訳」(メモをレシピに変える)

アシスタントの動作は通常「ハードコード化」されています(例:「ピクセル座標 144, 278 のボタンをクリック」)。これは、画面がずれると座標が間違ってしまうため、良くありません。
AutoRPAには、これらの動作を書き換える特別な翻訳エージェントがあります。「144, 278 でクリックする」と言う代わりに、「『フライトを予約』と書かれたボタンをクリックする」と言います。

  • 比喩: 料理人が、見習いの乱雑なメモ(「右上の赤いドットを押す」)を受け取り、明確な指示(「赤い『スタート』ボタンを押す」)に書き直します。これにより、キッチンのレイアウトが少し変わってもレシピが機能するようになります。

3. 「構築」(マスタースクリプトの作成)

ビルダーエージェントは、これらの翻訳された柔軟な指示を受け取り、単一の堅牢なコンピュータープログラム(RPA関数)に結合します。それは、多くの異なる試行(軌道)を見て、変異に対処する最良の方法を突き止めます。

  • 比喩: 料理人が、最終的なプロフェッショナルなレシピカードを作成します。これなら、誰でも、どこでも、その料理を完璧に作ることができます。

4. 「ハイブリッド修復」(セーフティネット)

時には、新しいレシピにバグが含まれていることがあります。ロボットがコードを実行しようとして失敗しても、AutoRPAは単に諦めるわけではありません。それはハイブリッド修復戦略を持っています。

  1. ロボットを一時停止します。
  2. スマートなLLMアシスタントを呼び戻し、なぜ失敗したのか、そしてその時点からどのように修正すべきかを考えさせます。
  3. アシスタントによる修正を使って、レシピを更新します。
  • 比喩: ロボットがトーストを焦がした場合、料理人が介入してトーストを直し、次にロボットが再び焦がさないようにレシピカードを更新します。

結果

この論文は、3つの異なる環境(Android アプリ、ウェブサイト、シミュレートされたウェブタスク)でこれをテストしました。

  • 効率性: 新しい AutoRPA コードを実行するコストは、毎回スマートなアシスタントにタスクを任せる場合と比較して、82% から 96% 安価です。AI の思考の通貨である「トークン」の使用量が大幅に節約されます。
  • 成功率: 生成されたコードは安定しており、画面のわずかな変化に混乱しないため、スマートなアシスタント単独の場合と同じか、それ以上のタスク解決率を達成します。
  • 再利用性: 一度、「フライトの予約」のような「種類の」タスク向けにコードが構築されれば、(ニューヨークへの予約、ロンドンへの予約など)数百の具体的な事例に対して、再度思考することなく再利用できます。

まとめ

AutoRPAとは、スマートなAIがタスクを学ぶ様子を見守り、その学習を柔軟で再利用可能なスクリプトに変換し、そのスクリプトを完璧になるまで磨き上げるシステムです。それは、新しい状況に対処する知性と、反復作業を処理するロボットのような効率性という、両方の世界から最良のものをもたらします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →