AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions
AutoRPA ist ein Framework, das die Lücke zwischen ineffizienten LLM-basierten ReAct-Agenten und traditionellem RPA schließt, indem es Interaktionstrajektorien automatisch in robuste, wiederverwendbare RPA-Funktionen überführt und dadurch erhebliche Reduktionen bei Token-Verbrauch und Laufzeitkosten erzielt, ohne die Fähigkeit zur Aufgabenerfüllung zu beeinträchtigen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie haben einen sehr klugen, aber etwas teuren persönlichen Assistenten namens „LLM" (Large Language Model). Dieser Assistent ist brillant darin, herauszufinden, wie man zum ersten Mal einen Computer- oder Handybildschirm bedient. Wenn Sie ihn bitten, einen Flug zu buchen oder eine Notiz zu löschen, kann er den Bildschirm betrachten, überlegen, was zu tun ist, die richtigen Knöpfe drücken und die Aufgabe erledigen.
Allerdings gibt es einen Haken: Sie sind langsam und teuer im Einsatz für wiederkehrende Aufgaben.
Jedes Mal, wenn Sie sie bitten, einen Flug zu buchen, müssen sie von Grund auf „nachdenken". Sie lesen den Bildschirm, planen die Schritte und klicken. Wenn Sie dies 100 Mal am Tag tun müssen, bezahlen Sie für 100 Stunden „Nachdenken", was eine Verschwendung von Geld und Zeit ist.
Andererseits nutzten Menschen vor dem Aufkommen dieser klugen Assistenten „Robotic Process Automation" (RPA). Denken Sie an RPA als ein vorab aufgezeichnetes Skript. Es ist wie ein Roboter, der blindlings auf „Knopf 3 drückt, dann 'Hallo' tippt, dann auf 'Speichern' klickt". Es ist unglaublich schnell und billig auszuführen. Aber es ist auch brüchig. Wenn der Designer der App „Knopf 3" an einen anderen Ort verschiebt, stürzt der Roboter ab, weil er nicht weiß, wie er sich anpassen soll. Es braucht einen Menschen, der das Skript jedes Mal manuell neu schreibt, wenn sich der Bildschirm ändert.
Das Problem
Wir wollen die Geschwindigkeit und Billigkeit des Roboters (RPA), aber die kluge Anpassungsfähigkeit des Assistenten (LLM). Wir wollen eine Lösung, die für wiederkehrende Aufgaben funktioniert (wie das tägliche Buchen von Flügen), ohne dass ein Mensch den Code jedes Mal neu schreiben muss, wenn die App aktualisiert wird.
Die Lösung: AutoRPA
Die Arbeit stellt AutoRPA vor, ein System, das wie ein Meisterkoch funktioniert, der eine chaotische Kochvorführung in ein perfektes, wiederverwendbares Rezept verwandelt.
So funktioniert es, Schritt für Schritt:
1. Die „Exploration" (Der Koch beobachtet)
Zuerst nutzt AutoRPA den klugen LLM-Assistenten, um die Aufgabe (z. B. einen Flug buchen) nur einmal oder ein paar Mal auszuführen. Der Assistent betrachtet den Bildschirm, denkt nach und klickt. Dies ist die „ReAct"-Phase.
- Analogie: Der Koch beobachtet einen Sous-Chef, wie er zum ersten Mal ein Gericht zubereitet, und notiert jede Bewegung.
2. Die „Übersetzung" (Notizen in ein Rezept verwandeln)
Die Aktionen des Assistenten sind normalerweise „hart codiert" (z. B. „Klicke auf den Knopf bei den Pixelkoordinaten 144, 278"). Das ist schlecht, denn wenn sich der Bildschirm verschiebt, sind die Koordinaten falsch.
AutoRPA verfügt über einen speziellen Translator-Agenten, der diese Aktionen neu schreibt. Anstatt zu sagen „Klicke bei 144, 278", sagt er „Klicke auf den Knopf, auf dem 'Flight buchen' steht."
- Analogie: Der Koch nimmt die chaotischen Notizen des Sous-Chefs („Drücke den roten Punkt oben rechts") und schreibt sie als klare Anweisung um („Drücke den roten 'Start'-Knopf"). Dadurch funktioniert das Rezept auch dann, wenn das Küchenlayout leicht verändert wird.
3. Das „Bauen" (Erstellen des Master-Skripts)
Ein Builder-Agent nimmt diese übersetzten, flexiblen Anweisungen und kombiniert sie zu einem einzigen, robusten Computerprogramm (einer RPA-Funktion). Er betrachtet viele verschiedene Versuche (Trajektorien), um den besten Weg zu finden, mit Variationen umzugehen.
- Analogie: Der Koch schreibt die endgültige, professionelle Rezeptkarte, die von jedem, überall, verwendet werden kann, um das Gericht perfekt zuzubereiten.
4. Die „Hybrid-Reparatur" (Das Sicherheitsnetz)
Manchmal hat das neue Rezept einen Fehler. Wenn der Roboter versucht, den Code auszuführen und scheitert, gibt AutoRPA nicht einfach auf. Es verfügt über eine Hybrid-Reparatur-Strategie:
- Es pausiert den Roboter.
- Es ruft den klugen LLM-Assistenten zurück, um herauszufinden, warum er gescheitert ist und wie er von genau diesem Punkt aus behoben werden kann.
- Es nutzt die Korrektur des Assistenten, um das Rezept zu aktualisieren.
- Analogie: Wenn der Roboter das Toastbrot verbrennt, greift der Koch ein, repariert das Toastbrot und aktualisiert dann die Rezeptkarte, damit der Roboter es beim nächsten Mal nicht wieder verbrennt.
Die Ergebnisse
Die Arbeit testete dies in drei verschiedenen Umgebungen (Android-Apps, Websites und simulierte Web-Aufgaben).
- Effizienz: Der neue AutoRPA-Code ist 82 % bis 96 % günstiger im Betrieb als die Anfrage an den klugen Assistenten, die Aufgabe jedes Mal neu zu erledigen. Es spart eine enorme Menge an „Token"-Verbrauch (die Währung des KI-Nachdenkens).
- Erfolgsrate: Es löst Aufgaben genauso gut wie, manchmal sogar besser als der kluge Assistent allein, da der generierte Code stabil ist und nicht durch geringfügige Bildschirmänderungen verwirrt wird.
- Wiederverwendbarkeit: Sobald der Code für eine „Art" von Aufgabe gebaut wurde (wie „Flug buchen"), kann er für hunderte spezifischer Instanzen wiederverwendet werden (Buchen nach New York, Buchen nach London), ohne erneut nachdenken zu müssen.
Zusammenfassung
AutoRPA ist ein System, das beobachtet, wie eine intelligente KI eine Aufgabe lernt, dieses Lernen in ein flexibles, wiederverwendbares Skript übersetzt und dieses Skript dann poliert, bis es perfekt ist. Es bietet uns das Beste aus beiden Welten: die Intelligenz, um mit neuen Situationen umzugehen, und die Effizienz eines Roboters, um wiederkehrende Arbeiten zu erledigen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.