Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling
Dieser Beitrag stellt die Agent-JIT-Kompilierung vor, ein Framework, das aus einem Planer, einem Scheduler und einem Invarianten-erzwingenden Protokoll besteht und natürliche Sprachaufgaben in ausführbaren Code umwandelt, um im Vergleich zu herkömmlichen sequenziellen Web-Agent-Schleifen erhebliche Beschleunigungen und Genauigkeitsverbesserungen zu erzielen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, einem Roboter einen komplexen Auftrag zu erteilen, wie zum Beispiel „Bestellen Sie das billigste Taco bei Taco Bell".
Derzeit arbeiten die meisten Roboter wie ein sehr vorsichtiger, langsamer menschlicher Assistent. Sie schauen auf den Bildschirm, fragen ein superintelligentes Gehirn (eine KI) nach dem nächsten Schritt, klicken auf einen Button, warten, bis sich der Bildschirm ändert, fragen das Gehirn erneut, tippen ein Wort ein, warten und fragen wieder. Diese „Schauen-Denken-Handeln"-Schleife wiederholt sich immer wieder. Sie ist langsam, teuer (weil das KI-Gehirn jedes Mal Geld kostet, wenn man es fragt) und fehleranfällig, da der Roboter möglicherweise auf das Falsche klickt, wenn der Bildschirm nur geringfügig anders aussieht.
Diese Arbeit stellt eine neue Methode vor, um diese Roboter schneller und intelligenter zu machen, genannt Agent JIT Compilation. Man kann sich das vorstellen wie den Wechsel von einer „Schritt-für-Schritt-Anleitung" zum „Schreiben eines benutzerdefinierten Software-Skripts", noch bevor der Roboter überhaupt in Bewegung setzt.
So funktioniert es, aufgeteilt in drei einfache Teile:
1. Der „Pre-Flight"-Planer (JIT-Planner)
Anstatt bei jedem einzelnen Schritt die KI zu fragen „Was soll ich als Nächstes tun?", generiert das System zunächst Ihre Anfrage („Bestellen Sie das billigste Taco") und erstellt sofort mehrere verschiedene Computerprogramme (Code), die das Problem lösen könnten.
- Die Analogie: Stellen Sie sich vor, Sie müssen von New York nach Boston fahren.
- Alter Weg: Sie halten an jeder Tankstelle an und fragen einen Einheimischen: „Wie komme ich nach Boston?" Sie fahren eine Meile, fragen erneut, fahren eine weitere Meile, fragen wieder.
- Neuer Weg: Bevor Sie losfahren, bitten Sie eine Karten-App, drei verschiedene Routen zu generieren. Sie prüft den Verkehr, die Straßenverhältnisse und die Entfernung. Sie wählt die absolut schnellste Route aus und schreibt die GPS-Koordinaten einmalig in das Navigationssystem Ihres Autos. Dann fahren Sie einfach los.
- Der Zauber: Das System überprüft diese generierten Routen, um sicherzustellen, dass sie logisch sind (z. B. können Sie nicht auf „Bestellen" klicken, bevor Sie nicht auf „In den Warenkorb" geklickt haben). Es wählt diejenige aus, die die geringste Menge an „Gehirnkraft" (KI-Aufrufe) und Zeit benötigt.
2. Der „Verkehrspolizist" (JIT-Scheduler)
Sobald der Roboter einen Plan hat, muss er entscheiden, wie er ihn ausführt. Soll er alles nacheinander erledigen? Soll er versuchen, drei Dinge gleichzeitig zu tun? Oder soll er dieselbe Aufgabe dreimal parallel versuchen und einfach die erste verwenden, die fertig wird?
- Die Analogie: Stellen Sie sich vor, Sie bestellen Essen für eine Party.
- Seriell (Eins nach dem anderen): Sie rufen ein Restaurant an, warten auf die Antwort, rufen das nächste an, warten...
- Parallel: Sie rufen drei Restaurants gleichzeitig an.
- Absicherung (Hedging): Sie rufen drei Restaurants an, aber es interessiert Sie nur der erste, der abhebt. Wenn einer langsam ist, warten Sie nicht; Sie nehmen einfach die Antwort von dem schnellen.
- Der Zauber: Das System betrachtet die spezifische Aufgabe und nutzt vergangene Daten, um zu erraten, welche Strategie am besten ist. Wenn die Aufgabe einfach ist, geht es eins nach dem anderen vor. Wenn die Aufgabe knifflig ist und stecken bleiben könnte, versucht es mehrere Pfade gleichzeitig (Absicherung), um sicherzustellen, dass sie schnell abgeschlossen wird. Es wählt die Strategie aus, die die meiste Zeit spart.
3. Das „Regelwerk" (Invariant-Enforcing Protocol)
Um sicherzustellen, dass der Roboter nicht abstürzt oder auf den falschen Button klickt, kommt jedes Werkzeug, das der Roboter verwendet (wie „Button klicken" oder „Text tippen"), mit einem strengen Regelwerk.
- Die Analogie: Denken Sie an einen Automaten.
- Alter Weg: Sie drücken einfach zufällig auf Tasten. Manchmal drücken Sie auf „Imbiss", wenn der Automat leer ist, und nichts passiert.
- Neuer Weg: Der Automat hat einen Sensor. Er prüft: „Ist der Automat an? Ist Geld eingeworfen? Ist die Tür geschlossen?" Wenn die Bedingungen nicht erfüllt sind, verweigert der Automat das Drücken der Taste.
- Der Zauber: Bevor der Roboter den Code ausführt, prüft er diese Regeln. Wenn ein Plan versucht, zu „Bestellen", wenn der „Warenkorb" leer ist, fängt das System diesen Fehler bevor der Roboter überhaupt beginnt, ab und verhindert so Fehler und Zeitverschwendung.
Die Ergebnisse
Die Autoren testeten dies auf fünf verschiedenen Websites (wie Lieferdienste für Essen, E-Mail- und Einkaufsseiten). Die Ergebnisse waren beeindruckend:
- Geschwindigkeit: Ihre neue Methode war 10-mal schneller als die Standardmethode „KI bei jedem Schritt fragen".
- Genauigkeit: Sie war auch 28 % genauer, was bedeutet, dass sie tatsächlich 28 % öfter das richtige Taco bekam.
- Vergleich: Selbst im Vergleich zu anderen fortschrittlichen KI-Agenten (wie denen von OpenAI oder Anthropic) war ihre Methode 2,4-mal schneller und 9 % genauer.
Zusammenfassung
Kurz gesagt besagt diese Arbeit: Fragen Sie die KI nicht, das Auto Schritt für Schritt zu steuern. Lassen Sie stattdessen die KI die gesamte Fahrstrecke als Skript schreiben, prüfen Sie, ob die Route sicher ist, wählen Sie den schnellsten Weg, sie zu fahren, und führen Sie dann einfach das Skript aus. Dies verwandelt ein langsames, stotterndes Gespräch in eine reibungslose, hochgeschwindigkeitsfähige Ausführung.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.