← Neueste Arbeiten
🤖 AI

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

PANDO stellt ein effizientes Online-Framework zur Fähigkeiten-Distillation vor, das multimodale Web-Agenten ermöglicht, ihre Leistung zu verbessern und den Token-Verbrauch zu senken, indem es eine strukturierte Fähigkeitenbibliothek pflegt und Techniken wie Fortschrittsreflexion und cache-bewusste Prompting-Strategien einsetzt, wodurch auf VisualWebArena eine Erfolgsrate von 58,3 % bei deutlich geringeren Inferenzkosten im Vergleich zu bestehenden Methoden erreicht wird.

Ursprüngliche Autoren: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

Veröffentlicht 2026-05-26
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Die „Pay-Per-Click"-Falle

Stellen Sie sich vor, Sie stellen einen sehr klugen, aber teuren Assistenten ein, der Ihnen beim Online-Shopping hilft. Jedes Mal, wenn dieser eine Webseite betrachtet, überlegt, was zu tun ist, oder auf einen Button klickt, müssen Sie eine winzige Gebühr (ein sogenanntes „Token") bezahlen.

Derzeit versuchen die meisten KI-Agenten, ihre Arbeit besser zu machen, indem sie mehr Geld ausgeben. Wenn sie scheitern, versuchen sie es erneut. Wenn sie feststecken, holen sie eine zweite Meinung ein. Sie führen dieselbe Aufgabe zehn Mal aus und wählen das beste Ergebnis aus. Das funktioniert, ist aber so, als würde man für eine Taxifahrt zum Supermarkt bezahlen, dann für eine zweite Taxifahrt zurück, um zu prüfen, ob man die Brieftasche vergessen hat, und dann für eine dritte Taxifahrt, um den Preis noch einmal zu überprüfen. Die Aufgabe wird erledigt, aber es ist unglaublich teuer und langsam.

Die Autoren dieses Papiers fragten: Können wir einen Agenten bauen, der mit zunehmender Arbeit günstiger und schneller wird, anstatt jedes Mal einfach nur mehr Geld auszugeben?

Die Lösung: PANDO (Der „Riesen-Aspen"-Agent)

Die Forscher entwickelten einen Agenten namens PANDO. Er ist nach dem „Pando"-Aspenhain in Utah benannt.

  • Die Metapher: Pando sieht aus wie 47.000 einzelne Bäume, aber sie sind tatsächlich alle durch ein einziges Wurzelsystem unter der Erde verbunden. Wenn ein Baum wächst, teilt er Nährstoffe mit den anderen. Wenn ein Baum stirbt, erinnert sich das Wurzelsystem daran und hält den gesamten Wald am Leben.
  • Die KI-Version: PANDO ist ein KI-Agent mit einer gemeinsamen „Gedächtniswurzel" (einer Fähigkeitsbibliothek). Anstatt jede neue Aufgabe als brandneues Problem zu behandeln, erinnert er sich daran, was er aus früheren Aufgaben gelernt hat, und nutzt diese Lehren, um neue zu lösen.

Wie PANDO funktioniert (Die 4-Schritte-Schleife)

PANDO rät und prüft nicht einfach nur. Es folgt einem Zyklus: Planen → Handeln → Reflektieren → Lernen.

  1. Planen: Das „Gehirn" (eine intelligente, teure KI) zerlegt eine große Aufgabe (wie „finde die günstigste Gitarre unter 500 $") in kleine Schritte.
  2. Handeln: Die „Hände" (eine günstigere, schnellere KI) klicken tatsächlich auf die Buttons.
  3. Reflektieren: Ein „Manager" prüft, ob die Schritte funktioniert haben. Hat der Preisfilter die Liste tatsächlich geändert? Wenn nicht, warum?
  4. Lernen (Der magische Teil): Hier wird PANDO schlauer.
    • Fähigkeitsbibliothek: Wenn der Agent erfolgreich eine günstige Gitarre findet, schreibt er das Rezept auf: „Um günstige Artikel zu finden, klicke auf 'Nach Preis sortieren' und dann 'Aufsteigend'." Er speichert dies als Regel oder als Routine.
    • Wiederverwendung von Fähigkeiten: Das nächste Mal, wenn der Agent das „teuerste" Item finden muss, muss er nicht schwer nachdenken. Er schaut einfach in seine Bibliothek, sieht die Regel und schaltet auf „Absteigend" um.
    • Degradierung (Die Aufräumaktion): Wenn eine Regel nicht mehr funktioniert (z. B. weil eine Webseite ihr Layout geändert hat), markiert der Agent sie als „kaputt" und nutzt sie nicht mehr. Dies verhindert, dass der Agent in Schleifen feststeckt und versucht, alte, defekte Anweisungen zu verwenden.

Warum es ein Gamechanger ist

Das Papier testete PANDO an 910 verschiedenen Web-Aufgaben (Einkaufen, Kleinanzeigen, Reddit). Hier ist, was passierte:

  • Erfolgsrate: PANDO hatte in 58,3 % der Fälle Erfolg. Das ist besser als die derzeit besten Agenten (die bei etwa 54 % lagen).
  • Kosten: Das ist der große Gewinn. PANDO verbrauchte 58 % weniger Tokens (Geld) als der nächstbeste Agent.
  • Der „Gratis-Mittagessen"-Effekt:
    • Am Anfang: PANDO ist etwas langsam, weil es die Regeln lernt.
    • Später: Während es seine Bibliothek mit Fähigkeiten aufbaut, wird es schneller und günstiger. Am Ende des Tests löste es Aufgaben mit weniger Schritten und weniger Geld als zu Beginn.
    • Analogie: Stellen Sie sich einen Schüler vor, der einen Mathe-Test schreibt.
      • Alte Agenten: Jedes Mal, wenn sie ein neues Problem sehen, leiten sie die Formel von Grund auf neu her. Das dauert ewig.
      • PANDO: Das erste Mal, wenn sie ein Problem sehen, lösen sie es und schreiben die Formel auf einen Spickzettel. Die nächsten 99 Male schauen sie einfach auf den Spickzettel. Sie beenden den Test schneller und mit weniger Hirnschmalz.

Die „versteckten Kosten", die PANDO vermeidet

Das Papier weist darauf hin, dass andere Agenten ihre Kosten auf zwei Arten verschleiern:

  1. Entdeckung vor der Bewertung: Manche Agenten verbringen Wochen damit, Werkzeuge zu „trainieren" oder zu „entdecken", bevor der Test überhaupt beginnt. PANDO lernt während des Tests, sodass keine versteckten Vorabkosten anfallen.
  2. Skalierung durch Ausrollen: Manche Agenten versuchen die Aufgabe einfach 10 Mal und wählen den Gewinner. PANDO versucht es einmal, nutzt aber sein Gedächtnis, damit dieser eine Versuch zählt.

Das Fazit

PANDO beweist, dass man nicht mehr Geld in eine KI stecken muss, um sie besser zu machen. Indem man ihr ein strukturiertes Gedächtnis (eine Bibliothek von Fähigkeiten) und eine Möglichkeit gibt, schlechte Erinnerungen zu bereinigen (Degradierung), wird der Agent mit zunehmender Arbeit effizienter.

Es ist der Unterschied zwischen einem Arbeiter, der jeden Tag alles vergisst und ständig neu eingearbeitet werden muss, und einem Arbeiter, der ein Notizbuch mit „Wie man Dinge macht" führt und jeden einzelnen Tag schneller wird.

Wichtigste Erkenntnis: PANDO wird nicht nur schlauer; es wird mit zunehmender Erfahrung günstiger im Betrieb.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →