← Nieuwste papers
🤖 AI

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

PANDO introduceert een efficiënt online vaardigheidsdistillatiekader dat multimodale webagenten in staat stelt om de prestaties te verbeteren en het tokenverbruik te verminderen door een gestructureerde vaardigheidsbibliotheek te onderhouden en technieken zoals voortgangsreflectie en cache-bewuste prompting toe te passen, waarmee een succespercentage van 58,3% op VisualWebArena wordt bereikt met aanzienlijk lagere inferentiekosten in vergelijking met bestaande methoden.

Oorspronkelijke auteurs: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Pay-Per-Click"-Valstrik

Stel je voor dat je een zeer slimme, maar dure assistent huurt om je te helpen online winkelen. Elke keer als ze een webpagina bekijken, nadenken over wat ze moeten doen, of op een knop klikken, moet je een kleine vergoeding betalen (een "token").

Op dit moment proberen de meeste AI-agenten hun werk beter te doen door meer geld uit te geven. Als ze falen, proberen ze het opnieuw. Als ze vastlopen, vragen ze een tweede mening. Ze voeren dezelfde taak tien keer uit en kiezen het beste resultaat. Dit werkt, maar het is alsof je betaalt voor een taxirit naar de supermarkt, dan betaalt voor een tweede taxi om terug te gaan en te controleren of je je portemonnee bent vergeten, en dan een derde taxi om de prijs nog eens te controleren. Het werk wordt gedaan, maar het is ongelooflijk duur en traag.

De auteurs van dit papier vroegen zich af: Kunnen we een agent bouwen die goedkoper en sneller wordt naarmate ze meer werkt, in plaats van elke keer gewoon meer geld uit te geven?

De Oplossing: PANDO (De "Gigante Aspen"-Agent)

De onderzoekers bouwden een agent genaamd PANDO. Ze noemden het naar het "Pando"-espenbos in Utah.

  • De Metafoor: Pando lijkt op 47.000 aparte bomen, maar ze zijn allemaal verbonden door één enkel wortelsysteem ondergronds. Als één boom groeit, deelt het voedingsstoffen met de anderen. Als één boom sterft, onthoudt het wortelsysteem dit en houdt het het hele bos in leven.
  • De AI-Versie: PANDO is een AI-agent met een gedeeld "geheugenvorstelsel" (een Vaardigheidsbibliotheek). In plaats van elke nieuwe taak als een compleet nieuw probleem te behandelen, onthoudt het wat het heeft geleerd van eerdere taken en gebruikt het die lessen om nieuwe op te lossen.

Hoe PANDO Werkt (De 4-Stappenlus)

PANDO gokt en controleert niet zomaar. Het volgt een cyclus: Plannen → Handelen → Reflecteren → Leren.

  1. Plannen: Het "Brein" (een slimme, dure AI) breekt een grote taak (zoals "vind de goedkoopste gitaar onder de 500 dollar") op in kleine stappen.
  2. Handelen: De "Handen" (een goedkopere, snellere AI) klikt daadwerkelijk op de knoppen.
  3. Reflecteren: Een "Manager" controleert of de stappen werkten. Veranderde de prijsfilter daadwerkelijk de lijst? Zo niet, waarom niet?
  4. Leren (Het Magische Deel): Hier wordt PANDO slimmer.
    • Vaardigheidsbibliotheek: Als de agent succesvol een goedkope gitaar vindt, schrijft het het recept op: "Om goedkope items te vinden, klik op 'Sorteren op Prijs' en dan 'Laag naar Hoog'." Het slaat dit op als een Regel of een Routine.
    • Hergebruiken van Vaardigheden: De volgende keer dat de agent het "duurste" item moet vinden, hoeft het niet hard na te denken. Het kijkt gewoon in zijn bibliotheek, ziet de regel en schakelt over naar "Hoog naar Laag".
    • Degradatie (De Opruiming): Als een regel niet meer werkt (bijvoorbeeld omdat een website zijn lay-out heeft gewijzigd), markeert de agent deze als "gebroken" en stopt met het gebruik ervan. Dit voorkomt dat de agent vastloopt in lussen terwijl het probeert oude, gebroken instructies te gebruiken.

Waarom Het Een Gamechanger Is

Het papier testte PANDO op 910 verschillende webtaken (winkelen, advertenties, Reddit). Dit gebeurde:

  • Succespercentage: PANDO slaagde 58,3% van de keren. Dit is beter dan de huidige topagenten (die rond de 54% zaten).
  • Kosten: Dit is de grote winst. PANDO gebruikte 58% minder tokens (geld) dan de volgende beste agent.
  • Het "Gratis Lunch"-Effect:
    • Aan het begin: PANDO is een beetje traag omdat het de regels aan het leren is.
    • Later: Naarmate het zijn bibliotheek met vaardigheden opbouwt, wordt het sneller en goedkoper. Aan het einde van de test loste het taken op met minder stappen en minder geld dan waarmee het begon.
    • Analogie: Stel je een student voor die een wiskundetoets maakt.
      • Oude Agenten: Elke keer als ze een nieuw probleem zien, leiden ze de formule opnieuw af vanaf nul. Het duurt eeuwen.
      • PANDO: De eerste keer dat ze een probleem zien, lossen ze het op en schrijven ze de formule op een spiekbriefje. De volgende 99 keer kijken ze gewoon naar het spiekbriefje. Ze maken de toets sneller af en met minder hersenkracht.

De "Verborgen Kosten" die PANDO Vermijdt

Het papier wijst erop dat andere agenten hun kosten op twee manieren verbergen:

  1. Pre-evaluatie Ontdekking: Sommige agenten spenderen weken aan "trainen" of "ontdekken" van hulpmiddelen voordat de test zelfs maar begint. PANDO leert tijdens de test, dus er zijn geen verborgen voorafgaande kosten.
  2. Rollout Schalen: Sommige agenten proberen de taak gewoon 10 keer en kiezen de winnaar. PANDO probeert het één keer, maar gebruikt zijn geheugen om die ene poging te laten tellen.

De Conclusie

PANDO bewijst dat je niet meer geld in een AI hoeft te steken om het beter te maken. Door het een gestructureerd geheugen (een bibliotheek met vaardigheden) te geven en een manier om slechte herinneringen op te ruimen (degradatie), wordt de agent efficiënter naarmate het meer werkt.

Het is het verschil tussen een werknemer die elke dag alles vergeet en constant opnieuw moet worden opgeleid, versus een werknemer die een notitieboekje bijhoudt met "hoe dingen te doen" en elke dag sneller wordt.

Belangrijkste Inzicht: PANDO wordt niet alleen slimmer; het wordt goedkoper om te draaien naarmate het ervaring opdoet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →