← Nieuwste papers
💬 NLP

MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?

Dit artikel introduceert MMG2Skill, een closed-loop framework en de bijbehorende benchmark (MMG2Skill-Bench), die AI-agenten in staat stellen om ruisgevoelige, multimodale webgidsen via gestructureerde compilatie en trajectgestuurde revisie te distilleren tot zelfevoluerende uitvoerbare vaardigheden, waarmee zij baseline-agenten aanzienlijk overtreffen over diverse domeinen heen.

Oorspronkelijke auteurs: Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming Sun, Han Li, Jiaheng Liu

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming Sun, Han Li, Jiaheng Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar ietwat naïeve robotassistent hebt. Je wilt dat deze complexe taken uitvoert, zoals het bewerken van een foto, het bouwen van een huis in een videogame, of het spelen van een strategisch kaartspel. Je hebt een enorme bibliotheek aan door mensen geschreven handleidingen, tutorials en wiki's op het internet die uitleggen hoe je deze dingen doet.

Het probleem is dat deze gidsen zijn geschreven voor mensen, niet voor robots. Ze zijn rommelig, gaan ervan uit dat je dingen weet die de robot niet weet, en raken in de war als de robot een kleine fout maakt. Als je de robot zomaar een link geeft naar een artikel over "Hoe bouw je een huis", raakt de robot misschien overweldigd door de tekst, mist het cruciale stappen, of probeert het dingen in de verkeerde volgorde uit te voeren.

Dit paper introduceert MMG2Skill, een nieuwe manier om robots te leren met behulp van deze rommelige menselijke gidsen. Zie het als een "Vertaler en Coach"-systeem dat menselijke instructies omzet in de persoonlijke speelboekjes van een robot.

Zo werkt het, onderverdeeld in drie eenvoudige fasen:

1. De Vertaler: "Mensentaal" omzetten in een "Robot Speelboekje"

In plaats van de hele rommelige artikel aan de robot te geven, leest het systeem de gids en extraheert de kernstappen. Het zet het artikel om in een schone, gestructureerde checklist genaamd een Skill.

  • De Analogie: Stel je een menselijke chefkok voor die een complex receptenblog leest. In plaats van de hele blog aan de sous-chef te geven, schrijft de chefko een beknopte, overzichtelijke "SOP" (Standard Operating Procedure) kaart: "Stap 1: Snijd uien. Stap 2: Verhit de pan. Stap 3: Voeg olie toe."
  • Het Resultaat: De robot heeft nu een duidelijke, bewerkbare instructiekaart (een SKILL.md bestand) in plaats van een verwarrende muur van tekst.

2. De Coach: Leren van fouten in real-time

De robot probeert de taak uit te voeren met behulp van deze nieuwe checklist. Als het mislukt, zegt het systeem niet alleen "Probeer het opnieuw". Het treedt op als een detective.

  • De Detective: Het kijkt naar wat de robot precies heeft gedaan, vergelijkt dit met het doel, en ontdekt waarom het is mislukt. Is de robot vergeten te wachten tot het bestand is opgeslagen? Heeft het op de verkeerde knop geklikt?
  • De Fix: Het systeem bewerkt vervolgens de checklist. Het voegt een notitie toe zoals: "Wacht 5 seconden tot het bestand is opgeslagen voordat je op 'Gereed' klikt."
  • De Analogie: Het is als een rijinstructeur die toekijkt hoe een leerling faalt voor een parkeerproef. In plaats van alleen te zeggen "Je bent gezakt", schrijft de instructeur een notitie op het oefenblad van de leerling: "Vergeet niet in de achteruitkijkspiegel te kijken voordat je achteruitrijdt." De volgende keer gebruikt de leerling dat bijgewerkte blad.

3. De Slimme Stopper: Weten wanneer te stoppen

Soms blijft een robot proberen, zelfs nadat hij is geslaagd, of blijft hij in een lus hangen omdat hij steeds faalt. Het systeem bevat een "Slimme Stopper".

  • De Analogie: Stel je een GPS voor die beseft dat je al op je bestemming bent aangekomen. In plaats van je rond het blok te laten rijden om maar zeker te weten dat je er bent, zegt het: "Je bent er. Zet de motor uit."
  • Het Voordeel: Dit bespaart tijd en geld (rekenkracht) door de robot te stoppen zodra er duidelijke tekenen van succes zichtbaar zijn, in plaats van het te dwingen een vast aantal pogingen uit te voeren.

Wat hebben ze ontdekt?

De onderzoekers hebben dit getest in drie zeer verschillende werelden:

  1. Desktopcomputers: Het besturen van software zoals Word of Photoshop.
  2. Videogames: Het spelen van Minecraft om grondstoffen te verzamelen en items te maken.
  3. Kaartspellen: Het spelen van strategische spellen zoals Doudizhu of Mahjong.

De Resultaten:

  • Ruwe gidsen zijn schadelijk: Wanneer ze de robot alleen de ruwe, rommelige menselijke gidsen gaven, werd de robot zelfs slechter in de taken. De extra ruis maakte het hem in de war.
  • Het Speelboekje wint: Wanneer ze het "Vertaler en Coach" systeem (MMG2Skill) gebruikten om die gidsen om te zetten in schone, bewerkbare skills, werden de robots aanzienlijk beter. Ze verbeterden met 12% tot 25% over de hele linie.
  • De Magie van Bewerken: De grootste winst kwam voort uit het vermogen van het systeem om de checklist aan te passen na een fout. Een eenmalige vertaling was niet genoeg; de robot moest leren van zijn eigen fouten en zijn eigen speelboekje bijwerken.

De Kernboodschap

Dit paper laat zien dat we niet voor elke robottaak perfecte code hoeven te schrijven. We kunnen de miljoenen menselijke gidsen die al op internet staan gebruiken, maar we moeten ze vertalen naar een formaat dat de robot begrijpt en de robot laten bewerken terwijl hij leert. Het verandert een rommelige menselijke handleiding in een zelfverbeterend speelboekje voor robots.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →