MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction
Het artikel introduceert MIND-Skill, een multi-agentkader dat automatisch hoogwaardige, herbruikbare LLM-vaardigheden genereert via een induktie-deductiecyclus die is geoptimaliseerd aan de hand van tekstuele verliezen (reconstructie, uitkomst en rubric) om robuustheid en generaliseerbaarheid op complexe taken te waarborgen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante maar iets onhandige robotassistent hebt. Je leert het een specifieke taak aan, zoals "een terugbetaling doen aan een vriend op Venmo", door het een video te laten zien van jou die het perfect doet. De robot kijkt toe, maar in plaats van je exacte bewegingen te kopiëren, probeert het een regelschrift voor zichzelf te schrijven zodat het in de toekomst vergelijkbare taken kan uitvoeren.
Het probleem is dat de robot, als het een slecht regelschrift schrijft, vast kan lopen. Het kan de naam van jouw specifieke vriend memoriseren (te specifiek) of instructies schrijven die te vaag zijn om nuttig te zijn (te abstract).
MIND-Skill is een nieuw systeem dat is ontworpen om deze AI-agenten te helpen automatisch perfecte, hoogwaardige regelschriften te schrijven. Het doet dit met behulp van een slim "Leraar en Student"-spel dat garandeert dat de regels daadwerkelijk werken.
Hier is hoe het werkt, opgesplitst in eenvoudige onderdelen:
1. De Twee Personages: De Leraar en de Student
Het systeem gebruikt twee AI-agenten die samenwerken:
- De Leraar (Inductie-agent): Deze agent bekijkt een succesvolle video van een taak die wordt uitgevoerd. Zijn taak is een algemeen regelschrift (een "vaardigheid") te schrijven dat uitlegt hoe de taak moet worden gedaan, zonder specifieke namen of nummers te noemen.
- De Student (Deductie-agent): Deze agent is de test. Het krijgt alleen het regelschrift geschreven door de Leraar en de oorspronkelijke taakbeschrijving. Het probeert de taak vanaf nul uit te voeren met uitsluitend die instructies.
2. De "Reconstructie"-test
Dit is de magische truc. Het systeem vraagt niet alleen: "Heeft de Student het juiste antwoord gekregen?" Het vraagt: "Volgde de Student dezelfde logica als de originele video?"
- Als de Leraar een regelschrift schrijft dat zegt "Klik op de rode knop", maar de originele video toonde het klikken op een blauwe knop, zal de Student falen. Het systeem vangt dit op.
- Als de Leraar een regelschrift schrijft dat te vaag is (bijvoorbeeld "Doe het ding"), zal de Student in de war raken en falen.
- Als de Leraar een regelschrift schrijft dat te specifiek is (bijvoorbeeld "Klik op de knop voor Gebruiker #123"), beseft het systeem dat dit voor niemand anders zal werken.
Het systeem vergelijkt de prestaties van de Student met de originele video. Als ze overeenkomen, is het regelschrift goed. Als ze niet overeenkomen, weet het systeem dat het regelschrift gebrekkig is.
3. De Drie "Rapporten"
Om ervoor te zorgen dat het regelschrift perfect is, geeft het systeem de Leraar na elke poging drie specifieke rapporten (genaamd "losses"):
- Het "Heb je de Stappen Gevolgd?"-rapport (Reconstructie Loss): Volgde de Student dezelfde strategie als de originele video? (Bijvoorbeeld: Hebben ze beiden eerst de e-mail gecontroleerd en toen op verzenden geklikt?)
- Het "Heb je de Taak Klaar Gemaakt?"-rapport (Outcome Loss): Heeft de Student de taak in de echte wereld daadwerkelijk succesvol voltooid?
- Het "Is dit een Goed Handboek?"-rapport (Rubric Loss): Is het regelschrift goed geschreven? Is het duidelijk? Vermijdt het het kopiëren van specifieke details (zoals namen of ID's) die er niet zouden moeten staan? Dit zorgt ervoor dat het regelschrift een bruikbaar hulpmiddel is, en niet slechts een kopie-plak van één specifieke gebeurtenis.
4. De Cyclus van Verbetering
Het systeem draait dit spel keer op keer.
- De Leraar schrijft een concept.
- De Student probeert het.
- Het systeem beoordeelt het concept met de drie rapporten.
- Het systeem vertelt de Leraar precies wat er mis was (bijvoorbeeld: "Je hebt een specifieke naam opgenomen; verwijder deze," of "Je hebt een veiligheidscontrole overgeslagen").
- De Leraar herschrijft het regelschrift op basis van deze feedback.
Dit gebeurt automatisch, waarbij het regelschrift wordt verfijnd totdat het foutloos is.
Waarom is dit speciaal?
De meeste eerdere methoden probeerden regelschriften te schrijven door gewoon een slimme AI te vragen een video te "samenvatten". Maar de AI maakt vaak fouten: het is ofwel te vaag of te specifiek.
MIND-Skill is anders omdat het het regelschrift direct test. Het is alsof een chef-kok een recept schrijft en het vervolgens direct aan een sous-chef geeft om het gerecht te bereiden. Als de sous-chok het eten verbrandt of de verkeerde ingrediënten gebruikt, weet de chef dat het recept slecht was en repareert hij het voordat iemand anders het probeert.
De Resultaten
Het artikel testte dit op twee moeilijke werelden:
- AppWorld: Een simulatie van het gebruik van echte apps (zoals geld overmaken, tickets boeken, bestanden beheren).
- BFCL-v3: Een test van het correct aanroepen van computerfuncties.
De resultaten toonden aan dat agenten die regelschriften van MIND-Skill gebruikten, veel beter waren in het oplossen van nieuwe, onbekende taken dan agenten die regelschriften gebruikten die door andere methoden waren gemaakt. Zelfs wanneer de "Leraar"-AI niet het slimste beschikbare model was, maakte het testproces de uiteindelijke regelschriften zo goed dat ze even goed presteerden als die gemaakt door de slimste modellen.
Kortom: MIND-Skill verandert AI-agenten in zelfverbeterende leraren die hun eigen perfecte instructiehandleidingen schrijven door constant te testen of die handleidingen daadwerkelijk werken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.