← Nieuwste papers
💻 computer science

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

SkillEvo is een framework dat duurzame evolutie van agent-vaardigheden mogelijk maakt door meerzaalvloeiende gebruikerssimulaties te transformeren naar continue feedbackgeneratoren voor gerichte verbeteringen en door een actieve governance-laag te introduceren om structurele degradatie te herstellen, waardoor het bestaande single-turn of zelfreflectie-gebaseerde benaderingen overtreft.

Oorspronkelijke auteurs: Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

Gepubliceerd 2026-08-14
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert hoe hij een kapotte broodrooster moet repareren. In de oude dagen moest je elke stap met de hand opschrijven: "Controleer de stekker," "Zoek naar verbrande draden," "Druk op de resetknop." Als de robot een fout maakte, moest je de fout zoeken, de handleiding herschrijven en opnieuw beginnen. Dit is traag, duur, en de robot leert nooit echt van zijn eigen fouten tijdens het proces.

Onlangs zijn wetenschappers begonnen door robots dingen te laten repareren en hen vervolgens te vragen: "Hoe heb je dat gedaan?" De robot kijkt naar zijn eigen werk, realiseert zich dat hij een stap heeft gemist, en probeert zijn eigen instructies te herschrijven. Dit wordt "zelfevolutie" genoemd. Maar er is een addertje onder het gras: de meeste van deze robots krijgen slechts één kans om zichzelf uit te leggen. Ze proberen de broodrooster te repareren, krijgen een snelle score van "goed gedaan" of "slecht gedaan" en stoppen dan. Ze missen de subtiele fouten die pas aan het licht komen als je vraagt: "Wacht even, wat als de stekker los zit en de draad verbrand is?" Ze lopen vast omdat ze de diepere lagen van het probleem niet kunnen zien.

Dit is waar een nieuw idee genaamd SkillEvo om de hoek komt kijken. Het is een framework dat ontworpen is om AI-"agents" (slimme computerprogramma's) beter te laten worden in hun werk door te leren van lange, wederzijdse gesprekken, in plaats van slechts een korte, snelle controle. De onderzoekers achter dit werk, van Tencent Cloud en Zhejiang University, wilden een specifiek probleem oplossen: hoe houd je de kennisbasis van een AI groeiend en verbeterend zonder dat het rommelig, verwarrend of vol met leugens wordt? Ze ontdekten dat het geheim niet alleen het hebben van een slimme redacteur is, maar het hebben van een slimme leraar die doorlopend vervolgvragen stelt om verborgen fouten te ontdekken, en een strikte inspecteur die ervoor zorgt dat de robot niet per ongeluk de juiste antwoorden verwijdert terwijl hij nieuwe probeert toe te voegen.

Het Probleem: De Robot die Stopt met Leren

Stel je voor dat je een videogame speelt met een nieuw personage. In de eerste ronde probeert het personage over een kuil te springen en faalt. Je zegt tegen hen: "Je moet hoger springen." Ze passen het aan, en in de volgende ronde springen ze prima. Maar dan proberen ze over een kuil te springen terwijl ze een vuurbel te ontwijken. En ze falen opnieuw. Als je leraar alleen feedback gaf op de eerste sprong, zou het personage nooit leren om de vuurbel te ontwijken. Ze zouden een "plafond" bereiken waarbij ze niet meer beter kunnen worden omdat ze niet worden getest op de moeilijke zaken.

Dit is precies wat er gebeurt met de huidige AI-vaardigheden. De meeste systemen gebruiken een "single-turn" controle. De AI probeert een probleem op te lossen, krijgt een score en probeert het opnieuw. Maar zodra de voor de hand liggende fouten zijn gecorrigeerd, wordt de feedback niet meer nuttig. De AI loopt tegen een muur aan. Het is alsof je een taal probeert te leren door alleen met "Ja" of "Nee" te antwoorden op eenvoudige vragen; je zult nooit leren hoe je een complexe conversatie voert.

Bovendien, wanneer deze AI's proberen zichzelf te verbeteren, maken ze vaak dingen kapot. Ze voegen misschien zoveel nieuwe informatie toe dat hun instructies een rommelige, 100 pagina's tellende roman vol tegenstrijdigheden worden. Ze kunnen de oorspronkelijke regels die ze moesten volgen vergeten. Dit wordt "degradatie" genoemd. Hoe meer ze proberen te evolueren, hoe minder betrouwbaar ze worden.

De Oplossing: De Tweeledige Magie van SkillEvo

De auteurs van dit artikel stellen een nieuw systeem voor genaamd SkillEvo (Skill Evolution). Ze beargumenteren dat de sleutel tot het beter maken van AI niet alleen het geven van meer tijd om de eigen code te bewerken is, maar het geven van betere feedback en betere regels. Ze bouwden een systeem met twee hoofdonderdelen: een Trustworthy Feedback Generator en een Controllable Governance Layer.

Deel 1: De Nieuwsgierige Simulator (Betrouwbare Feedback)

In plaats van de AI slechts één vraag te stellen, gebruikt SkillEvo een "Simulator" die fungeert als een echte, ietwat lastige menselijke klant. Deze simulator stelt niet slechts één vraag en vertrekt ook niet. De simulator speelt een spelletje "20 vragen".

  1. De Opzet: De simulator leest een echte, rommelige klacht van een klant (een "ticket") en creëert een realistisch scenario. De simulator weet wat de klant wil, wat ze al geprobeerd hebben en zelfs hoe ze gefrustreerd kunnen raken.
  2. De Conversatie: De AI probeert te helpen. De simulator stelt vervolgvragen: "Oké, maar wat als ik dat probeerde en het niet werkte?" of "Wacht, ik heb nu een andere foutcode."
  3. De Onthulling: Dit heen-en-weer praten legt de lagen van het probleem bloot. Net als in de videogame kan de eerste ronde van het gesprek de makkelijke dingen oplossen, maar de tweede en derde ronde onthullen de verborgen, complexe fouten.
  4. Het Filter: Niet elke fout is de schuld van de AI. Soms is de simulator vreemd, of is de tool die de AI gebruikt kapot. SkillEvo heeft een speciale "Attributor" die controleert: "Is dit een gat in de kennis van de AI, of is het iets anders?" Alleen de echte kennishiaten worden omgezet in feedback.

Dit creëert een "zelfvernieuwende" gradiënt. Elke keer dat de AI een fout herstelt, krijgt de simulator de kans om een moeilijkere vraag te stellen, waardoor de volgende laag van defecten wordt onthuld. De AI raakt nooit uitgeput wat betreft dingen om te leren.

Deel 2: De Strikte Inspecteur (Beheersbare Governance)

Zelfs met goede feedback kan een AI rommelig worden. Als je een student elke dag zijn tekstboek laat herschrijven, kan hij per ongeluk het hoofdstuk over wiskunde verwijderen terwijl hij een hoofdstuk over kunst toevoegt. Hij kan het boek 1.000 pagina's lang maken met repetitieve onzin.

SkillEvo voegt een "Governance"-laag toe om dit te voorkomen. Denk aan dit als een strikte redacteur die twee regels heeft:

  1. Verwijder de Waarheid Niet: De AI moet alle stabiele, correcte feiten behouden waarmee hij begon. Als de AI probeert een bekend feit te verwijderen, zegt het systeem "Nee!" en herstelt het dit onmiddellijk.
  2. Laat het Boek Niet Opzwellen: Het systeem controleert of de AI onnodige franje toevoegt of de links tussen verschillende delen van zijn kennis verbreekt. Als de "kennisgrafiek" van de AI in de knoop raakt of te groot wordt, herstelt het systeem dit actief door doodlopende wegen te snoeien en de structuur aan te scherpen.

Dit zorgt ervoor dat naarmate de AI slimmer wordt, hij niet rommelig wordt. Hij blijft georganiseerd en betrouwbaar.

Wat Ze Vonden: De Cijfers

De onderzoekers testten dit systeem op 9 echte vaardigheden die worden gebruikt in clouddiensten (zoals het oplossen van databaseproblemen of het beheren van servers). Ze vergeleken SkillEvo met drie andere methoden:

  • Original Skills: Het startpunt, nooit bijgewerkt.
  • Self-Reflection: De AI probeert zichzelf te verbeteren zonder externe feedback.
  • Single-Turn QA: De AI krijgt feedback van slechts één vraag-en-antwoordsessie.

De resultaten waren duidelijk. De "Self-Reflection"-methode verbeterde nauwelijks; het draaide alleen maar rondjes. De "Single-Turn QA"-methode werd eerst beter, maar liep toen tegen een muur aan en stopte rond een succespercentage van 66,4%.

SkillEvo bleef echter stijgen. Door de multi-turn conversatie te gebruiken om diepere problemen te vinden en de governance-laag om de boel schoon te houden, bereikte het een succespercentage van 81,8%. Dat is een verbetering van 15,4 procentpunt ten opzichte van de single-turn methode en een enorme verbetering van 51,8 procentpunt ten opzichte van de oorspronkelijke, niet-bijgewerkte vaardigheden.

Ze maten ook hoeveel het "kennisboek" van de AI groeide. Zonder de governance-laag groeide het boek met 16,2% in omvang, waardoor het opgeblazen en rommelig werd. Met de governance-laag groeide het slechts met 2,8%, wat bewees dat de AI efficiënt leerde zonder onnodige troep toe te voegen.

Waarom Dit Belangrijk Is

Dit artikel suggereert dat de toekomst van AI niet alleen gaat over het maken van grotere modellen of het laten bewerken van zichzelf. Het gaat over hoe we met hen praten en hoe we hun werk controleren. Door een eenvoudige "test" te veranderen in een lang, onthullend gesprek, en door een strikt "governance"-systeem toe te voegen om de AI te voorkomen dat hij in de war raakt, kunnen we AI creëren die echt leert en in de loop van de tijd verbetert.

De auteurs hebben dit getest in een echte productieomgeving bij Tencent Cloud, wat betekent dat dit geen theorie is; het is een systeem dat daadwerkelijk werkt wanneer echte klanten betrokken zijn. Ze hebben aangetoond dat als je een AI een leraar geeft die de juiste vervolgvragen stelt en een strikte redacteur die hem eerlijk houdt, de AI kan evolueren naar een veel capabelere en betrouwbaardere helper.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →