← Nieuwste papers
🤖 AI

Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents

Dit artikel introduceert "Formele Vaardigheid", een runtime-inheemse abstractie die informele instructies in natuurlijke taal vervangt door uitvoerbare toestandsautomaten en JSON-schema's om de efficiëntie, nauwkeurigheid en afdwingbaarheid van LLM-agenten te verbeteren, zoals aangetoond door de superieure prestaties van het open-source Framework FairyClaw op de Harness-Bench.

Oorspronkelijke auteurs: Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

Gepubliceerd 2026-05-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, zeer snelle stagiair (de AI-agent) inhuurt om een complex probleem op je kantoor op te lossen, zoals het repareren van een defect stuk software.

De Oude Manier: Het "Muur van Tekst"-Handleiding

Momenteel werken de meeste AI-agenten als volgt: je geeft hen een enorme, gedetailleerde instructiehandleiding geschreven in gewoon Engels (een "Prompt Skill"). Daarin staat dingen als: "Kijk eerst naar het foutenlogboek. Probeer daarna de code te repareren. Zorg ervoor dat je de testbestanden niet verwijdert. Als je faalt, probeer het opnieuw. Zodra je klaar bent, schrijf een rapport."

Het artikel noemt dit een "Informele Skill". Het heeft drie grote problemen:

  1. Het is duur: De AI moet deze enorme handleiding elke keer opnieuw lezen wanneer het een stap zet. Dit kost veel "tokens" (de valuta van AI-rekenkracht).
  2. Het is vaag: De AI moet raden wat "probeer opnieuw" of "verwijder niet" echt betekent. Het is alsof je tegen een mens zegt: "Wees voorzichtig", zonder te definiëren hoe "voorzichtig" eruit ziet.
  3. Het is kwetsbaar: Als de AI een fout maakt, moet het door de hele conversatiegeschiedenis terugkijken om te onthouden waar het was. Het heeft geen ingebouwde "checklist" om te weten of het klaar is of dat het een stap terug moet gaan.

De Nieuwe Manier: De "Formele Skill"

De auteurs stellen een nieuwe manier voor, genaamd "Formele Skill". In plaats van de AI een lange teksthandleiding te geven, geven ze het een programmeerbare toolkit.

Denk eraan als een upgrade van het geven van een 50 pagina's tellend receptenboek aan een kok, naar het geven van een slimme keuken met ingebouwde veiligheidsfuncties:

  • Het Recept is Code, Geen Tekst: In plaats van alinea's te lezen, interacteert de AI met specifieke knoppen (tools) en volgt het een strikte flowchart (toestandmachine).
  • Het "Hook"-Systeem: Stel je een bouncer bij een club voor (de "Hook"). Afhankelijk van welke fase van de baan de AI zich bevindt, beslist de bouncer welke deuren open zijn.
    • Fase 1 (Onderzoek): De bouncer opent alleen de deur naar de "Zoektools". De "Verwijder"-deur is vergrendeld.
    • Fase 2 (Repareren): De bouncer opent de "Patch-tool", maar vergrendelt de "Verwijder"-deur opnieuw.
    • Fase 3 (Verificatie): De bouncer laat de AI de kamer niet verlaten totdat het een "Geslaagd"-certificaat van de testmachine laat zien.
  • De Toestandmachine: De AI hoeft het hele verhaal niet te onthouden. Het heeft gewoon een klein digitaal badge dat zegt: "Ik bevind me momenteel in de 'Reparatie'-fase." Als het probeert naar "Rapporteren" te springen voordat "Repareren" klaar is, stopt het systeem dit automatisch.

De "FairyClaw"-Engine

Om dit werkend te krijgen, bouwden de auteurs een nieuwe engine genaamd FairyClaw. Je kunt FairyClaw zien als de slimme manager die het roer in handen heeft.

  • Het praat niet alleen met de AI; het beheert actief de tools en regels van de AI.
  • Het breekt grote taken op in kleinere sub-taken en wijst de juiste "Formele Skill" toe aan elk ervan.
  • Het houdt een lopend logboek bij van precies waar de AI is, wat het heeft gedaan en wat het nog moet doen, zodat de AI nooit verdwaalt.

De Resultaten: Sneller, Goedkoper en Veiliger

De auteurs testten dit systeem (FairyClaw) tegen andere populaire AI-agent-systemen met behulp van een strenge test genaamd Harness-Bench.

  • De Score: FairyClaw presteerde net zo goed, of beter, dan de andere systemen bij het daadwerkelijk krijgen van de klus geklaard.
  • De Kosten: Dit is de grote winst. FairyClaw gebruikte 48% minder tokens (geld/rekenkracht) dan het gemiddelde van de andere systemen.
    • Analogie: Als de andere systemen waren als een bezorgvrachtwagen die door de stad rijdt en bij elke bocht een enorme kaart hardop voorleest aan de bestuurder, dan is FairyClaw als een GPS die de bestuurder alleen de volgende bocht laat zien en de rest van de kaart verborgen houdt tot deze nodig is.
  • De "Code Reparatie"-Test: Bij een specifieke taak waarbij het gaat om het repareren van defecte code, was FairyClaw de duidelijke winnaar. Omdat de "Formele Skill" de AI dwong zijn werk te verifiëren voordat het klaar was, maakte het niet de domme fouten die andere agenten maakten.

Samenvatting

Het artikel betoogt dat we AI-vaardigheden niet langer moeten behandelen als lange, vage instructiehandleidingen, maar ze moeten gaan behandelen als strikte, uitvoerbare softwareprotocollen. Door de regels te verplaatsen van "tekst die de AI leest" naar "code die de AI uitvoert", krijgen we agenten die goedkoper zijn om te draaien, moeilijker te misleiden zijn en beter zijn in het volgen van complexe procedures.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →