← Nieuwste papers
🤖 AI

SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution

Dit artikel introduceert SkillTV-Bench, een uitgebreide benchmark voor het evalueren van vaardigheidsbewuste trajectverificatie in LLM-agenten, samen met SkillTV-Evolve, een methode die herbruikbare beoordelingsvaardigheden verfijnt om zowel de verificatienauwkeurigheid als de succespercentages van trajectselectie aanzienlijk te verbeteren.

Oorspronkelijke auteurs: Zhi Han, Chenxi Zeng, Liuhaichen Yang, Zihan Guo, Ming Zhou, Yang Li

Gepubliceerd 2026-08-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhi Han, Chenxi Zeng, Liuhaichen Yang, Zihan Guo, Ming Zhou, Yang Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers niet alleen met je chatten, maar ook daadwerkelijk dingen doen. Ze kunnen bestanden openen, code schrijven, het web doorzoeken en zelfs robots aansturen om complexe, meerstaps-problemen op te lossen. Dit zijn "AI-agenten". Maar hier komt de lastige kant aan: wanneer een AI-agent probeert een kapende website te repareren of een reis te plannen, geeft hij je niet zomaar één definitief antwoord. Hij maakt een lange reis, waarbij hij honderden kleine stappen zet, hulpmiddelen aanroept en onderweg zijn werk controleert.

De grote vraag voor wetenschappers is: hoe weten we of de AI het echt goed heeft gedaan? In het verleden keken we alleen naar het eindresultaat. Als de website er gerepareerd uitzag, zeiden we: "Goed gedaan!" Maar wat als de AI daar kwam door sluiproutes te nemen, of als hij het verkeerde ding heeft gefixed en daarbij iets anders heeft kapotgemaakt in het proces? We hebben een manier nodig om de hele reis te bekijken, niet alleen de finishlijn. Hier komen "rechters" om de hoek kijken — speciale AI-systemen die getraind zijn om het werk van de agent te beoordelen. Maar deze rechters worstelen momenteel nog. Ze worden vaak gefopt door glanzende eindantwoorden en missen de verborgen fouten die onderweg zijn gemaakt, vooral wanneer de agent speciale "vaardigheden" gebruikt (zoals een gereedschapskist vol vooraf geprogrammeerde trucjes) om de taak te voltooien.

Dit artikel introduceert een nieuwe manier om deze rechters te testen en te trainen. De onderzoekers hebben een gigantische speeltuin gecreëerd genaamd SkillTV-Bench, wat lijkt op een enorme TV-marathon met 681 verschillende afleveringen waarin AI-agenten proberen real-world taken op te lossen binnen 11 verschillende vakgebieden, van cybersecurity tot koken. De twist? De rechters kijken niet alleen naar een video; ze krijgen de "handleiding van vaardigheden" van de agent en toegang tot de werkelijke bestanden en logs die de agent heeft aangemaakt. Dit stelt hen in staat om precies te zien wat de agent had moeten doen en of hij de regels heeft gevolgd.

Het team ontdekte dat zelfs de slimste huidige rechters de mist in gaan. Ze geven vaak een "Pass" aan agenten die er aan de oppervlakte goed uitzien, maar die de missie eigenlijk hebben gefaald. Om dit op te lossen, bouwde de auteur een systeem genaamd SkillTV-Evolve. Denk aan dit als een "coach" voor de rechter. In plaats van alleen maar te gokken, krijgt de rechter een dynamische checklist (een "JudgeSkill") die hem precies vertelt waar hij naar moet kijken, waar hij moet zoeken en welk bewijs aantoont dat de agent geslaagd is of gefaald heeft. Als de rechter een fout maakt, herschrijft het systeem automatisch de checklist om die fout de volgende keer te voorkomen.

De resultaten waren indrukwekkend. Door gebruik te maken van deze evoluerende checklist, steeg de nauwkeurigheid van de rechter met bijna 15 procentpunten. Maar de echte magie gebeurde toen ze deze betere rechter gebruikten om de beste pogingen uit een groep AI-agenten te selecteren. Stel je voor dat een AI probeert een puzzel 10 keer op te lossen en daarmee 10 verschillende pogingen produceert. Een slechte rechter zou een "nep"-succes kunnen kiezen, maar deze nieuwe, vaardigheid-bewuste rechter kan het ene echte succes opsporen. Met deze betere rechter was het team in staat om 45,5% van de tijd een succesvolle oplossing te selecteren bij 10 pogingen, vergeleken met slechts 22,9% met één enkele poging of een zwakkere rechter.

Kortom, het artikel suggelt dat om AI-agenten te vertrouwen, we rechters nodig hebben die niet alleen naar de definitieve foto kijken, maar het hele album inspecteren, waarbij ze de eigen instructiehandleiding van de agent gebruiken om de neptitels te herkennen. Door deze rechters een betere "regelset" te geven die leert van hun eigen fouten, kunnen we AI veel betrouwbaarder maken bij het uitvoeren van complexe, real-world taken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →