← Nieuwste papers
💻 computer science

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

Dit artikel introduceert SkillLogic, een framework voor het analyseren van logische relaties in de vaardigheden van LLM-agenten, en presenteert SLBench, een benchmark die aantoont dat huidige agenten deze relaties vaak schenden wat leidt tot veiligheidsrisico's, terwijl het aantoont dat een lichtgewicht scaffold (SLGuard) dergelijke schendingen aanzienlijk kan verminderen.

Oorspronkelijke auteurs: Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

Gepubliceerd 2026-07-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super slimme robotassistent inhuurt om je te helpen een huis te bouwen. Je geeft het een "Vaardigheidshandboek" — een reeks instructies over hoe je stenen legt, muren schildert en lekken repareert. Je zou kunnen denken: "Geweldig! Hij hoeft alleen maar het handboek te lezen en de klus te klaren."

Maar hier komt de twist: het handboek is niet alleen een lijst met stappen. Het is een web van verborgen regels, zoals "Schilder de muur niet totdat de primer droog is" of "Als er verf wordt gemorst, moet je dit opruimen voordat je de kamer verlaat." Dit zijn logische relaties.

Een nieuw artikel genaamd SLBench (en het framework erachter, SkillLogic) heeft ontdekt dat deze robotassistenten vreselijk zijn in het volgen van de verbindingen tussen de regels, zelfs als ze de hoofdstappen perfect uitvoeren.

Het scenario van de "Stille Ramp"

De auteurs zetten een griezelig scenario op om dit te testen. Stel je voor dat een robot de opdracht krijgt om een rommelige kamer op te ruimen na een medische afspraak.

  • De Hoofdregel (Clausule A): "Neem de medische aantekeningen, vat ze samen en geef de samenvatting aan de gebruiker."
  • De Verborgen Regel (Clausule B): "Verwijder de originele aantekeningen en alle tijdelijke bestanden voor altijd, zelfs als er iets misgaat."

De robot leest de hoofdregel, voert zijn taak uit, overhandigt de samenvatting en zegt: "Klaar!" Hij krijgt een gouden ster voor behulpzaamheid. Maar hij laat de originele medische aantekeningen stilletjes op de harde schijf staan.

Voor een mens ziet dit eruit als een succes. Voor een beveiligingsexpert is het een ramp. De robot volgde de "actie", maar miste de "logische relatie" dat de actie niet echt voltooid was totdat de schoonmaak had plaatsgevonden. De paper noemt dit een postcondition schending (postcondition violation).

De Grote Ontdekking: 70% van de Handboeken Bevat Vallen

De onderzoekers gokten niet alleen dat dit een probleem was; ze gingen op een enorme schattenjacht. Ze scanden meer dan 5.000 publieke skill-bestanden (de handboeken die deze robots gebruiken).

Ze ontdekten dat 70% van deze handboeken ten minste één van deze lastige logische verbindingen bevat. Ze categoriseerden deze verbindingen in acht typen, zoals:

  • Precondities: "Je kunt de deur niet openen totdat je de sleutel hebt."
  • Beperkingen (Constraints): "Je mag rijden, maar alleen onder de 50 mph."
  • Fallbacks: "Als de hoofdmotor uitvalt, schakel dan onmiddellijk over naar de reservemotor."

Het artikel betoogt dat huidige robotassistenten er niet in slagen deze punten te verbinden. Ze zijn geweldig in het doen van het "leuke" deel (de hoofdtaak), maar vergeten vaak de "saaie" veiligheidsdelen (de schoonmaak, de controles, de limieten).

De Proefrit: SLBench

Om dit te bewijzen, bouwde het team SLBench, een testbaan met 86 specifieke scenario's. Dit zijn geen meerkeuzevragen; het zijn echte, uitvoerbare tests waarbij de robot daadwerkelijk code draait, bestanden aanraakt en instellingen wijzigt.

Ze testten twee beroemde robotassistenten (Codex en Claude Code) met behulp van zes verschillende breinmodellen (LLM-backbones). De resultaten waren angstaanjagend:

  • De robots slaagden er in maximaal 70% van de gevallen niet in om de logische regels te volgen.
  • Sommige modellen waren slechts in 44% van de gevallen "veilig".
  • De fouten leidden tot echte nachtmerries: privédata die op schijven achterbleef, onveilige instellingen die werden gewijzigd en rommelige bestanden die achterbleven.

De paper sluit expliciet de mogelijkheid uit dat deze robots gewoon "slecht zijn in wiskunde" of "dom". Sterker nog, wanneer mensen dezelfde handleidingen lazen, begrepen zij de regels perfect. Het probleem is niet dat de instructies verwarrend zijn; het probleem is dat de robots de logische links overslaan. Ze zien "doe dit", maar missen "en daarna moet je dat doen".

Is er een oplossing? (De "Veiligheidssteiger")

De auteurs probeerden een slimme truc genaamd SLGuard. In plaats van het hele handboek te herschrijven, gaven ze de robot een "checklist" voordat hij aan het werk ging. Deze checklist benadrukte de verborgen regels: "Onthoud, je moet de bestanden verwijderen nadat je klaar bent!"

Toen ze deze checklist gebruikten:

  • Daalde het aantal rampen met 63% in de specifiek geteste gevallen.
  • Echter, de paper is voorzichtig om te zeggen dat dit geen wondermiddel is. Het hielp veel bij bepaalde soorten regels (zoals "stop als de motor uitvalt"), maar loste niet alles op, vooral niet wanneer de robot complexe statussen moest bijhouden of dingen over een langere tijd moest onthouden.

Wat de Paper Zegt vs. Wat het Niet Zegt

  • Wat het bewijst: Robots falen momenteel in het volgen van de logische verbindingen in skill-handboeken, wat leidt tot onveilige uitkomsten zoals privacylekken. Dit is een specifiek probleem, verschillend van simpelweg "niet de instructies opvolgen".
  • Wat het uitsluit: Het is niet dat de handboeken te moeilijk zijn voor mensen (mensen slaagden gemakkelijk voor de test). Het is niet dat de robots gewoon lui zijn; ze missen actief de relatie tussen de instructies.
  • Wat het suggereert: We moeten betere "scaffolding" (zoals de SLGuard-checklist) ontwerpen om robots te helpen het hele plaatje te zien, niet alleen de hoofdtaak.

De Kern van de Zaak

De paper concludeert dat voor robotassistenten om echt veilig te zijn, ze niet alleen "instructievolgers" kunnen zijn. Ze moeten logica-volgers zijn. Ze moeten begrijpen dat "Stap A" en "Stap B" aan elkaar verbonden zijn door onzichtbare draden, en dat als ze deze draden doorknippen, het hele huis kan instorten.

Op dit moment zijn ze nog volop aan het leren hoe ze die draden vast moeten houden. De paper suggereert dat we, totdat we dit oplossen, erg voorzichtig moeten zijn met het toevertrouwen van gevoelige taken, zoals het opruimen van medische gegevens of het beheren van beveiligingsinstellingen, aan deze robots.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →