Agentic Context Learning with Self-Discovered Specification
Dit artikel identificeert dat de primaire uitdaging in context learning voor grote taalmodellen niet louter het toegankelijk maken van inhoud is, maar het verwerven van impliciete, taakspecifieke specificaties die over de context verspreid zijn, en demonstreert dat een eenvoudige interventie genaamd PSCI, die deze specificaties extraheert en afdwingt via adversariële controle, de bestaande baselines op de CL-Bench benchmark significant overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je zojuist een enorme, 40.000 pagina tellende instructiehandleiding hebt gekregen voor een gloednieuwe, supercomplexe videogame. De handleiding zit vol met lore, achtergrondverhalen van personages en wereldgeschiedenis. Dan vraagt een vriend je een simpele vraag: "Wat gebeurt er als ik een level oversla?"
Je zou denken dat het moeilijkste deel is om het antwoord in dat gigantische boek te vinden. Je zou denken: "Als ik maar zoek op 'level overslaan', dan vind ik de regel!" Maar hier komt de twist: het artikel betoogt dat voor moderne AI-modellen het echte probleem niet het vinden van het antwoord is (de inhoud). Het echte probleem is het vinden van de spelregels die je vertellen hoe je dat antwoord correct schrijft (de specificaties).
Het "Bijna-Mis" Mysterie
De onderzoekers testten dit op een benchmark gena de CL-Bench, die 1.899 lastige taken bevat waarbij de AI nieuwe regels moet leren uit lange teksten. De resultaten waren verrassend. Zelfs de slimste AI-modellen (zoals GPT-5.1) kregen slechts ongeveer 22,55% van de taken perfect goed.
Maar toen ze dieper keken naar de fouten, ontdekten ze iets vreemds. De AI zat meestal niet naast met de feiten. De AI zat naast met de vorm.
- Het Feit: De AI wist dat de ontbrekende ID "404" was.
- De Regel: De handleiding zei: "Als je een ontbrekende ID ziet, moet je de exacte flag
Sequence_Gap_Warningschrijven." - De Fout: De AI schreef "404" maar vergat de flag.
Het was een "bijna-mis". De AI kende de inhoud, maar miste de lokale specificatie. Sterker nog, het onderzoek vond dat 55,4% van alle regels in de test over deze specifieke gedragingen ging (formaten, volgorde, exacte bewoordingen), terwijl slechts 22,6% over feitelijke inhoud ging.
Waarom "Zoeken" Niet Werkte
Een logische gok zou zijn: "Misschien kan de AI de juiste pagina in de handleiding niet vinden." Dus probeerden de onderzoekers 12 verschillende methoden om de AI beter te laten zoeken, zoals het samenvatten van de tekst of het extraheren van relevante fragmenten.
Het resultaat? Geen van deze methoden werkte goed. De beste van deze zoekgeoriënteerde methoden scoorde nog steeds slechts rond de 23%. Dit suggereert dat het simpelweg vinden van de juiste pagina niet het probleem is. Het probleem is dat de regels vaak verborgen zijn in de achtergrond — zoals een voetnoot in een paragraaf over "event semantics" — en de AI beseft niet dat hij ze moet volgen, tenzij hij er expliciet naar zoekt.
De "Privécontract" Oplossing
Om dit te bewijzen, ontwierpen de onderzoekers een eenvoudige truc genaamd PSCI (Private Specification-Contract Induction). Denk er zo over na:
Voordat de AI probeert de vraag te beantwoorden, dwingen ze het tot een "pre-game meeting":
- Induceren: De AI leest de hele handleiding en schrijft een "Privécontract" op van alle verborgen regels die hij heeft gevonden (bijv. "Regel 1: Gebruik altijd de flag
Sequence_Gap_Warning"). - Genereren: De AI schrijft zijn antwoord, maar hij moet dat contract volgen.
- Controleren: Een "scheidsrechter" (een andere AI-stap) controleert het antwoord tegen het contract. Heb je de flag gebruikt? Heb je de volgorde gevolgen?
- Repareren: Als de scheidsrechter "Nee" zegt, herstelt de AI het antwoord voordat hij het aan jou laat zien.
Het resultaat? Deze eenvoudige vierstaps-methode verhoogde de score van GPT-5.1 van 22,55% naar 28,14%. Dat is een sprong van 5,59 procentpunt, wat enorm is in deze wereld. Het werkte ook op andere modellen zoals Qwen3.5-27B (sprong van 14,14% naar 19,42%) en Gemini 3 Pro (sprong van 16,14% naar 22,31%).
Wat Dit Uitsluit
Het artikel is heel duidelijk over wat niet werkt:
- Gewoon meer zoeken: Het gooien van meer zoektools op het probleem hielp niet.
- Gewoon harder nadenken: Het gebruik van de "GPT 5.1 (High)" instelling uit de oorspronkelijke CL-Bench evaluatie haalde de AI slechts naar 23,7%, wat nog steeds lager is dan de 28,14% bereikt door de PSCI-truc.
- Generieke checklists: Als je de AI alleen vraagt om "zijn werk te controleren" zonder eerst de specifieke regels uit deze context te laten opschrijven, helpt het niet. De regels moeten specifiek zijn voor de taak die voorhanden is.
Hoe Zeker Zijn Ze?
De auteurs zijn vrij zelfverzekerd over hun bevindingen omdat ze dit grondig hebben getest. Ze hebben niet alleen gegokt; ze hebben 17 verschillende "ablatie-experimenten" uitgevoerd (het uit elkaar halen van de methode om te zien wat werkt).
- Ze bewezen dat als je de regels door elkaar husselt (de AI een verkeerd contract geeft), de score instort naar 19,80%, wat bewijst dat de regels moeten overeenkomen met de specifieke taak.
- Ze bewezen dat als je de "contract"-stap overslaat en de AI gewoon later zijn eigen werk laat controleren, het mislukt. Het contract moet geschreven worden voordat het antwoord wordt gegenereerd.
- Ze lieten zelfs menselijke experts 100 van de antwoorden van de AI controleren. De mensen stemden in 96% van de gevallen overeen met het oordeel van de computer, wat bevestigt dat de AI daadwerkelijk beter werd, en niet alleen maar aan het gokken was.
De Kernboodschap
Het artikel suggereert dat voor AI om nieuwe regels te leren uit lange teksten, het niet alleen een goede bibliothecaris moet zijn die de juiste boeken vindt. Het moet een goede advocaat zijn die de kleine lettertjes leest, een contract van de regels opstelt en dat contract ondertekent voordat het werk wordt uitgevoerd.
Hoewel de score van 28,14% de beste tot nu toe is, merken de auteurs op dat het nog geen "opgelost" probleem is. Er is nog veel ruimte voor verbetering, vooral in het deel van de "handhaving" — ervoor zorgen dat de AI het contract dat hij voor zichzelf heeft geschreven ook daadwerkelijk uitvoert. Maar de belangrijkste conclusie is duidelijk: contextueel leren gaat niet alleen over het vinden van het antwoord; het gaat over het eerst ontdekken van de spelregels.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.