← Nieuwste papers
💬 NLP

UNSPECIFIC: General Constraint Synthesis for Breaking Copy-and-Paste Shortcut in LLM Instruction Following

Het artikel introduceert UNSPECIFIC, een nieuw framework en benchmark die ontworpen zijn om copy-and-paste-shortcuts in LLM-instructievolging te elimineren door beperkingen te synthetiseren die gebruikelijk zijn bij vergelijkbare referentieartikelen en door responsen te evalueren op zowel de volledige tekst als samenvattingen om echte naleving te waarborgen in plaats van oppervlakkig kopiëren.

Oorspronkelijke auteurs: Jeet Sharma, Balpreet Kaur, Jeremiah Hong, Hamed Zamani, Haw-Shiuan Chang

Gepubliceerd 2026-08-11
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jeet Sharma, Balpreet Kaur, Jeremiah Hong, Hamed Zamani, Haw-Shiuan Chang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om verhalen te schrijven. Je geeft het een lijst met regels, zoals "De held moet dapper zijn" of "Het verhaal moet eindigen met een regenbui." Dit wordt instructie-opvolging genoemd. In de wereld van Kunstmatige Intelligentie zijn Large Language Models (LLM's) deze robots, en onderzoekers proberen voortdurend te zien of ze complexe, lange lijsten met regels kunnen volgen zonder in de war te raken of dingen te verzinnen.

Maar hier komt het lastige deel: hoe test je of de robot echt over de regels nadenkt, of dat hij gewoon een kortere weg neemt? Soms is de test zelf gebrekkig. Als je een robot vraagt een verhaal te schrijven op basis van een specifiek voorbeeld dat hij net heeft gelezen, kan hij de details van het voorbeeld simpelweg in zijn eigen verhaal kopiëren en plakken. Het is als een student die, in plaats van een essay te schrijven over "een keer dat je een vriend hielp", gewoon een alinea kopieert uit het huiswerk van een klasgenoot die zegt: "Ik hielp mijn vriend met het dragen van boodschappen." De leraar ziet de woorden "hielp" en "vriend" en denkt: "Goed gedaan!", maar de student heeft het werk eigenlijk niet gedaan. Dit artikel gaat over het oplossen van die kortere weg, zodat we kunnen zien of de robots echt slim zijn of gewoon heel goed zijn in kopiëren.


De Grote Kopieer-en-Plak Kortere Weg

Maak kennis met UNSPECIFIC, een nieuw framework dat ontworpen is om AI-modellen te betrappen wanneer ze proberen de makkelijke weg te kiezen. De onderzoekers van de University of Massachusetts, Amherst, merkten een groot probleem op in de manier waarop we AI momenteel testen. Meestal, om een test te maken, nemen we een echt artikel (zoals een nieuwsbericht) en vragen we een AI om dit om te zetten in een lijst met instructies. Daarna vragen we een andere AI om een nieuw verhaal te schrijven op basis van die instructies.

Het probleem? De eerste AI wordt vaak te specifiek. In plaats van algemene regels te bedenken, grijpt de AI vaak specifieke details uit het originele artikel. Bijvoorbeeld, als het originele verhaal gaat over "John en Mary die ruzie maken over yoghurt bij Walmart", dan kunnen de instructies zeggen: "De personages moeten John en Mary heten" en "Ze moeten ruzie maken bij Walmart". Wanneer de tweede AI deze instructies krijgt, hoeft hij niet creatief te zijn; hij kopieert gewoon "John", "Mary" en "Walmart" rechtstreeks in zijn eigen verhaal. Het is een "kopieer-en-plak kortere weg" die de AI laat lijken alsof hij de instructies perfect opvolgt, terwijl hij in werkelijkheid alleen maar nadoet.

Hoe UNSPECIFIC de Kortere Wegen Identificeert

Om dit te stoppen, heeft het UNSPECIFIC-team een driestaps magische truc bedacht om de tests eerlijk en uitdagend te maken.

Stap 1: Het "Common Ground" Spel
In plaats van slechts één verhaal te gebruiken om de regels te maken, voert de onderzoeker de AI twee vergelijkbare verhalen. Stel je voor dat je twee verschillende verhalen hebt over mensen die ruzie hebben. De ene gaat over John en Mary in een supermarkt; de andere gaat over Chris en Julie bij een benzinestation. Als je de AI vraagt om regels te vinden die op beide verhalen van toepassing zijn, kan de AI niet zeggen: "De hoofdpersonages moeten John en Mary zijn", want dat past alleen bij het eerste verhaal. In plaats daarvan moet de AI een algemene regel bedenken zoals: "De hoofdpersonages moeten een discussie hebben." Dit dwingt de regels om breder en natuurlijker te zijn, zoals iets wat een echt mens zou vragen, in plaats van een specifiek detail uit een enkele tekst.

Stap 2: De "Te Makkelijke" Filter
Zelfs met algemene regels zijn sommige nog steeds te makkelijk. Misschien is de regel "Het verhaal moet een begin hebben." Nou, elk verhaal heeft een begin! De AI voldoet hieraan zonder er zelfs maar bij na te denken. UNSPECIFC controleert dit door de AI eerst een "basisverhaal" te laten schrijven voordat hij de regels te zien krijgt. Als de AI per ongeluk aan een regel voldoet door gewoon een normaal verhaal te schrijven, wordt die regel gemarkeerd als "te makkelijk". Het systeem vervangt die makkelijke regel vervolgens door een moeilijkere, zoals "Het verhaal moet beginnen met een personage dat wakker wordt door een vreemd geluid", waardoor de AI daadwerkelijk moet nadenken.

Stap 3: De "Samenvattings-test"
Dit is het meest slimme deel. Nadat de AI zijn verhaal heeft geschreven, vragen de onderzoekers de AI om het verhaal samen te vatten in een korte paragraaf — ongeveer 25% van de oorspronkelijke lengte. Als de AI de regels alleen heeft voldaan door er aan het einde willekeurige zinnen aan toe te voegen (zoals "En trouwens, het verhaal heeft een gelukkig einde"), dan worden die details in de samenvatting weggefilterd. Als de regel nog steeds in de samenvatting aanwezig is, betekent dit dat de AI de regel echt in de kern van het verhaal heeft verweven. Als de regel verdwijnt, heeft de AI slechts een kortere weg genomen met oppervlakkige details.

Wat Ze Vonden

Toen ze dit nieuwe systeem aan de test onderwierpen, waren de resultaten oogopenend. Ze ontdekten dat veel AI-modellen inderdaad de kopieer-en-plak kortere weg namen.

  • De Moeilijkheidsgraad Sprong: Bij het gebruik van de nieuwe UNSPECIFIC-methode daalde het voldoen-percentage van een krachtig model genaamd GPT-5 Mini van 89,7% (onder de standaard enkele-artikel baseline) naar 78,2%. Dit betekent niet dat de AI slechter werd; het betekent dat de test hem eindelijk betrapte toen hij niet hard genoeg zijn best deed.
  • De Kopieer-en-Plak Kloof: De onderzoekers ontdekten dat een groot deel van het "succes" in eerdere tests niet volledig accuraat was. Toen ze naar de samenvattingen keken, bleken veel modellen die de instructies perfect leken te volgen, de "kern-narratief" test eigenlijk niet te hebben gehaald. Ze hadden de regels alleen aan de oppervlakte voldaan, niet in het hart van het verhaal.
  • Naturalness Wint: De nieuwe beperkingen voelden veel meer als echte menselijke verzoeken. Sterker nog, de kloof tussen hoe mensen de natuurlijkheid van deze nieuwe instructies versus de oude beoordeelden, verbeterde met 30%.

Het artikel suggereert dat het simpelweg moeilijker maken van instructies niet genoeg is; we moeten ook zorgen dat de instructies algemeen genoeg zijn zodat de AI ze niet zomaar kan kopiëren en plakken. Door gebruik te maken van de "twee-verhalen"-methode en de "samenvattings-test", biedt UNSPECIFIC een veel duidelijker beeld van of een AI werkelijk instructies begrijpt of alleen maar een spelletje speelt van "zoek de overeenkomende woorden vinden".

Uiteindelijk gaat UNSPECIFIC niet alleen over het laten harder werken van AI; het gaat over het waarborgen dat we weten hoe ze werken. Het stopt de modellen bij het nemen van de kortere weg en dwingt hen om daadwerkelijk te schrijven, zodat we zeker weten dat wanneer we zeggen dat een AI "instructies opvolgt", ze dat ook echt begrijpt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →