← Nieuwste papers
💻 computer science

Instruction fragility under hidden operational requirements

Dit artikel toont aan dat instructies in natuurlijke taal kwetsbaar zijn onder verborgen operationele vereisten, wat onthult dat hoewel generieke prompting faalt om weggelaten beperkingen te voldoen, de prestaties aanzienlijk verbeteren wanneer die beperkingen expliciet worden opgevraagd en uitgevoerd.

Oorspronkelijke auteurs: Chanho Park, Jinbae Gong, Minsu Kim, Gyeongho Gong, Woochan Lee, Yeachan Kwak, Seongim Choi

Gepubliceerd 2026-07-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chanho Park, Jinbae Gong, Minsu Kim, Gyeongho Gong, Woochan Lee, Yeachan Kwak, Seongim Choi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Kernprobleem: De "Genie" die het fout doet

Stel je voor dat je een magische Genie hebt (de AI) die je wensen vervult. Je zegt: "Maak me rijk."

De Genie zou dit op duizend manieren kunnen interpreteren:

  • Het zou je een legitieme baan kunnen geven.
  • Het zou nepgeld kunnen bijdrukken.
  • Het zou een bank kunnen hacken.
  • Het zou de definitie van "rijkdom" kunnen veranderen zodat je rijk bent aan "geluk", maar arm aan contant geld.

Het paper betoogt dat wanneer je een AI een korte instructie geeft, je in feite een wensenlijst geeft met ontbrekende items. Je denkt misschien dat je "legitieme rijkdom" wilt, maar je hebt niet gezegd "geen illegale activiteiten" of "geen bankfouten". Omdat je het niet hebt gezegd, is de AI vrij om elke versie van "rijkdom" te kiezen die past bij de woorden die je gebruikte.

De auteurs noemen dit "Instruction Fragility" (Instructie-fragiliteit). De instructie is fragiel omdat deze gemakkelijk breekt wanneer de AI de verkeerde versie van jouw verborgen regels raadt.

Het Experiment: Het "Geheime Regel" Spel

Om dit te testen, creëerden de onderzoekers een spel met 100 verschillende taken (zoals een e-mail schrijven, een rapport samenvatten of een reis plannen).

  • De Zichtbare Prompt: Dit is wat de gebruiker ziet en typt (bijv. "Schrijf een samenvatting van dit artikel").
  • De Verborgen Vereisten: Dit zijn geheime regels die alleen bekend zijn bij de onderzoekers (de "evaluatoren"), niet bij de AI. Voorbeelden zijn: "Moet minder dan 50 woorden zijn", "Moet een waarschuwing voor risico bevatten", "Moet in JSON-formaat zijn" of "Mag het woord 'zekerlijkheid' niet gebruiken".

De AI moest de zichtbare prompt volgen en de verborgen regels perfect raden. Als de AI zelfs maar één verborgen regel miste, was de taak een totale mislukking.

De Resultaten: Raden versus Vragen

De onderzoekers testten de AI onder verschillende omstandigheden om te zien hoe goed het met deze ontbrekende regels om kon gaan.

1. De "One-Shot" Gok (2,7% Succes)

  • Analogie: Je vertelt een chef: "Maak me een broodje," en loopt weg. Je zegt niet "geen uien," "gebruik zuurdesem," of "snijd het doormidden."
  • Resultaat: De AI had het slechts 2,7% van de tijd goed. Het miste bijna altijd de verborgen regels.

2. Het "Generieke Sjabloon" (7,3% Succes)

  • Analogie: Je geeft de chef een standaard "Broodje Bestelformulier" dat vakjes heeft voor "Brood" en "Vlees", maar je hebt nog steeds het specifieke "Geen Uien"-vakje niet ingevuld.
  • Resultaat: Iets beter, maar nog steeds grotendeels fout. Generieke formulieren lossen het gebrek aan specifieke details niet op.

3. Het "Nepgesprek" (1,7% Succes)

  • Analogie: Je vraagt aan de chef: "Heb je speciale regels?" en de chef zegt: "Nee, maak gewoon een broodje."
  • Resultaat: Dit hielp helemaal niet. Alleen praten zonder de juiste informatie te verkrijgen, is nutteloos.

4. De "Eerlijke Verduidelijking" (8,0% Succes)

  • Analogie: Je dwingt de chef om specifieke vragen te stellen van een menu (bijv. "Wilt u JSON-formaat?"). De chef vraagt, en jij zegt "Ja."
  • Resultaat: Nog steeds erg laag. De AI was slecht in het uitzoeken van welke vragen hij moest stellen. Hij stelde de verkeerde vragen of miste de cruciale vragen.

5. De "Oracle" (Het Spiekbriefje) (64,7% Succes)

  • Analogie: Je geeft de chef een spiekbriefje dat elke enkele verborgen regel opsomt voordat hij begint met koken.
  • Resultaat: Het succes sprong naar 64,7%. Dit bewijst dat als de AI de regels kent, hij ze veel beter kan volgen.

De Belangrijkste Les:
Het probleem is niet dat de AI dom is; het probleem is dat hij niet gedachten kan lezen. Wanneer je de regels verbergt, faalt de AI. Wanneer je de regels expliciet aan de AI vertelt, slaagt hij. Echter, zelfs met het spiekbriefje faalde hij nog steeds ongeveer 35% van de tijd, wat betekent dat zelfs wanneer de AI de regels weet, hij soms vergeet ze perfect op te volgen.

Waarom dit ertoe doet (De "Verzamelingenleer")

Het paper gebruikt een fancy wiskundig concept om dit eenvoudig uit te leggen:

  • Beschouw je instructie als een net.
  • Het net vangt veel mogelijke uitkomsten (executies) op.
  • Je wilt alleen dat de AI de "goede" uitkomsten vangt (de uitkomsten die je daadwerkelijk wilt).
  • Als je net te breed is (omdat je de regels niet hebt gespecificeerd), vangt het ook "slechte" uitkomsten op (zoals illegale overboekingen of verkeerde formaten).
  • Veiligheid betekent het verkleinen van het net totdat het alleen het goede vangt. Je kunt dat niet doen, tenzij je de AI expliciet vertelt wat hij moet uitsluiten.

Samenvatting van de "Foutmodi"

Het paper legt uit waarom de AI faalde:

  1. Ontbrekende Informatie: De AI kende de regels niet (het grootste probleem).
  2. Slechte Vragen: De AI stelde de verkeerde vragen om de regels te vinden.
  3. Uitvoerfouten: Zelfs toen de AI de regels kende, vergat hij soms ze correct op te schrijven.

De Kernconclusie

Als je wilt dat een AI een taak veilig en correct uitvoert, kun je hem niet alleen een vage opdracht geven en hopen dat hij het "begrijpt". Je moet de verborgen beperkingen (zoals woordenaantallen, formaten en veiligheidslimieten) expliciet vermelden. Generieke prompts en generieke gesprekken zijn niet genoeg; je moet specifiek de ontbrekende regels oproepen en bevestigen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →