← Nieuwste papers
💻 computer science

When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences

Dit artikel introduceert een op symmetrie gebaseerd experimenteel kader om systematisch te meten hoe grote taalmodellen conflicten tussen concurrerende specificaties oplossen, waarbij een consistente voorkeurshiërarchie wordt onthuld waarbij formele en genaturaliseerde formele talen de voorkeur krijgen boven pure natuurlijke taal en input-outputvoorbeelden over diverse domeinen heen.

Oorspronkelijke auteurs: Tairan Wang, Liang Zhou, Zikang Zhan, Pingchuan Yan

Gepubliceerd 2026-07-31
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tairan Wang, Liang Zhou, Zikang Zhan, Pingchuan Yan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer intelligente, zeer goed onderlegde vriend om hulp vraagt bij een lastige puzzel. Maar hier is de crux: je vriend heeft twee verschillende instructiehandleidingen gekregen voor dezelfde puzzel. De ene zegt: "Draai de rode knop naar links," terwijl de andere volhardt: "Draai de rode knop naar rechts." In de wereld van Kunstmatige Intelligentie zijn deze "vrienden" Large Language Models (LLM's)—gigantische computerprogramma's die getraind zijn op bijna alle tekst op het internet. Ze zijn geweldig in het schrijven van verhalen, het oplossen van wiskundige problemen en zelfs het programmeren, maar ze raken vaak in de war wanneer de informatie die ze ontvangen rommelig of tegenstrijdig is.

Dit artikel duikt in een specifiek hoekje van de AI-wetenschap: Conflictresolutie. Het stelt een eenvoudige maar diepgaande vraag: Wanneer een AI twee tegenstrijdige instructies krijgt, naar welke luistert hij dan echt? Geeft hij de voorkeur aan een strikte, wiskundige formule? Een informele zin in gewone mensentaal? Een lijst met voorbeelden? Of een formele code-snippet? Het begrijpen hiervan is cruciaal omdat we, naarmate we AI gaan gebruiken voor belangrijke taken—zoals het schrijven van computercode, het diagnosticeren van medische problemen of het nemen van juridische beslissingen—moeten weten of de AI de "harde regels" volgt of gewoon gokt op basis van hoe de woorden klinken. Als we niet weten welke instructie de AI prioriteit geeft, kunnen we de antwoorden ervan niet vertrouwen.

De Grote Instructie-showdown

De onderzoekers van University College London besloten dit probleem aan te pakken als een wetenschappelijk experiment. In plaats van de AI willekeurige vragen te stellen, bouwden ze een gecontroleerde arena waarin ze de AI konden dwingen te kiezen tussen twee specifieke, tegenstrijdige regels. Ze noemden dit een "symmetrie-gebaseerd framework", wat een chique manier is om te zeggen dat ze het spel zo perfect hadden opgezet dat alleen de manier waarop de regels werden geschreven veranderde, en niet de regels zelf.

Hiervoor creëerden ze een enorme "Wiskundige Battle Arena" met 550 verschillende conflictsituaties. In elk scenario moest de AI een wiskundig probleem oplossen (zoals het berekenen van een reeks of het vinden van een pad op een graaf), maar kreeg de AI twee verschillende manieren om de oplossing te beschrijven. Ze testten vier verschillende "talen" van instructie:

  1. Pure Natuurlijke Taal: Gewoon gewone Engelse zinnen (bijv. "Tel de getallen bij elkaar op.").
  2. Formele Taal: Strikte wiskundige symbolen en vergelijkingen (bijv. f(x)=x+1f(x) = x + 1).
  3. Genaturaliseerde Formele Taal: Een mix, waarbij wiskundige symbolen worden gebruikt binnen Engelse zinnen (bijv. "De functie is gedefinieerd als f(x)=x+1f(x) = x + 1.").
  4. Input-Output Voorbeelden: Een lijst met voorbeelden die inputs en hun resultaten laten zien (bijv. "Als er 2 ingaat, komt er 3 uit. Als er 5 ingaat, komt er 6 uit.").

De AI moest één van deze beschrijvingen kiezen om een specifieke testvraag op te lossen. De onderzoekers keken vervolgens naar welke beschrijving de AI genoeg "vertrouwde" om te volgen.

De Resultaten: De Hiërarchie van Vertrouwen

De bevindingen waren verrassend consistent. De AI koos niet willekeurig; hij had een heel duidelijke favoriet. Het blijkt dat AI-modellen houden van structuur en haten ambiguïteit.

De onderzoekers ontdekten een strikte "voedselketen" van vertrouwen:

  1. Top Tier: Formele en Genaturaliseerde Formele talen waren de duidelijke winnaars. De AI volgde deze regels ongeveer 87% tot 93% van de tijd wanneer ze werden afgezet tegen gewone Engelse taal of voorbeelden. Het lijkt erop dat wanneer de AI een zuivere wiskundige formule ziet, deze als de "wet" behandelt.
  2. Midden Tier: Pure Natuurlijke Taal kwam als tweede uit de bus. Het was betrouwbaarder dan voorbeelden, maar minder betrouwbaar dan wiskunde. De AI volgde deze instructies ongeveer 78% van de tijd wanneer ze concurreerden met voorbeelden.
  3. Onderste Tier: Input-Output Voorbeelden werden het minst vertrouwd. Wanneer de AI moest kiezen tussen een lijst met voorbeelden en een duidelijke regel, negeerde hij de voorbeelden bijna altijd.

Denk er zo over na: Als je een robot vertelt: "Hier is een lijst met tijden waarop ik heb geluncht: 12:00, 12:15, 12:30," dan kan hij raden dat je om 12:45 luncht. Maar als je hem vertelt: "Ik lunch elke dag om 12:00 uur," dan zal hij zich aan 12:00 uur houden. De AI geeft de voorkeur aan de expliciete regel boven het patroon dat hij moet raden.

Het is Niet Alleen Wiskunde: De Tests in de Praktijk

Het team stopte niet bij wiskunde. Ze wilden zien of deze "hiërarchie van vertrouwen" standhield in meer chaotische, realistische situaties. Ze testten de AI in drie andere gebieden:

  • Booleaanse Algebra (Logische Poorten): Ze zetten een compacte wiskundige formule af tegen een gigantische "Waarheidstabel" (een enorme lijst van elke mogelijke uitkomst). Ondanks het feit dat de Waarheidstabel uitputtend was en onmogelijk fout kon zijn, gaf de AI nog steeds de voorkeur aan de compacte formule in 88% van de gevallen. Het lijkt erop dat de AI de voorkeur geeft aan "slimme" shortcuts boven "brute force" lijsten.
  • Code Generatie: Ze gaven de AI een conflict tussen een geschreven beschrijving van wat een computerprogramma moet doen en een reeks geautomatiseerde tests (code die controleert of het programma werkt). Hier hing het resultaat af van de "hersencapaciteit" van de AI. Kleinere, minder capabele modellen hadden de neiging om de geschreven beschrijving te volgen, terwijl de krachtigste modellen sterk de voorkeur gaven aan de geautomatiseerde tests, waarbij ze deze tot wel 97% van de tijd volgden. Dit suggereert dat naarmate AI slimmer wordt, het leert om het "harde bewijs" van codetests boven menselijke beschrijvingen te verkiezen.
  • Klinische Regels (Medisch Advies): Ze testten de AI met echte medische regels over medicijndoseringen. Interessant genoeg gaf de AI niet zoveel om het formaat (Engels versus voorbeelden) als wel om de inhoud. In dit domein koos de AI consequent voor de striktere regel (de regel die zei "doe dit niet") boven de meer permissieve regel, ongeacht hoe de regel werd opgeschreven. Dit suggereert dat de AI in sectoren met hoge belangen een ingebouwde bias heeft naar veiligheid.

Wat Dit Voor Ons Betekent

Het paper concludeert dat AI niet zomaar een willekeurige gokker is; het heeft een systematische manier om te beslissen welke instructies het moet volgen. Het geeft over het algemeen de voorkeur aan expliciete, gestructureerde regels (zoals wiskundige formules) boven geïmpliceerde patronen (zoals voorbeelden).

De onderzoekers ontdekten echter ook dat dit geen perfecte, onveranderlijke wet is. De voorkeur van de AI kan verschuiven afhankelijk van hoe slim het model is en wat voor soort taak het uitvoert. Bijvoorbeeld, in de medische tests negeerde de AI het formaat volledig en keek het simpelweg naar het "veiligere" antwoord.

Deze studie geeft ons een nieuw instrument om te meten hoe AI denkt. Door te begrijpen dat AI een "favoriet" type instructie heeft, kunnen we betere systemen ontwerpen. Als we willen dat een AI een specifieke regel volgt, moeten we die waarschijnlijk als een duidelijke, formele verklaring opschrijven in plaats van te hopen dat hij het uit een lijst met voorbeelden afleidt. Het is een herinnering aan het feit dat, hoewel AI slimmer wordt, het nog steeds van ons nodig heeft om zijn taal duidelijk te spreken—vooral wanneer de instructies in conflict zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →