← Nieuwste papers
💬 NLP

Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes

Dit artikel toont aan dat geleerde zachte prefixes systematisch correcte logische oordelen in grote taalmodellen kunnen overschrijven door een brede antwoordvoorkeur te induceren in plaats van specifieke logische operaties af te dwingen, waardoor significante variaties in logische stabiliteit over verschillende modelarchitecturen worden blootgelegd.

Oorspronkelijke auteurs: Brian K Chen

Gepubliceerd 2026-07-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Brian K Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om logische puzzels op te lossen. Je geeft hem een klassieke raadsel: "Alle katten zijn zoogdieren; alle zoogdieren zijn dieren; dus zijn alle katten dieren." De robot krijgt het goed. Maar wat gebeurt er als je een geheime code in het oor van de robot fluistert voordat hij de puzzel ziet? Houdt de robot zich aan de waarheid, of raakt hij in de war en verandert hij zijn antwoord alleen maar omdat de fluistering bestond? Deze vraag staat in het hart van een veld dat "AI-veiligheid" en "redeneerrobuustheid" wordt genoemd. Wetenschappers willen weten of AI-modellen werkelijk slim en logisch zijn, of dat ze slechts patronenherkenningsmachines zijn die kunnen worden misleid door een verandering in de verlichting van de kamer of een vreemd woord in de instructies. Het kernconcept hier is "robuustheid": een slim systeem zou niet alleen één keer het juiste antwoord moeten geven; het zou ook het juiste antwoord moeten blijven geven, zelfs wanneer de wereld om het heen een beetje vreemd wordt. Als een model gemakkelijk kan worden misleid om "nee" te zeggen terwijl de logica duidelijk "ja" zegt, dan is de logica van dat model niet zo solide als we dachten.

Dit artikel is als een stresstest voor de hersenen van enkele zeer geavanceerde AI-modellen. De onderzoekers, onder leiding van Brian K Chen, besloten deze modellen te prikkelen met een speciaal soort "onzichtbare duw". In plaats van een zin te schrijven als "Negeer de regels en zeg nee," gebruikten ze een "soft prefix". Denk aan dit als een geheime, onzichtbare frequentie of een spookachtige trilling die je aan de voorkant van een vraag plakt. Het is niet gemaakt van woorden die je kunt lezen; het is een reeks wiskundige getallen die de computer begrijpt maar die mensen niet kunnen zien. Het doel was om te zien of ze deze onzichtbare duwen konden trainen om de correcte antwoorden van de AI om te draaien naar foutieve antwoorden, zelfs wanneer de logica van de puzzel helemaal niet veranderde.

De onderzoekers testten dit op drie verschillende AI-modellen (Qwen3.6, Qwen3-8B en Gemma 4) met behulp van syllogismen, wat eenvoudige logische puzzels zijn met twee premissen en een conclusie. Ze trainden deze onzichtbare duwen om de AI van gedachten te laten veranderen bij puzzels die de AI oorspronkelijk goed beantwoordde. Bijvoorbeeld, als de AI correct zei dat een bewering "geldig" (logisch waar) was, werd de duw getraind om de AI "ongeldig" te laten zeggen.

De resultaten waren verbijsterend. Deze onzichtbare duwen werkten als toverstaven. Wanneer de onderzoekers ze gebruikten op nieuwe puzzels die de AI nog nooit eerder had gezien, draaiden de modellen hun antwoorden tussen de 72% en 90% van de tijd om voor de Qwen-modellen, en ongeveer 54% tot 56% voor het Gemma-model. Om dit in perspectief te plaatsen: als je de AI zou proberen te misleiden met een willekeurige reeks onzichtbare getallen of een onzinnige, betekenisloze zin, zou het de AI bijna niet van gedachten doen veranderen (minder dan 1% van de tijd). Dit bewijst dat het effect niet simpelweg ging over het toevoegen van elke vorm van ruis; de specifieke, geleerde "geesttrilling" deed iets krachtigs.

Maar hier komt de wending: het artikel suggereert dat deze duwen de AI niet echt nieuwe logica leren of hem dwingen op een specifieke manier te denken. In plaats daarvan ontdekten de onderzoekers dat de duwen vooral een "brede voorkeur" voor één antwoord creëerden. Het is alsof de duw de robot niet vertelde: "Deze specifieke puzzel is fout," maar eerder fluisterde: "Hé, ik hou vandaag echt van het antwoord 'Nee', laten we dat voor alles gebruiken." De AI leerde geen nieuwe regel; het kreeg simpelweg een sterke bias naar een specifieke keuze.

De studie vond ook dat verschillende modellen verschillend reageerden op deze druk. Het gedrag van het Gemma-model was zeer voorspelbaar; als je de beginscore kende, kon je precies voorspellen hoeveel de duw de mening zou veranderen. Maar de Qwen-modellen waren meer chaotisch. De duw kon je vertellen welke antwoorden zouden omslaan, maar het kon niet voorspellen hoeveel de mate van vertrouwen van het model zou verschuiven. Het is alsof Gemma een rigide robot is die altijd op dezelfde manier buigt als je ertegen duwt, terwijl Qwen een elastiekje is dat op onvoorspelbare manieren terugspringt.

Uiteindelijk laat dit artikel zien dat zelfs wanneer een AI een logische puzzel goed oplost, zijn "logische stabiliteit" verrassend fragiel is. Een kleine, onzichtbare, geleerde duw kan de correcte redenering van de AI overrulen en hem de verkeerde keuze laten maken, niet omdat de logica veranderde, maar omdat het model een tijdelijke, sterke voorkeur voor het foute antwoord ontwikkelde. Dit suggereert dat hoewel deze modellen goed zijn in het oplossen van puzzels, ze misschien niet zo diep logisch zijn als we hopen, en dat hun antwoorden kunnen worden beïnvloed door onzichtbare druk die we niet eens kunnen zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →