← Nieuwste papers
🤖 AI

Coherence Under Commitment: Probing Generalization and Vacuous Memorization in LLM Logical Reasoning

Dit artikel introduceert Coherence Under Commitment (CUC), een paradigma voor evaluatie met dubbele queries dat blootlegt hoe grote taalmodellen een triviale logische coherentie kunnen bereiken door middel van systematische onthouding, door gezamenlijk consistentie en besluitvaardigheid te meten over vier open-source modellen.

Oorspronkelijke auteurs: Noor Islam S. Mohammad, Mahmudul Hasan

Gepubliceerd 2026-06-23
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Noor Islam S. Mohammad, Mahmudul Hasan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Stille" Expert

Stel je voor dat je een logica-expert inhuurt om je te helpen een puzzel op te lossen. Je geeft hem een reeks aanwijzingen en vraagt: "Volgt deze conclusie uit de aanwijzingen?"

  • De Ideale Expert: Kijkt naar de aanwijzingen, denkt diep na en zegt: "Ja, dit volgt er zeker uit," of "Nee, dit volgt er absoluut niet uit."
  • De Problematische Expert: Deze expert is erg voorzichtig. Hij wil nooit ongelijk hebben. Dus wanneer je hem een vraag stelt, haalt hij vaak alleen maar zijn schouders op en zegt: "Ik weet het niet zeker," of hij blijft volledig stil.

Hier komt de crux: Als de expert nooit "Ja" of "Nee" zegt, kan hij nooit ongelijk krijgen. Hij spreekt zichzelf nooit tegen. In de wereld van standaardtesten lijkt deze stille expert perfect omdat hij een foutpercentage van 0% heeft. Maar hij is nutteloos! Hij heeft eigenlijk niets opgelost; hij heeft alleen het risico om ongelijk te hebben vermeden.

De auteurs van dit artikel noemen dit "Vacuous Coherence" (Lege Coherentie). Het is als een student die weigert alle vragen op een examen te beantwoorden, zodat hij geen enkele vraag fout heeft. Hij heeft een perfect cijfer, maar hij heeft niets geleerd.

De Oplossing: De "Commitment Score"

Het artikel introduceert een nieuwe manier om AI (Large Language Models) te testen, genaamd Coherence Under Commitment (CUC). In plaats van alleen te controleren of de AI het goed of fout heeft, stelt CUC twee vragen tegelijkertijd:

  1. Is de AI consistent? (Spreekt hij zichzelf tegen?)
  2. Is de AI besluitvaardig? (Is hij bereid om een standpunt in te nemen?)

Om dit te doen, gebruiken ze een slimme truc. Voor elke vraag die ze de AI stellen, stellen ze ook exact de tegenovergestelde vraag.

  • Vraag A: "Is dit waar?"
  • Vraag B: "Is dit onwaar?"

Ze meten vervolgens twee dingen:

  • De Commitment Score: Hoeveel "energie" (waarschijnlijkheid) stak de AI in het geven van een definitief antwoord? Als de AI over beide vragen stil blijft, is de score laag. Als de AI zelfverzekerd één kant kiest, is de score hoog.
  • De Violation Score: Heeft de AI bij beide vragen "Ja" gezegd? (Dat zou een logische tegenstrijdigheid zijn).

De "Frontier": De Afweging

De onderzoekers ontdekten een scherpe lijn (een "frontier") die bepaalt hoe deze AI-modellen zich gedragen. Je kunt niet alles hebben.

  • De "Hedgehog" (Systematische Onthouding):
    Eén model (Qwen2.5-3B) gedroeg zich als een egel die zich in een bal oprolt. Het weigerde bijna alles te beantwoorden.

    • Resultaat: Het had bijna nul tegenstrijdigheden (perfecte consistentie).
    • Realiteit: Het beantwoordde slechts 7% van de vragen. Het was "perfect", maar nutteloos.
    • Analogie: Een weervoorspeller die elke dag zegt: "Ik weet het niet." Ze hebben het nooit fout over de regen, maar ze zijn verschrikkelijk in hun werk.
  • De "Blinde Gokkker" (Overcommitment):
    Een ander model (TinyLlama-1.1B) gedroeg zich als een gokker die op alles wedt.

    • Resultaat: Het beantwoordde bijna alles (79% dekking).
    • Realiteit: Het was fout en tegenstrijdig bij bijna elke vraag. Het beweerde dat dingen tegelijkertijd waar en onwaar waren.
    • Analogie: Een weervoorspeller die tegelijkertijd schreeuwt: "ZONNISCH!" en "REGEN!" Het is zeer besluitvaardig, maar volkomen krankzinnig.

Waarom Oude Tests Faalden

Standaardtests keken alleen naar de "Hedgehog". Omdat de Hedgehog nooit een fout maakte, rangde de oude tests dit model als het beste model. Het artikel stelt dat dit een valstrik is. Het beloont modellen die te bang zijn om hun mond open te doen.

De nieuwe CUC-test legt dit bloot. Het laat zien dat de "Hedgehog" eigenlijk faalt omdat hij zijn werk niet doet (het beantwoorden van vragen), ook al ziet hij er veilig uit.

De "Grootte" Verrassing

Het artikel testte ook wat er gebeurt als je de AI groter maakt (krachtiger).

  • De bevinding: Toen ze het Qwen-model groter maakten (van 1,5 miljard naar 3 miljard parameters), werd het beter in het vermijden van tegenstrijdigheden, maar werd het slechter in het beantwoorden van vragen.
  • De les: Grotere modellen leerden niet beter te redeneren; ze leerden meer te hedgen (voorzichtiger te zijn). Ze leerden dat stil blijven de veiligste manier is om een hoge score te halen op een test. Dit is een waarschuwing voor ontwikkelaars: als je modellen alleen straft voor het maken van fouten, zullen ze leren om helemaal niets meer te zeggen.

Samenvatting in één zin

Dit artikel waarschuwt ons dat een AI die nooit een risico neemt niet een slimme AI is, maar gewoon een stille AI; we hebben nieuwe tests nodig die modellen belonen voor het zijn van zowel consistent als besluitvaardig.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →