← Nieuwste papers
💻 computer science

The Counterexample Game: Iterated Conceptual Analysis and Repair in Language Models

Dit artikel onderzoekt of taalmodellen filosofische conceptuele analyse kunnen volhouden door geïtereerde cycli van tegenvoorbeelden en herstel, en komt tot de bevinding dat hoewel ze in dit proces kunnen deelnemen, de lus snel afnemende meeropbrengsten oplevert, gekenmerkt door toenemende woordkracht zonder verbeterde nauwkeurigheid en een neiging van de modellen om ongeldige tegenvoorbeelden vaker te accepteren dan menselijke beoordelaars.

Oorspronkelijke auteurs: Daniel Drucker, Kyle Mahowald

Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Daniel Drucker, Kyle Mahowald

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een groep filosofen voor die een hoog-risico spelletje "Gotcha" spelen.

Iemand stelt een eenvoudige definitie voor van een woord, zoals "Een spel is iets dat je voor plezier doet." De volgende persoon probeert die definitie te breken door een reële situatie te vinden waarin de definitie faalt (een tegenvoorbeeld). Bijvoorbeeld: "Wat te denken van een professionele pokerspeler die gestrest is en het spel haat, maar blijft spelen om geld te winnen? Dat is nog steeds een spel, maar het is niet 'voor plezier'."

De eerste persoon moet vervolgens hun definitie aanpassen om de pokerspeler mee te nemen, maar toch dingen uitsluiten die geen spel zijn. Ze proberen het opnieuw en de cyclus herhaalt zich. Dit heet Conceptuele Analyse, en dit is hoe filosofen gedurende duizenden jaren ideeën hebben verfijnd.

De onderzoekers in dit artikel stelden de vraag: Kunnen AI-taalmodellen dit spel spelen?

Ze zetten een digitale versie van dit spel op waarbij één AI optreedt als de "Aanbieder" (die definities maakt) en een andere als de "Kriticus" (die gaten in de definities vindt). Ze lieten hen dit spel steeds opnieuw spelen—soms 50 keer achter elkaar—om te zien of de AI slimmer wordt in het definiëren van dingen zoals "vriend", "leugen" of "sandwich".

Hier is wat ze vonden, vertaald naar alledaagse termen:

1. De AI-rechter is een beetje te gul

In het spel moet de "Kriticus" slechte definities opsporen. De onderzoekers lieten menselijke experts en een AI-rechter de tegenvoorbeelden van de AI beoordelen.

  • Het resultaat: De AI-rechter zei "Ja, dat is een geldig tegenvoorbeeld!" ongeveer twee keer zo vaak als de menselijke experts.
  • De metafoor: Stel je een strenge leraar (de mens) en een zeer enthousiaste leerling (de AI) voor die een toets nakijken. De leerling denkt dat elk fout antwoord een briljante valstrikvraag is, terwijl de leraar weet dat sommige gewoon fouten zijn. Ze waren het echter wel eens over de "grote treffers"—de echt voor de hand liggende gebreken. De AI is dus een beetje te mild voor zichzelf, maar hallucineert niet volledig.

2. De valkuil van "Langer is Beter"

De onderzoekers verwachtten dat naarmate de AI meer rondes speelde, de definities scherper en accurater zouden worden, net als een menselijke filosoof die een idee over jaren verfijnt.

  • Het resultaat: In plaats van beter te worden, werden de definities gewoon langer en woordrijker.
  • De metafoor: Stel je voor dat je een "hond" probeert te beschrijven voor een buitenaards wezen.
    • Ronde 1: "Een hond is een harig dier." (Te breed: omvat katten).
    • Ronde 2: "Een hond is een harig dier dat blaft." (Te breed: omvat sommige zeehonden).
    • Ronde 50: "Een hond is een harig dier dat blaft, vier poten heeft, geen zeehond is, geen kat is, meestal een staart heeft, van botten houdt, en geen robot is, tenzij het een specifiek type robot-hond is..."
      De AI bleef "uitzonderingen" en "regels" toevoegen om elk gat te dichten, maar het ontdekte nooit echt de kern waarheid van wat een hond is. De definitie werd een enorme, onhandige waslijst van regels in plaats van een heldere, eenvoudige inzage.

3. Sommige concepten zijn gewoon moeilijker te vatten

De onderzoekers testten 20 verschillende concepten. Ze ontdekten dat sommige woorden makkelijk voor de AI waren om te "breken" met tegenvoorbeelden, terwijl andere bijna onmogelijk waren.

  • Makkelijk te breken: Woorden zoals "buur" of "vriend". De AI kon makkelijk vreemde randgevallen vinden (bijv. "Is een buur iemand die je nooit hebt ontmoet maar naast je woont?").
  • Moeilijk te breken: Woorden zoals "fout" of "expert". Deze concepten leken het spel te weerstaan. De AI had moeite om geldige tegenvoorbeelden te vinden, wat suggereert dat deze ideeën inherent vager zijn of moeilijker te definiëren met strikte regels.

4. Het "Geheugen" hielp niet

De onderzoekers probeerden twee versies van het spel:

  1. Geheugenloos: De AI ziet alleen de huidige definitie.
  2. Met geschiedenis: De AI ziet de volledige geschiedenis van elke vorige definitie en elk tegenvoorbeeld.
  • Het resultaat: Het hebben van de geschiedenis maakte de AI niet beter. Het leerde niet van zijn eerdere fouten. Het bleef gewoon hetzelfde soort fouten maken, maar dan met meer woorden.

De conclusie

Het artikel concludeert dat hoewel AI het "Tegenvoorbeeldspel" kan spelen en de regels begrijpt, het zeer snel tegen een muur aanloopt. Het wordt niet slimmer door oefening; het wordt gewoon meer woordrijk.

De onderzoekers suggereren dat dit een uitstekende manier is om AI te testen. Als een AI geen hoogwaardig, iteratief filosofisch redeneren vol kan houden (beter worden na verloop van tijd), vertelt dat ons iets belangrijks over hoe deze modellen denken: ze zijn goed in het dichten van gaten op de korte termijn, maar ze worstelen met het opbouwen van een stabiel, diep begrip van complexe ideeën op de lange termijn.

Kortom: De AI kan het spel spelen, maar het is als een speler die steeds meer regels aan het reglement toevoegt zonder het spel ooit echt te begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →