← Nieuwste papers
📈 economics

Measuring Judgment Quality in Natural-Language Explanations: Evidence from Forecasting Tournaments

Dit artikel introduceert Explanation Quality Markers (EQMs), een schaalbare, op LLM gebaseerde methode voor het scoren van zestig redeneerpatronen in natuurlijke taalverklaringen die de voorspellende nauwkeurigheid effectief voorspelt en traditionele tekstanalysetechnieken overtreft.

Oorspronkelijke auteurs: Christopher W. Karvetski, Sheldon S. Huang, Simas Kučinskas, Nadja Flechner, Jingyu Hu, Philip Tetlock, Ezra Karger

Gepubliceerd 2026-07-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Christopher W. Karvetski, Sheldon S. Huang, Simas Kučinskas, Nadja Flechner, Jingyu Hu, Philip Tetlock, Ezra Karger

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een manager bent die de beste financiële adviseur probeert aan te nemen. Je hebt een stapel van 55.000 sollicitaties. Elke sollicitatie bevat een specifieke voorspelling (bijv. "Er is een kans van 20% dat het aandeel zal stijgen") en een geschreven paragraaf waarin wordt uitgelegd waarom zij denken dat.

Je probleem? Je kunt niet alle 55.000 paragrafen lezen om te zien wie er werkelijk goed is in het voorspellen van de toekomst. Je hebt een manier nodig om de tekst snel te scannen en te zeggen: "Deze uitleg ziet er slim uit," of "Deze is waarschijnlijk een gok."

Dit artikel introduceert een nieuwe tool genaamd Explanation Quality Markers (EQMs) om dit probleem op te lossen. Hier is hoe het werkt, met behulp van eenvoudige analogieën.

De Oude Manier: Woorden Tellen en Woordenboeken Controleren

Voordat dit onderzoek plaatsvond, probeerden onderzoekers deze uitleg te beoordelen met behulp van "pre-LLM"-tools. Denk aan deze als een spellingscontrole of een woordteller.

  • Ze telden hoeveel woorden er in de paragraaf stonden.
  • Ze zochten naar specifieke "slim klinkende" woorden (zoals "daarom" of "echter").
  • Ze controleerden of de tekst complex was.

Het Resultaat: Deze tools waren alsof je probeert de kookkunsten van een chef te beoordelen door te tellen hoeveel kruiden hij gebruikte. Het vertelde je niet echt of het eten lekker smaakte. Het onderzoek toonde aan dat deze oude methoden bijna geen enkele connectie hadden met de vraag of de persoon daadwerkelijk accuraat was.

De Nieuwe Manier: De "Superlezer" AI

De auteurs gebruikten een Large Language Model (een geavanceerde AI, zoals GPT-4o) om te fungeren als een Superlezer. In plaats van alleen woorden te tellen, werd deze AI getraind om te zoeken naar 60 specifieke "redeneringspatronen" die experts als goed of slecht herkennen.

Zie de AI als een detective die op zoek is naar aanwijzingen in het verhaal van een verdachte.

  • Goede Aanwijzingen (Groene Vlaggen): Kijkt de persoon naar historische gegevens? Geeft de persoon toe dat hij het mis zou kunnen hebben? Breekt de persoon een groot probleem af in kleine, beheersbare stukjes?
  • Slechte Aanwijzingen (Rode Vlaggen): Is de persoon gewoon aan het gokken? Is de persoon overmoedig ("Het zal definitief gebeuren!")? Negeert de persoon bewijs dat hun visie tegenspreekt?

De AI leest de uitleg en geeft een score op basis van hoeveel "Groene Vlaggen" en "Rode Vlaggen" deze vindt.

De Grote Ontdekking: De "Vuilnisdetector"

De onderzoekers testten deze AI tegen de werkelijke resultaten van de voorspellingen (ging het aandeel omhoog of omlaag?). Dit is wat ze ontdekten:

  1. De AI is een geweldige "Vuilnisdetector": De AI is ongelooflijk goed in het opsporen van slechte uitleg. Als een uitleg vol staat met "Rode Vlagen" (zoals gokken of overmoed), markeert de AI dit, en die persoon heeft bijna altijd ongelijk.
  2. De AI is een zwakke "Sterrenzoeker": De AI is minder goed in het opsporen van de absolute beste experts. Alleen omdat een uitleg er perfect uitziet, betekent niet dat de persoon een genie is.
    • Analogie: Stel je een metaaldetector voor op een strand. Die is geweldig in het vinden van roestige spijkers en gebroken glas (het slechte spul). Maar hij is niet zo goed in het onderscheiden tussen een glimmend stukje koper en een echt goudklompje (het allerbeste spul).

Hoe het Verhoudt tot Mensen

De onderzoekers vroegen ook aan echte mensen om deze uitleg te lezen en te beoordelen.

  • Mensen laten zich gemakkelijk foppen door lengte: Mensen gaven vaak hogere scores aan langere uitleg. Ze dachten: "Wauw, deze persoon heeft veel geschreven, dus moet hij wel slim zijn."
  • De Realiteit: De lengte van de tekst had bijna niets te maken met de vraag of de voorspelling correct was.
  • De AI versus Mensen: De AI was veel beter in het voorspellen van wie accuraat was dan de mensen dat waren. De mensen werden afgeleid door de "ophulp" (lengte en chique woorden), terwijl de AI zich concentreerde op de werkelijke logica.

Waarom Dit Belangrijk Is

Deze tool is nuttig omdat het geen trackrecord vereist.

  • Normaal gesproken moet je maanden of jaren wachten om te zien of een voorspeller goed is door naar hun eerdere resultaten te kijken.
  • Met EQMs kun je naar een enkele geschreven uitleg kijken en een goed idee krijgen of die persoon waarschijnlijk accuraat zal zijn of niet.

Samenvatting

  • Het Probleem: We hebben te veel deskundige verklaringen om te lezen, en we weten niet welke betrouwbaar zijn.
  • De Oplossing: Een AI die scant op 60 specifieke redeneergewoonten (zoals controleren op bias of het gebruik van data).
  • Het Resultaat: De AI is veel beter dan oude computermethoden en beter dan menselijke lezers in het opsporen van slecht redeneren. Het helpt besluitvormers om de "ruis" en de "gokkers" eruit te filteren, zelfs als het niet perfect de "genieën" kan identificeren.

Noot: Het onderzoek heeft dit strikt getest op geopolitieke en economische voorspellingswedstrijden. Het claimt niet dat deze methode al werkt voor medische diagnoses, juridische oordelen of andere velden; het bewijst alleen dat het werkt voor het voorspellen van toekomstige gebeurtenissen in deze specifieke wedstrijden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →