← Nieuwste papers
💬 NLP

Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers

Dit artikel stelt vast dat bestaande methoden voor vertrouwenskalibratie falen voor grote taalmodellen wanneer vragen meerdere juiste antwoorden hebben vanwege systematische onderschatting, en stelt een nieuwe benchmark (MACE) en een Semantic Confidence Aggregation (SCA) methode voor om robuuste kalibratie te bereiken in zowel scenario's met één als meerdere antwoorden.

Oorspronkelijke auteurs: Yuhan Wang, Shiyu Ni, Zhikai Ding, Zihang Zhan, Yuanzi Li, Keping Bi

Gepubliceerd 2026-06-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yuhan Wang, Shiyu Ni, Zhikai Ding, Zihang Zhan, Yuanzi Li, Keping Bi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Wanneer "Gelijk Hebben" lijkt op "Verward Zijn"

Stel je voor dat je een quiz doet.

  • Scenario A: De vraag is: "Wie schreef Hamlet?" Er is slechts één juist antwoord: Shakespeare. Als je "Shakespeare" zegt, heb je gelijk en voel je je zeer zelfverzekerd.
  • Scenario B: De vraag is: "Noem een vrucht die rood is." Er zijn veel juiste antwoorden: Appel, Aardbei, Kersen, Framboos.

Het artikel stelt dat huidige Large Language Models (LLM's) in de war raken door Scenario B.

Wanneer een model weet dat er veel juiste antwoorden zijn (zoals Appel, Aardbei en Kers), heeft het de neiging om zijn "stemmen te splitsen". Het zegt misschien 6 keer "Appel", 6 keer "Aardbei" en 6 keer "Kers" in 20 pogingen. Omdat het niet bij elke poging precies één antwoord koos, daalt de interne "zelfvertrouwenmeter" van het model. Het denkt: "O nee, ik weet niet goed welk antwoord ik moet kiezen, dus ik moet wel onzeker zijn."

De Ironie: Het model is in werkelijkheid waarschijnlijker correct in Scenario B (omdat er meer manieren zijn om het goed te hebben), maar de zelfvertrouwenmeter geeft een lagere score aan. Het is als een persoon die drie verschillende routes naar de winkel kent, maar omdat hij niet in één specifieke route kan beslissen, overtuigt hij zichzelf ervan dat hij verdwaald is.

Het Nieuwe Instrument: MACE (De "Multi-Answer" Test)

Om te bewijzen dat dit probleem bestaat, hebben de onderzoekers een nieuwe test gebouwd genaamd MACE. Zie MACE als een gespecialiseerde sportschool om te testen hoe goed modellen omgaan met vragen met meerdere juiste antwoorden.

  • De Opzet: Ze creëerden 12.000 vragen over zes onderwerpen (zoals Awards, Politieke Ambten en Rivieren).
  • De Twist: Voor elk onderwerp maakten ze vragen met exact 1, 2, 4 of 6 juiste antwoorden.
  • Het Doel: Om te zien of de zelfvertrouwenscores van de modellen accuraat blijven wanneer het aantal juiste antwoorden verandert.

Wat Ze Vonden: De "Grote Brein" Paradox

Ze testten 15 verschillende manieren om zelfvertrouwen te meten op vier verschillende families van AI-modellen (variërend van klein tot enorm). Dit is wat er gebeurde:

  1. Nauwkeurigheid gaat omhoog, Zelfvertrouwen gaat omlaag: Naarmate het aantal juiste antwoorden toenam (van 1 naar 6), hadden de modellen de vragen vaker goed. Echter, hun geschatte zelfvertrouwen daalde aanzienlijk.
  2. Grotere Modellen Lijden Meer: De grootste, slimste modellen (zoals de 70-miljard parameter modellen) waren het meest in de war. Omdat ze zoveel weten, kunnen ze een grotere variëteit aan correcte antwoorden genereren. Deze variëteit zorgt ervoor dat ze "besluiteloos" lijken voor de zelfvertrouwen-checkers, waardoor hun zelfvertrouwenscores instorten.
  3. De "Vertrouwenscrisis": In een echte mix van vragen (sommigen met 1 antwoord, sommigen met 6), faalden de beste bestaande methoden. Ze zouden een correct antwoord als "onbetrouwbaar" markeren, simpelweg omdat het model een paar verschillende correcte variaties aanbood.

De Oplossing: SCA (De "Teamstemming" Methode)

De onderzoekers stelden een nieuwe methode voor genaamd Semantic Confidence Aggregation (SCA).

De Oude Manier (De "Top Dog" Benadering):
De meeste methoden kijken naar het enkele meest populaire antwoord dat het model gaf. Als het model 20 antwoorden gaf en 10 waren "Appel" en 10 waren "Aardbei", dan zegt de oude methode: "Je bent slechts in 50% van de gevallen het eens met jezelf. Je bent niet zelfverzekerd."

De Nieuwe Manier (SCA - De "Teamstemming"):
SCA kijkt naar de totale waarschijnlijkheid van alle juiste antwoorden gecombineerd.

  • Het groepeert de antwoorden op basis van betekenis (bijv. alle "Appel" antwoorden vormen één groep, alle "Aardbei" antwoorden een andere groep).
  • Het telt de zelfvertrouwenscores van alle juiste groepen bij elkaar op.
  • Het Resultaat: Zelfs als het model zijn stemmen splitste tussen Appel en Aardbei, ziet SCA dat de totale stem voor "Rode Vruchten" 100% is. Het realiseert zich: "Ah, het model is zelfverzekerd, het heeft gewoon een paar geldige opties."

De Belangrijkste Conclusie

  • Het Probleem: Huidige AI-zelfvertrouwen tools denken dat het hebben van meerdere juiste antwoorden betekent dat de AI onzeker is.
  • De Fix: De nieuwe SCA methode lost dit op door het zelfvertrouwen van alle geldige antwoorden bij elkaar op te tellen, in plaats van alleen naar het meest populaire antwoord te kijken.
  • Het Resultaat: SCA werkt uitstekend op vragen met veel antwoorden en gaat niet kapot bij vragen met slechts één antwoord. Het helpt de AI om zelfverzekerd te klinken wanneer het ook echt is, zelfs wanneer het op meer dan één manier gelijk heeft.

Kortom: het artikel leert ons dat voor AI, op veel verschillende manieren gelijk hebben, niet moet lijken op onzeker zijn. We hebben alleen een betere manier nodig om de stemmen te tellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →