← Nieuwste papers
💬 NLP

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models

Dit artikel introduceert Know2Guess, een contaminatie-bewuste multi-zone benchmark die is ontworpen om het vermogen van grote taalmodellen om onderscheid te maken tussen ondersteunde antwoorden en onthoudingen bij onbekenden rigoureus te evalueren, waarbij wordt onthuld dat hoewel huidige modellen enige capaciteit vertonen voor selectieve onthouding, ze nog steeds worstelen met kalibratie en het weigeren van onschuldige items.

Oorspronkelijke auteurs: Renwei Meng, Bowen Zhang, Jian Wang, Xican Wang, Haoyi Wu, Xuanyan Qiu, Shengan Yang

Gepubliceerd 2026-06-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Renwei Meng, Bowen Zhang, Jian Wang, Xican Wang, Haoyi Wu, Xuanyan Qiu, Shengan Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Overmoedige Gokkende" Student

Stel je voor dat je een toets maakt met een zeer slimme student die bijna elk boek in de bibliotheek heeft gelezen.

  • Het Goede: Wanneer ze het antwoord weten, zijn ze briljant.
  • Het Slechte: Wanneer ze het antwoord niet weten, zeggen ze niet: "Ik weet het niet." In plaats daarvan verzinnen ze een zelfverzekerd klinkend verhaal dat waar lijkt te zijn, maar volledig verzonnen is.

In de wereld van Kunstmatige Intelligentie (AI) wordt dit hallucinatie genoemd. Huidige tests voor AI controleren meestal alleen: "Heeft de AI het juiste antwoord gegeven?" Als de AI zelfverzekerd gokt en het fout heeft, merkt de test dit vaak niet goed op. Het behandelt een zelfverzekerde leugen hetzelfde als een gelukkige gok.

De Oplossing: Een Nieuwe Test met "Stoplichten"

De auteurs hebben een nieuwe benchmark ontwikkeld genaamd Know2Guess. Zie dit niet alleen als een test, maar als een verkeerslichtsysteem voor AI.

In plaats van alleen te vragen: "Wat is het antwoord?", dwingt deze test de AI om te kiezen tussen twee opties:

  1. Rijden (Antwoorden): "Ik weet dit, en dit is het feit."
  2. Stoppen (Onthouden): "Ik weet dit niet, dus ik blijf stil."

Het doel is niet om te zien hoeveel vragen de AI kan beantwoorden. Het doel is om te zien of de AI weet wanneer hij moet stoppen.

Hoe de Test is Opgebouwd: De Vier "Zones"

Om de test eerlijk en lastig te maken, hebben de auteurs 1.200 vragen verdeeld in vier verschillende "zones" (zoals verschillende niveaus in een videogame):

  • Zone A (Het Makkelijke Spul): Beroemde feiten die iedereen kent (bijv. "Wie was de eerste Amerikaanse president?"). De AI zou deze moeten beantwoorden.
  • Zone B (Het Obscure Spul): Feiten die waar zijn, maar minder bekend (bijv. "Wat is de hoofdstad van een klein land?"). De AI zou deze ook nog steeds moeten beantwoorden.
  • Zone C (Het Lastige Spul): Dit zijn echte feiten, maar de vraag is op een verwarrende manier geformuleerd. De AI moet slim genoeg zijn om dit uit te zoeken zonder op te geven.
  • Zone D (De Valstrik): Dit zijn vragen die echt lijken, maar eigenlijk nep zijn. Het zijn verzonnen feiten over mensen of gebeurtenissen die nooit hebben bestaan. De AI moet hier zeggen: "Ik weet het niet." Als de AI probeert te antwoorden, is hij in de val gelopen.

De Twist: De test bevat ook een "Contaminatie-meter". Dit is also al controleren of de AI de testvragen al eerder heeft gezien in zijn trainingsdata. Als de AI het antwoord heeft uit het hoofd geleerd, is hij aan het spieken. De test houdt dit bij zodat we weten of de AI echt iets weet of dat hij het gewoon onthoudt.

De Regels van het Spel

De onderzoekers hebben strikte regels opgesteld om ervoor te zorgen dat de AI eerlijk speelt:

  • Geen "Ik weet het niet" als vluchtroute: De AI kan niet simpelweg weigeren om alles te beantwoorden om veilig te lijken. Hij moet de echte vragen beantwoorden en alleen stoppen bij de nepvragen.
  • Strenge Beoordeling: Een computerprogramma controleert de antwoorden. Als de AI bij een echte vraag zegt "Ik weet het niet", krijgt hij een strafpunt. Als hij gokt bij een nepvraag, krijgt hij ook een strafpunt.

Wat Ze Vonden: De Resultaten

De onderzoekers hebben verschillende populaire AI-modellen (zoals Qwen, Llama en FLAN) getest met deze nieuwe test. Dit is wat er gebeurde:

  1. De "Oude" Modellen (FLAN): Deze modellen waren slecht in stoppen. Wanneer ze het antwoord niet wisten, gokten ze gewoon zelfverzekerd. Ze faalden volledig op het "Stoppen"-gedeelte van de test.
  2. De "Nieuwere" Modellen (Qwen en Llama): Deze modellen zijn slimmer. Ze werden veel beter in het zeggen van "Ik weet het niet" bij de nepvragen (Zone D).
    • De Winnaar: Het Qwen2.5-3B model presteerde het beste overall. Het was goed in het beantwoorden van echte vragen en erg goed in het stoppen bij nepvragen.
  3. De Addertjes onder het Gras (Het is nog niet opgelost): Zelfs het beste model heeft nog steeds problemen:
    • Zelfvertrouwen-problemen: Zelfs wanneer ze het juiste antwoord hebben, zijn ze niet altijd zeker van hun zaak (ze zijn slecht "gekalibreerd").
    • Het "Weigerings"-probleem: Soms weigert de AI een echte vraag te beantwoorden, simpelweg omdat de vraag gevoelig of moeilijk klinkt, en niet omdat hij het antwoord niet weet. Dit is als een student die een wiskundevraag weigert te beantwoorden omdat de leraar eng kijkt.
    • Het "Moeilijke" Spul: De modellen hebben nog steeds moeite met de "Lastige" vragen (Zone C). Ze geven vaak te snel op bij echte feiten.

De Belangrijkste Conclusie

De conclusie van het artikel is dat AI het probleem van "weten wanneer je moet stoppen" nog niet heeft opgelost.

Hoewel nieuwere modellen beter worden in het herkennen van nepvragen, zijn ze nog steeds te zelfverzekerd wanneer ze het fout hebben, en geven ze soms soms te snel op bij echte vragen die ze eigenlijk wel zouden kunnen beantwoorden.

De auteurs zeggen dat deze nieuwe test belangrijk is omdat het drie verschillende dingen scheidt die we meestal door elkaar halen:

  1. Kennis: Het weten van het antwoord.
  2. Eerlijkheid: Weten wanneer je het niet weet en dan stil blijven.
  3. Weigering: Praten weigeren vanwege veiligheidsregels (wat iets anders is dan het niet weten).

Door deze zaken gescheiden te houden, helpt de test ons precies te zien waar de AI faalt, in plaats van alleen een enkel "geslaagd/gezakt" cijfer te geven. Het is een hulpmiddel om ontwikkelaars te helpen AI te bouwen die niet alleen slim is, maar ook bescheiden en betrouwbaar.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →