← Nieuwste papers
💬 NLP

HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam

Dit paper introduceert HLE-Verified, een systematisch gevalideerde en herziene versie van de Humanity's Last Exam-benchmark die door een tweestapsproces van expertreview en herstel de nauwkeurigheid van model-evaluaties aanzienlijk verbetert door ruis in de oorspronkelijke vragen en antwoorden te elimineren.

Oorspronkelijke auteurs: Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li, Qiyuan Feng, Yuhao Zhou, Shoulin Han, Wenjie Luo, Yiyuan Li, Yaxuan Wang, Ruixi
Gepubliceerd 2026-03-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li, Qiyuan Feng, Yuhao Zhou, Shoulin Han, Wenjie Luo, Yiyuan Li, Yaxuan Wang, Ruixian Luo, Guojie Lin, Peiyao Xiao, Chengliang Xu, Ben Wang, Zeyu Wang, Zichao Chen, Jianan Ye, Yijie Hu, Jialong Chen, Zongwen Shen, Yuliang Xu, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Hu Wei, Que Shen, Bing Zhao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, supermoeilijke examenbundel hebt voor de slimste computers ter wereld. Deze bundel heet HLE (Humanity's Last Exam). Het is bedoeld om te testen hoe goed deze computers kunnen redeneren in vakken als wiskunde, natuurkunde en biologie.

Het probleem? De bundel was een beetje rommelig.

Het Probleem: Een examen met fouten in de antwoorden

Stel je voor dat je een wiskundetoets maakt, maar je hebt per ongeluk een fout in de vraag zelf staan, of het antwoord in het antwoordboekje is verkeerd. Als een leerling dan het juiste antwoord geeft, krijg je een nul. Of als de vraag zo vaag is dat er twee goede antwoorden mogelijk zijn, wordt het een gok.

Dit is precies wat er met de HLE-bundel gebeurde. De makers merkten dat veel vragen onduidelijk waren, de antwoorden soms fout waren, of de uitleg erachter niet klopte. Hierdoor was het niet eerlijk om te zeggen welke computer het slimst was. Het was alsof je een marathonwedstrijd organiseert, maar sommige lopers moeten over een muur springen die er niet had moeten staan, terwijl anderen een kortere route krijgen.

De Oplossing: HLE-Verified (De "Gereviseerde Examenbundel")

De auteurs van dit paper hebben een team samengesteld om deze bundel grondig te inspecteren en te repareren. Ze noemen hun nieuwe versie HLE-Verified.

Ze hebben dit gedaan in twee stappen, alsof ze een oude, beschadigde schatkaart opnieuw tekenen:

  1. Stap 1: De "Goedkeuring"
    Ze keken naar elke vraag. Was de vraag duidelijk? Was het antwoord correct?

    • Als alles perfect was: Gouden label. Deze vragen blijven precies zoals ze waren.
    • Als er iets mis was, maar het was te repareren: Naar Stap 2.
    • Als het te ingewikkeld was om zeker te weten wat er aan de hand was: Onzekere map. Deze vragen worden apart gezet zodat mensen in de toekomst nog verder kunnen kijken.
  2. Stap 2: De "Reparatie"
    Voor de vragen die te repareren waren, hebben experts (mensen die echt verstand hebben van het vak) de fouten eruit gehaald. Ze hebben de vraag scherp gemaakt, het juiste antwoord gezet en de uitleg logisch gemaakt. Ze hebben er echter voor gezorgd dat ze niet de vraag veranderden die ze wilden testen. Ze hebben alleen de "ruis" weggehaald.

Wat vonden ze? (De Resultaten)

Toen ze de slimste computers van vandaag (zoals GPT-5, Claude, en Qwen) opnieuw op deze gereviseerde bundel lieten testen, gebeurde er iets verrassends:

  • De scores gingen omhoog: De computers scoorden gemiddeld 7 tot 10 punten beter.
  • De grote winnaars: Op de vragen die oorspronkelijk fout waren, steeg de score met maar liefst 30 tot 40 punten!

Dit betekent dat de computers eigenlijk veel slimmer waren dan we dachten. Ze werden niet "dommer" door de vragen, maar ze werden "gestoord" door de fouten in de examens.

Een Leuke Vergelijking: De Gebrekkige Navigatie

Stel je voor dat je een GPS-app gebruikt om een route te rijden.

  • De oude HLE was als een GPS die soms verkeerde afritten aangaf of stopte bij een brug die er niet meer was. De auto (de computer) probeerde het beste te doen, maar kreeg een boete omdat hij niet op de juiste plek aankwam.
  • HLE-Verified is de GPS die is opgepoetst. De verkeerde afritten zijn gecorrigeerd. Nu zie je pas echt hoe goed de auto kan rijden. Als de auto nu sneller en netter rijdt, is dat omdat de weg beter is, niet omdat de auto ineens een motor heeft gekregen.

Waarom is dit belangrijk?

Vroeger dachten we dat als een computer een lage score haalde, hij misschien niet slim genoeg was. Nu weten we: "Oh, wacht even, misschien was de vraag gewoon slecht gemaakt."

Met HLE-Verified hebben de onderzoekers een eerlijker meetlat gemaakt. Ze hebben laten zien dat als je de "ruis" uit een test haalt, je pas echt kunt zien wat een computer écht kan. Het is een belangrijke stap om te voorkomen dat we slimme technologie onderschatten door slechte testmateriaal.

Kortom: Ze hebben een rommelig examen opgepoetst, de fouten eruit gehaald, en bewezen dat de computers veel slimmer zijn dan de oude, gebrekkige test liet zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →