← Nieuwste papers
💻 computer science

MMLongBench-Doc-V2: A Corrected-Annotation, Semantics-Aware Revision of MMLongBench-Doc

MMLongBench-Doc-V2 is een gecorrigeerde en semantisch bewuste revisie van de MMLongBench-Doc benchmark die 106 ground-truth annotaties herstelt, string-matching metrieken vervangt door een LLM-gebaseerde rechter en ongeldige samples verwijdert om een betrouwbaarder evaluatiekader te bieden voor long-document QA.

Oorspronkelijke auteurs: Mingtian Zhang

Gepubliceerd 2026-08-05
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mingtian Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een rechter bent in een enorme, prestigieuze talentenjacht waar de deelnemers superintelligente computerprogramma's zijn, genaamd "AI". Deze AI's proberen te bewijzen dat ze dikke, saaie en ingewikkelde documenten kunnen lezen — zoals financiële rapporten, wetenschappelijke artikelen en instructiehandleidingen — en vragen erover kunnen beantwoorden. Dit is de wereld van Document QA (Question Answering). In deze arena is het doel simpel: de AI leest een lange PDF, en jij stelt een vraag. Als de AI het antwoord goed heeft, krijgt hij punten. Als hij het fout heeft, of als hij een antwoord verzint terwijl de informatie niet in het document staat, verliest hij punten.

Waarom geven we dit aandacht? Omdat naarmate deze AI's slimmer worden, ze beginnen te handelen als overmoedige studenten die een antwoord raden, alleen maar om druk te lijken. We hebben een manier nodig om te testen of ze daadwerkelijk aan het lezen zijn of gewoon aan het hallucineren (dingen verzinnen). Om dit te doen, hebben wetenschappers een enorme test gemaakt genaamd MMLongBench-Doc. Het is als een eindexamen met meer dan 1.000 vragen verspreid over 135 verschillende documenten. Maar, zoals dit nieuwe paper onthult, had het examen zelf enkele serieuze gebreken die de cijfers oneerlijk maakten.


Het Gebrekkige Examen: Wanneer de Beoordelaar het Probleem is

Beschouw het originele examen (MMLongBench-Doc) als een strenge, ouderwetse leraar die corrigeert met een rode pen die alleen zoekt naar exacte spellingsovereenkomsten. Als het juiste antwoord "1.358.000" is en de AI schrijft "1358000" (zonder de komma's), markeert de leraar het als fout. Als het antwoord "Operating Activities" is en de AI schrijft "Operations activities", markeert de leraar het als fout. Het is alsof een wiskundeleraar een leerling niet slaagt omdat hij "12" schreef in plaats van "12,0", terwijl het getal wel juist is.

Nog erger nog: de antwoordsleutel van de leraar was soms fout. Stel je een vraag voor als: "Hoeveel blauwe pijlen staan er op pagina 5?" De antwoordsleutel zegt "Nul". Maar als je naar de pagina kijkt, zijn er inderdaad geen blauwe pijlen, dus "Nul" is correct. Echter, soms zei de sleutel "Nul" terwijl het document wél een pijl bevatte, of was de vraag zo verwarrend geformuleerd dat zelfs een mens het niet kon beantwoorden. Het ergste van alles? Deze fouten waren geconcentreerd bij de moeilijke vragen. Dus de slimste AI's werden het meest gestraft, terwijl de minder slimme (die willekeurig gokten) er minder last van hadden. Het was als een race waarbij de snelste hardlopers werden belast met loden laarzen, terwijl de langzame wandelaars dat niet werden.

De Oplossing: MMLongBench-Doc-V2

Hier komt het nieuwe paper binnen: MMLongBench-Doc-V2. De auteur, zijnde Mingtian Zhang, besloot het examen te repareren in plaats van het weg te gooien. Hij behandelde de originele test als een slordig concept en heeft het opgelapt met drie belangrijke zetten.

1. De Nieuwe Beoordelaar: Een "Betekenis"-detective
In plaats van een robot die alleen controleert of twee tekstreeksen er identiek uitzien, heeft hij een "Betekenis-detective" ingehuurd (een speciale AI-rechter). Deze detective geeft niet om komma's, hoofdletters of extra spaties. Hij kijkt naar het antwoord van de AI en vraagt: "Betekent dit hetzelfde als het juiste antwoord?"

  • De Analogie: Als het antwoord "The cat is sleeping" is, en de AI zegt "A feline is napping", zou de oude beoordelaar het als fout markeren. De nieuwe detective laat het door omdat de betekenis hetzelfde is.
  • De Catch: Deze detective ziet het originele document nooit. Hij vergelijkt alleen het antwoord van de AI met de juiste antwoordsleutel. Dit voorkomt dat de detective in de war raakt door slechte scans of ontbrekende tekst in de PDF.

2. Het Herstellen van de Antwoordsleutel (106 Correcties)
De auteur ging door het examen en vond 106 vragen waarbij de antwoordsleutel fout was, de vraag defect was, of het document niet overeenkwam met de vraag.

  • Het "Verkeerd Bestand"-probleem: Ze vonden 10 vragen die gingen over een document dat niet eens in de testmap zat! Het was alsocht een vraag stellen over "Hoofdstuk 5 van Harry Potter", maar de student een exemplaar van The Hobbit aanreiken. Niemand kon dat beantwoorden, dus hebben ze die vragen volledig verwijderd.
  • De "Teken"-fout: In één geval zei de sleutel dat een getal met 60,3% steeg, maar het document liet zien dat het met 60,3% daalde. De auteur heeft het teken gecorrigeerd.
  • De "Ambiguïteit"-fix: Sommige vragen waren te vaag. Als een document "kortlopende schuld" en "langlopende schuld" apart vermeldt, maar de vraag vraat om "totale schuld" zonder te zeggen welke men moet optellen, dan heeft de auteur de vraag super specifiek herschreven.

3. Het "Lege Verzameling"-dilemma
Dit is het lastigste deel. Sommige vragen vragen: "Hoeveel draken zijn er in dit financiële rapport?" Het antwoord is overduidelijk nul. Maar in de originele test werden sommige "nul"-antwoorden gemarkeerd als "Niet Beantwoordbaar" (wat betekende dat het document de informatie niet bevatte), terwijl andere werden gemarkeerd als "0" (wat betekende dat het document gecontroleerd was en er niets gevonden werd).

  • De Regel: De auteur heeft een strikte regel opgesteld: Als het document bestaat en je kunt bewijzen dat het ding er niet is, dan is het antwoord 0. Als het document een hele pagina mist of de vraag gaat over iets dat niet geteld kan worden (zoals "alle sterren in het universum"), dan is het Niet Beantwoordbaar.
  • Het Resultaat: Ze hebben 14 vragen aangepast om ervoor te zorgen dat de "nul"-antwoorden eerlijk zijn. Dit voorkomt dat de AI erin wordt geluisd om te denken dat "Ik weet het niet" het juiste antwoord is wanneer het juiste antwoord eigenlijk "Geen" is.

Het Eindscorebord

Na alle schoonmaakwerkzaamheden heeft de nieuwe test (V2) 1.071 vragen verspreid over 134 documenten (daal van 1.082 vragen en 135 documenten).

  • De Grote Verandering: De scores op deze nieuwe test zijn niet vergelijkbaar met de oude scores. Je kunt niet zeggen: "De AI haalde 44,9% vorig jaar en 50% dit jaar, dus hij is verbeterd." De test zelf is veranderd, dus de cijfers zitten op een andere schaal.
  • Het Goede Nieuws: De nieuwe test is een eerlijkere manier om te zien of een AI daadwerkelijk slim is of gewoon geluk heeft. Het verwijdert de "instinkers" die de beste modellen in de war maakten.
  • De Nuance: De auteur geeft toe dat hij niet elke vraag heeft gecontroleerd. Hij heeft zich gericht op de vragen waar slimme AI's de fout in gingen, want daar is de kans het grootst dat fouten zich verschuilen. Er kunnen nog steeds enkele fouten in de test zitten, maar er zijn er veel minder dan voorheen.

Waarom Dit Belangrijk Is

Dit paper gaat niet over het uitvinden van een nieuwe super-AI. Het gaat over het repareren van de liniaal die we gebruiken om hen te meten. Als je een robot bouwt om juridische contracten of medische rapporten te lezen, moet je weten of hij daadwerkelijk leest of gewoon gokt. MMLongBench-Doc-V2 geeft ons een schonere, eerlijkere liniaal. Het zorgt ervoor dat wanneer een AI een vraag goed beantwoordt, dat komt omdat hij het document begreep, en niet omdat hij het juiste aantal komma's heeft geraden.

De auteur heeft al zijn correcties, de nieuwe testdata en de tools om de antwoorden te beoordelen beschikbaar gesteld voor iedereen om te gebruiken. Het is een herinnering dat in de wetenschap de belangrijkste taak soms niet het bouwen van de motor is, maar het repareren van de snelheidsmeter, zodat we weten hoe snel we werkelijk gaan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →