← Nieuwste papers
💬 NLP

SciClaimEval: Cross-modal Claim Verification in Scientific Papers

Dit paper introduceert SciClaimEval, een nieuw cross-modaal dataset voor het verifiëren van wetenschappelijke claims op basis van authentieke figuren en tabellen, en presenteert de resultaten van benchmarks met 11 multimodale modellen die aantonen dat figuurgebaseerde verificatie nog steeds een aanzienlijke uitdaging vormt ten opzichte van menselijke prestaties.

Oorspronkelijke auteurs: Xanh Ho, Yun-Ang Wu, Sunisth Kumar, Tian Cheng Xia, Florian Boudin, Andre Greiner-Petter, Akiko Aizawa

Gepubliceerd 2026-02-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xanh Ho, Yun-Ang Wu, Sunisth Kumar, Tian Cheng Xia, Florian Boudin, Andre Greiner-Petter, Akiko Aizawa

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat wetenschappers een groot feest geven waar ze allemaal nieuwe ontdekkingen presenteren. Ze zeggen dingen als: "Kijk, deze nieuwe medicijn werkt wonderbaarlijk!" of "Onze nieuwe computerprogramma is 10% sneller dan de rest."

Nu, normaal gesproken kijken andere wetenschappers (de 'rechercheurs') naar de bewijzen die ze laten zien: de grafieken, de tabellen en de foto's. Maar met de opkomst van slimme computers (AI) die zelf teksten kunnen schrijven, wordt het steeds moeilijker om te weten of een bewering echt waar is of dat de AI iets heeft verzonnen.

De auteurs van dit paper hebben een nieuw hulpmiddel bedacht, genaamd SciClaimEval. Hier is hoe het werkt, vertaald naar simpele taal:

1. Het Probleem: Valse Sporen

Vroeger maakten onderzoekers 'valse' beweringen voor hun tests door gewoon een woordje "niet" toe te voegen aan een echte zin.

  • Echte zin: "Deze pil geneest de ziekte."
  • Valse zin: "Deze pil geneest de ziekte niet."

Dit is als een spoorzoeker die alleen zoekt naar mensen die een rode pet dragen. Als je de pet verwisselt, is het te makkelijk. De AI's leerden alleen dat "niet" betekent "onwaar", in plaats van echt na te denken over de inhoud.

2. De Oplossing: Het Bewijs Manipuleren

SciClaimEval doet het anders. In plaats van de zin van de wetenschapper aan te passen, veranderen ze het bewijs zelf.

  • Stel je een foto voor: Een wetenschapper zegt: "Kijk, deze grafiek toont dat de temperatuur stijgt."
  • De truc: De onderzoekers nemen diezelfde grafiek en veranderen er een klein stukje van. Ze laten de lijn plotseling dalen, of ze verwisselen de namen op de assen.
  • Het resultaat: De zin is nog steeds hetzelfde ("De temperatuur stijgt"), maar de foto (het bewijs) vertelt nu een ander verhaal.

Dit is alsof je een detective-spel speelt waarbij je de getuigenis van een getuige niet verandert, maar de foto's die de getuige laat zien, vervalst. De AI moet nu echt kijken of de tekst klopt met de foto, in plaats van alleen te zoeken naar sleutelwoorden.

3. De Verzameling: Een Diverse Bibliotheek

Ze hebben 1.664 van deze "spelletjes" gemaakt, gebaseerd op echte, gepubliceerde wetenschappelijke papers uit drie gebieden:

  • Medische wetenschap (zoals nieuwe medicijnen).
  • Talen en computers (zoals hoe AI werkt).
  • Algemene machine learning (zoals hoe robots leren).

Ze hebben niet alleen tekst gebruikt, maar ook:

  • Foto's (Grafieken): Zichtbaar als plaatjes.
  • Tabellen: Deze zijn heel speciaal. Ze zijn niet alleen als plaatje, maar ook als "bouwplaat" (code zoals LaTeX, HTML en JSON). Dit is alsof je een auto niet alleen als foto ziet, maar ook als de blauwdruk en de onderdelenlijst. Dit helpt AI om de data beter te begrijpen.

4. De Test: Kan de AI het?

De onderzoekers hebben 11 verschillende slimme AI's (zowel gratis open-source modellen als dure, gespecialiseerde modellen) getest op deze verzameling.

De resultaten waren verrassend:

  • Bij tabellen: De AI's deden het best. Ze konden de cijfers in de tabellen goed lezen en vergelijken met de tekst. De beste AI's kwamen bijna in de buurt van wat een mens zou doen.
  • Bij foto's/grafieken: Hier liepen de AI's vast. Zelfs de slimste AI's (zoals de nieuwe o4-mini van OpenAI) hadden grote moeite. Ze konden vaak niet zien dat de lijn in de grafiek verkeerd was getekend of dat de kleuren waren verwisseld. Er is nog een enorme kloof tussen wat de beste AI kan en wat een mens kan.

Waarom is dit belangrijk?

Stel je voor dat je een nieuwe auto koopt. Je wilt niet dat de verkoper alleen zegt "Deze auto is veilig", maar je wilt ook dat hij de crash-testvideo's laat zien en dat jij kunt zien of die video's niet nep zijn.

SciClaimEval is een testcursus voor AI's om te leren of ze echt begrijpen wat ze zien en lezen, of dat ze alleen maar gissen. Het laat zien dat AI's nog veel moeten leren voordat we ze volledig kunnen vertrouwen om wetenschappelijke feiten te controleren, vooral als het gaat om het interpreteren van complexe plaatjes.

Kortom: Ze hebben een nieuwe, eerlijke test gemaakt waarbij ze de "bewijsstukken" vervalsen in plaats van de tekst. Hierdoor zien we dat AI's nog steeds moeite hebben om echt te "zien" en te begrijpen wat er op een plaatje staat, terwijl ze dat met tabellen al een stuk beter kunnen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →