← Nieuwste papers
💻 computer science

Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

Dit artikel introduceert S-OBI, een nieuwe benchmark die heldere, gestandaardiseerde zinsniveau Oracle Bone Inscription-instanties synthetiseert om Multimodale Grote Taalmodellen te evalueren, waarbij wordt onthuld dat huidige modellen moeite hebben met het begrijpen van gestructureerde inscripties vanwege een zware afhankelijkheid van karakterherkenning en de voortplanting van visuele perceptiefouten.

Oorspronkelijke auteurs: Ziqi Li, Zijian Chen, Tingzhu Chen, Guangtao Zhai

Gepubliceerd 2026-07-01
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ziqi Li, Zijian Chen, Tingzhu Chen, Guangtao Zhai

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij de oude Chinese geschiedenis moet lezen. Al een lange tijd leren onderzoekers deze robots om individuele oude symbolen te herkennen, een beetje zoals je een kind leert om de letter "A" of het getal "1" in isolatie te herkennen. Ze kunnen naar een enkel gegraveerd symbool op een schildpadschild wijzen en zeggen: "Dat is een 'paard'."

Maar echte geschiedenis is niet zomaar een stapel willekeurige letters; het zit vol met zinnen met verhalen, data en specifieke betekenissen. Dit artikel, getiteld "Beyond Single Character," betoogt dat alleen omdat een robot de letters kan herkennen, betekent dit nog niet dat hij het verhaal kan lezen.

Hier is een eenvoudige uiteenzetting van wat de onderzoekers hebben gedaan en wat ze hebben gevonden:

Het Probleem: De "Lego" versus het "Kasteel"

Zie de Oracle Bone Inscriptions (de oude schriftuur) als een kasteel gemaakt van Lego-stenen.

  • Eerdere studies testten alleen of de robot een enkele rode steen of een enkele blauwe steen kon identificeren.
  • Dit artikel vraagt: "Kan de robot naar het hele kasteel kijken en vertellen wie het gebouwd heeft, waarom het gebouwd is en wat het verhaal is?"

De onderzoekers ontdekten dat huidige AI-modellen (genaamd Multimodale Grote Taalmodellen, of MLLM's) erg goed zijn in het spotten van de individuele stenen, maar verschrikkelijk in het begrijpen van het kasteel. Ze weten misschien wat een "paard"-symbool is, maar ze kunnen niet uitzoeken of de zin gaat over een koning die op een paard jaagt of over een paard dat wegrent.

De Oplossing: Het Bouwen van een "Schone" Test (S-OBI)

De oude records zijn oud, gebarsten en vuil (zoals een modderige, gescheurde foto). Om de AI eerlijk te testen, hebben de onderzoekers een nieuwe benchmark gecreëerd genaamd S-OBI.

In plaats van de rommelige, originele foto's te gebruiken, traden ze op als digitale restaurateurs:

  1. Ze namen 95 oude zinnen die experts al hadden vertaald en begrepen.
  2. Ze namen de rommelige, wazige delen van de oude inkervingen en vervingen deze door kristalheldere, perfecte digitale versies van diezelfde symbolen.
  3. Ze hielden de zinstructuur exact hetzelfde, maar maakten de visuele input "schoon".

Dit is alsof je een modderige, gescheurde brief uit de 19e eeuw neemt, scant, en hem vervolgens opnieuw typt op een schoon stuk papier met een perfect lettertype, zodat de AI niet wordt afgeleid door het vuil en zich puur kan concentreren op het begrijpen van de betekenis van de zin.

De Test: Drie Niveaus van Moeilijkheidsgraad

Ze ontwierpen drie soorten puzzels om te zien hoe slim de AI werkelijk is:

  1. De "Gist" Test (Semantische Matching): "Hier is een oude zin. Welke van deze vier moderne samenvattingen beschrijft deze het best?"
    • Resultaat: De AI was oké met dit. Hij kon de algemene sfeer raden.
  2. De "Structuur" Test (Slot Extractie): "Hier is een zin. Vul een formulier in met de Datum, de Persoon, de Actie en het Object."
    • Resultaat: De AI had moeite. Hij kon de informatie niet correct organiseren.
  3. De "Detective" Test (Contextuele Redenering): "Hier is een zin waarin we één woord hebben gewist. Gebaseerd op de andere woorden, wat was het ontbrekende woord?" OF "Hier is een zin waarin we de woorden hebben gehusseld. Zet ze terug in de juiste volgorde."
    • Resultaat: De AI faalde jammerlijk. Hij kon de omliggende aanwijzingen niet gebruiken om het ontbrekende deel te achterhalen.

De Grote Ontdekking

De meest verrassende bevinding is dat de AI nog steeds vastzit op het "enkele karakter"-niveau.

De onderzoekers ontdekten dat als de AI een kleine fout maakt bij het herkennen van één klein symbool, die fout doorwerkt in de hele zin, waardoor de AI de verkeerde betekenis voor het hele verhaal raadt. Het is also kind als je één woord in een zin verkeerd leest, kun je de hele paragraaf verkeerd begrijpen.

Zelfs de slimste geteste AI-modellen (zoals GPT-4o en Qwen) scoorden erg laag (ongeveer 33% correct). Ze konden soms de juiste volgorde van de woorden raden (zoals weten dat de zin met een datum begint), maar ze konden het verhaal dat de zin vertelde, niet echt begrijpen.

De Conclusie

Het artikel concludeert dat hoewel AI beter wordt in het herkennen van oude symbolen, het nog niet heeft geleerd om ze als een samenhangende taal te "lezen". Het is alsof je een woordenboek hebt, maar niet weet hoe je een gedicht schrijft. Om deze oude records echt te begrijpen, moet AI verder gaan dan alleen het identificeren van individuele stenen en leren hoe je het hele kasteel bouwt (en begrijpt).

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →