← Nieuwste papers
💬 NLP

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

Het artikel introduceert Khondo, de eerste vision-native, tweetalige benchmark voor het splitsen en herordenen van samengevoegde Bengaalse overheidsformulieren, wat onthult dat multimodale grote taalmodellen pagina's effectief per document kunnen clusteren, maar aanzienlijk moeite hebben met het reconstrueren van de oorspronkelijke paginavolgorde, met name in talen met weinig middelen.

Oorspronkelijke auteurs: Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan, Ezharuddin Jubaer, Sumaiya Karim Katha, Armun Alam, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

Gepubliceerd 2026-07-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan, Ezharuddin Jubaer, Sumaiya Karim Katha, Armun Alam, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een bibliothecaris bent in een chaotische, magische bibliotheek waar boeken niet alleen op planken liggen; ze worden soms aan elkaar gelijmd tot enorme, slordige rollen, en dan schudt iemand de tafel, waardoor de pagina's van verschillende verhalen door elkaar raken en volledig door de war raken. Jouw taak is om naar deze verwarde bende te kijken, uit te zoeken welke pagina's bij welk verhaal horen, en ze vervolgens weer in de juiste volgorde te stapelen zodat het verhaal weer logisch wordt. Dit is het echte wereldprobleem van "document packet splitting". In de digitale wereld scannen overheden en kantoren vaak honderden papieren in één groot bestand. Soms raakt de scanner in de war, of heeft een werknemer per ongeluk de pagina's gehusseld, waardoor een geboorteakte met een belastingformulier of een rijbewijs met een medisch rapport wordt gemengd. Voor computers is dit een nachtmerrie. Hoewel we slimme AI hebben gebouwd die tekst kan lezen, is het leren aan de computer om naar een afbeelding van een pagina te kijken, visuele aanwijzingen te begrijpen en dan een door elkaar gehusselde stap documenten te ontwarren een veel moeilijkere uitdaging, vooral wanneer de documenten zijn geschreven in talen die computers niet zo vaak zien.

Hier komt een nieuw project genaamd Khondo (wat "splitsen" of "segmenteren" betekent in het Bengaals) in beeld. De onderzoekers achter dit project hebben een speciale testset gecreëerd, zoals een enorme puzzeldoos, specifiek ontworpen om te zien hoe goed moderne AI een rommelige stap documenten kan ontwarren. Ze gebruikten niet alleen Engels; ze gebruikten echte overheidsformulieren uit Bangladesh, die vaak in het Bengaals, Engels of een mix van beide zijn geschreven. Ze namen duizenden pagina's, plakten ze samen tot nep-"pakketten" en husselden de pagina's vervolgens op vijf verschillende manieren door elkaar: van het behouden van de volgorde tot het mengen van pagina's binnen één enkel document, tot het volledig door elkaar husselen van pagina's van verschillende documenten. Vervolgens vroegen ze de meest geavanceerde AI-modellen ter wereld om naar de afbeeldingen van deze pagina's te kijken en ze te proberen te sorteren.

De resultaten waren een mix van "niet slecht" en "o jee". De AI-modellen waren verrassend goed in het eerste deel van de taak: ze konden een door elkaar gehusselde stap bekijken en correct raden welke pagina's bij elkaar hoorden. Het was alsof de AI kon zeggen: "Hé, deze vier pagina's gaan allemaal over landbouw, en die drie over belastingen," zelfs toen de pagina's door elkaar lagen. De AI liep echter tegen een enorme muur op bij het tweede deel: het terugbrengen van de pagina's in de juiste volgorde. Wanneer de pagina's gehusseld waren, worstelde de AI met de vraag welke pagina eerst, tweede of laatst kwam. Het was alsof de AI de personages in een verhaal kon identificeren, maar zich de volgorde van de plot niet kon herinneren.

De onderzoekers groeven dieper om te ontdekken waarom dit gebeurde. Ze probeerden twee belangrijke trucs uit. Eerst gaven ze de AI zeer specifieke instructies, waarbij ze ze vertelden: "Hé, deze pagina's zijn door elkaar gehusseld; graag de volgorde herstellen!" Dit hielp een hoop, maar loste het probleem niet volledig op. De AI maakte nog steeds fouten, wat suggereert dat de moeilijkheid niet alleen lag aan het feit dat de AI niet luisterde, maar dat de taak zelf simpelweg erg moeilijk was. Ten tweede testten ze de AI met pakketten die alleen uit Engels bestonden en pakketten die alleen uit Bengaals bestonden. Ze ontdekten dat de AI veel beter was in het ordenen van de Engelse pagina's dan de Bengaalse. Het lijkt erop dat het lezen van de visuele aanwijzingen in het Bengaals een extra laag van moeilijkheid vormde die de AI vertraagde, ook al kon de AI de pagina's nog steeds correct groeperen.

Kortom, dit artikel laat zien dat hoewel AI steeds beter wordt in het herkennen waarvan een document is, het nog steeds moeite heeft om te functioneren als een menselijke bibliothecaris die naar een door elkaar gehusselde stap papier kijkt en direct de juiste leesvolgorde weet, vooral wanneer de tekst in een taal als het Bengaals is. De onderzoekers hebben deze "rommelige bibliotheek"-puzzel nu beschikbaar gesteld voor iedereen, in de hoop dat het bestuderen van deze mislukkingen toekomstige AI zal helpen om de knopen te ontwarren en de orde in onze digitale documenten te herstellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →