← Nieuwste papers
💬 NLP

MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

MM-BizRAG introduceert een multimodale retrieval-augmented generation framework dat bedrijfsdocumenten dynamisch door oriëntatie-specifieke parsing-pipelines routeert om structurele informatie expliciet te extraheren, waarmee het bestaande visie-gecentreerde baselines aanzienlijk overtreft in Q&A-nauwkeurigheid terwijl het een kosteneffectieve evaluatiemetriek genaamd FastRAGEval biedt.

Oorspronkelijke auteurs: Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal, Prateek Singh, Aymen Kallala, Rachneet Kaur, Yiqiao Jin, Zhen Zeng, Adwait Ratnaparkhi, Denis Kochedykov

Gepubliceerd 2026-06-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal, Prateek Singh, Aymen Kallala, Rachneet Kaur, Yiqiao Jin, Zhen Zeng, Adwait Ratnaparkhi, Denis Kochedykov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je werkt in een gigantische, chaotische bibliotheek waar de boeken in twee zeer verschillende vormen komen: lange, smalle rapporten (zoals financiële overzichten) en brede, platte slide decks (zoals PowerPoint-presentaties).

Een lange tijd hebben de "robots" (AI-systemen) die vragen uit deze boeken moeten beantwoorden, een luie aanpak gehanteerd. Ze kregen de opdracht om simpelweg een foto van elke pagina te maken en die foto in het brein van de robot te voeren. Ze hoopten dat de robot de structuur van de pagina zou kunnen "raden" door alleen naar de foto te kijken.

Het Probleem:
Deze "alleen foto"-methode werkt redelijk bij eenvoudige slides, maar faalt jammerlijk bij complexe rapporten. Het is alsof je probeert een gedetailleerde blauwdruk te begrijpen door naar een wazige foto ervan te turen. De robot mist de specifieke cijfers in de tabellen, de tekststroom en de relatie tussen een grafiek en de paragraaf ernaast. De robot is te druk met het bekijken van het "gehele plaatje" om de belangrijke details te zien.

De Oplossing: MM-BizRAG
De auteurs van dit artikel hebben een nieuw systeem gebouwd genaamd MM-BizRAG. In plaats van elk type document hetzelfde te behandelen, werkt dit systeem als een slimme bibliothecaris die precies weet hoe hij verschillende soorten boeken moet afhandelen.

Zo werkt het, met behulp van eenvoudige analogieën:

1. De "Slimme Sorteerder" (Document Structure-Aware Split)

Wanneer een document binnenkomt, vraagt het systeem eerst: "Is dit een lang rapport of een brede slide deck?"

  • Als het een Rapport is (Verticaal): Het systeem maakt niet alleen een foto. Het snijdt het document zorgvuldig in stukken, leest de tekst, extraheert de tabellen en beschrijft de afbeeldingen. Het houdt bij waar alles op de pagina stond, zoals een puzzelmeester die de stukjes in de juiste volgorde houdt.
  • Als het een Slide Deck is (Horizontaal): Het systeem beseft dat op een slide de tekst, afbeelding en grafiek samen gemengd zijn om één verhaal te vertellen. Daarom behandelt het de hele slide als één enkele eenheid en beschrijft het de gehele scène in één keer.

2. De "Twee-Rugzakken-Strategie" (Decoupling Retrieval and Generation)

Dit is het geheime ingrediënt van het systeem. De meeste andere systemen proberen alles in één rugzak te proppen om het antwoord te vinden. MM-BizRAG gebruikt twee verschillende rugzakken:

  • Rugzak A (Voor het Zoeken): Deze bevat vereenvoudigde, tekstzware samenvattingen en beschrijvingen. Het is lichtgewicht en snel, waardoor het gemakkelijk door duizenden documenten kan zoeken om de juiste te vinden.
  • Rugzak B (Voor het Beantwoorden): Zodra de juiste documenten zijn gevonden, haalt het systeem de volledige, rijke versies (inclusief de werkelijke afbeeldingen en tabellen) tevoorschijn en assembleert deze perfect voor het uiteindelijke antwoord.

Waarom dit belangrijk is: Het is also� mắt een goedkope, snelle kaart gebruiken om een stad te vinden (Rugzak A), en zodra je daar bent, een high-definition, 3D-model van de stad gebruiken om je gids de beste instructies te geven (Rugzak B). Je krijgt de snelheid van een zoekmachine met de diepgang van een menselijke expert.

3. De "Eén-Oproep-Rechter" (FastRAGEval)

Om te testen of hun systeem echt goed is, hadden ze een manier nodig om de antwoorden te beoordelen. Bestaande beoordelingstools waren als een leraar die het antwoord moest lezen, het in kleine zinnetjes moest opdelen, elk zinnetje moest controleren en vervolgens een rapport moest schrijven. Dit kostte veel tijd en geld.

De auteurs hebben FastRAGEval uitgevonden, wat een soort super snelle leraar is die het hele antwoord kan lezen, de feiten kan controleren en in één oogopslag een cijfer kan geven. Het is twee keer zo snel en komt beter overeen met menselijke beoordelaars dan de oude methoden.

De Resultaten

Toen ze dit nieuwe systeem testten tegenover de "alleen foto"-robots:

  • Voor Rapporten: Het was een enorme overwinning, met een verbetering van de nauwkeurigheid tot wel 32%. Het systeem begreep eindelijk de complexe tabellen en grafieken die anderen misten.
  • Voor Slides: Het presteerde net zo goed als de beste foto-gebaseerde systemen, wat bewees dat je de tekst niet hoeft te negeren om slides te kunnen verwerken.
  • Snelheid: Ze vonden een "sweet spot" configuratie die bijna even nauwkeurig was als de meest complexe versie, maar ongeveer twee keer zo snel draaide.

In een Notendop

Het artikel betoogt dat we niet alleen moeten vertrouwen op AI om de structuur van een document te "raden" door naar een foto te kijken. In plaats daarvan moeten we documenten actief parsen (ontleden) op basis van hun vorm, een snelle methode gebruiken om de juiste informatie te vinden, en pas de rijke details samenstellen wanneer we het uiteindelijke antwoord moeten schrijven. Deze aanpak maakt de AI veel slimmer, vooral voor de complexe documenten die bedrijven dagelijks gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →