← Nieuwste papers
💬 NLP

ENTLORE: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering

Dit artikel introduceert ENTLORE, een op grafen gebaseerde benchmark die de systemen voor beantwoording van vragen binnen ondernemingen evalueert op hun vermogen om latente organisatorische redenering uit te voeren door gecontroleerde bedrijfswerelden te reconstrueren uit routinedocumenten om het herstel van impliciete relaties te testen die verder gaan dan eenvoudige feitenretrieval.

Oorspronkelijke auteurs: Akrin Zheng, Alexander Wu, Alaia Liu

Gepubliceerd 2026-08-12
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Akrin Zheng, Alexander Wu, Alaia Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen in een gigantische, chaotische bibliotheek. Dit is niet zomaar een bibliotheek; dit is de "hersenen" van een enorm bedrijf, gevuld met miljoenen documenten zoals e-mails, projectrapporten, vergaderverslagen en spreadsheets. In de wereld van Kunstmatige Intelligentie (AI) is er een populair spel genaamd "Question Answering" (Vraagbeantwoording). Meestal krijgt de AI een vraag en een stapel documenten, en is het de taak om de exacte zin te vinden die het antwoord bevat. Denk aan het als een spelletje "Ik zie, ik zie wat jij ziet" waarbij het antwoord in het volle zicht verborgen ligt, wachtend om opgepakt te worden.

Maar het echte leven in een bedrijf is rommeliger dan een spelletje. Vaak staat het antwoord op een vraag niet in één enkele zin opgeschreven. In plaats daarvan is de waarheid verborgen in de relaties tussen verschillende documenten. Misschien zegt één e-mail: "Alice werkte aan Module X," en zegt een ander rapport: "Module X is onderdeel van Project Y," maar geen enkel document zegt ooit: "Alice werkte aan Project Y." Om het antwoord te vinden, moet de AI zelf de puntjes verbinden, gebruikmakend van de onzichtbare regels van hoe het bedrijf is georganiseerd. Dit paper, geschreven door onderzoekers van ScitiX.ai, gaat over het leren van computers hoe ze dat soort detectivewerk kunnen doen, in plaats van alleen maar goed te zijn in het vinden van woorden.

Het Probleem: De "Verborgen Waarheid" Valstrik

De meeste AI-benchmarks (tests voor AI) zijn als een schattenjacht waarbij de kaart al getekend is. De makers van de test schrijven een vraag, en zorgen er vervolgens voor dat het antwoord expliciet in de documenten staat die ze de AI geven. Het is alsof je vraagt: "Welke kleur heeft de rode bal?" en de AI een foto van een rode bal geeft. De AI hoeft alleen maar het woord "rood" te vinden.

De auteurs van dit paper stellen dat dit te makkelijk is en niet weerspieggelt hoe echte bedrijven werken. In de echte wereld wordt de "rode bal" misschien in één bestand genoemd, en de informatie dat het een "bal" is in een ander, maar de connectie tussen die twee wordt nooit expliciet vermeld. De AI moet begrijpen dat "Module X" bij "Project Y" hoort op basis van hoe het bedrijf gestructureerd is, zelfs als geen enkel document ze expliciet aan elkaar koppelt. De onderzoekers noemen deze ontbrekende vaardigheid Latent Organizational Reasoning (Latente Organisatorische Redenering). Het is het vermogen om de onzichtbare regels van een organisatie af te leiden uit de rommelige bijproducten van het dagelijkse werk.

De Oplossing: ENTLORE, de "Truth Graph"

Om te testen of AI dit daadwerkelijk kan, heeft het team een nieuwe benchmark gebouwd genaamd ENTLORE. Stel je voor dat ze de volledige digitale geschiedenis van een echt, privaat bedrijf hebben genomen — duizenden documenten, organogrammen en operationele logs — en achter de schermen een gigantische, geheime "Truth Graph" (Waarheidsgrafiek) hebben gebouwd. Deze grafiek is als een meesterblauwdruk die precies weet hoe elke persoon, elk project en elke module met elkaar verbonden is, gebaseerd op strikte, gecontroleerde regels.

Vervolgens creëerden ze een "gepubliceerde wereld" waarin de AI mag spelen. Deze gepubliceerde wereld bevat dezelfde documenten, maar alle namen zijn veranderd om de privacy te beschermen (zoals "Alice" veranderen in "Werknemer #42" en "Project Alpha" in "Project Beta"). Cruciaal is dat de AI de geheime Truth Graph niet kan zien. De AI ziet alleen de rommelige, geanonimiseerde documenten.

Het team stelde vervolgens 907 vragen. Ze deelden deze vragen op in drie moeilijkheidsgraden:

  1. Niveau 1 (De Opzoekopdracht): Het antwoord staat direct in één document. (bijv. "Wie is de manager van Project Beta?")
  2. Niveau 2 (De Samenstelling): Het antwoord vereist het lezen van twee documenten en het combineren van feiten. (bijv. "Wie beheert het team dat Module X heeft gebouwd?")
  3. Niveau 3 (De Latente Redenering): Het antwoord vereist het verbinden van puntjes die niet expliciet aan elkaar gelinkt zijn. (bijv. "Wie is verantwoordelijk voor het algemene succes van Project Beta?" — ook al staat er nergens dat "Werknemer #42 verantwoordelijk is voor Project Beta", de Truth Graph weet dit omdat zij de module binnen het project beheerde.)

De Bevindingen: AI is Goed in Lezen, Slecht in Verbinden

De onderzoekers testten 8 verschillende AI-modellen met diverse methoden, variërend van eenvoudige zoekopdrachten tot complexe "agent"-systemen die documenten kunnen doorzoeken zoals een mens dat doet. Dit is wat ze ontdekten:

1. De "Verborgen Waarheid" is Moeilijk te Vinden
Wanneer het antwoord expliciet in de documenten stond (Niveaus 1 en 2), presteerden de AI-modellen redelijk goed. Maar toen ze Niveau 3 bereikten (Latente Redenering), daalde de prestatie drastisch. Zelfs de beste modellen beantwoordden slechts ongeveer 36,2% van deze moeilijke vragen correct.

2. Structuur Is Belangrijker Dan Snelheid
De onderzoekers probeerden verschillende manieren uit om de AI te helpen informatie te vinden.

  • Eenvoudige Zoekopdracht (BM25): Gewoon zoeken naar overeenkomstige woorden. Dit was verrassend goed.
  • Dense Search (Flat RAG): Geavanceerde wiskunde gebruiken om vergelijkbare ideeën te vinden. Dit deed het eigenlijk slechter dan de eenvoudige zoekopdracht.
  • Grafiek-gebaseerde Systemen (GraphRAG): Deze systemen proberen een kaart van verbindingen tussen documenten te bouwen voordat ze een antwoord geven. Dit bleek de sterkste aanpak te zijn, die de andere methoden gemiddeld versloeg. Dit suggereert dat AI de structuur van het bedrijf moet begrijpen, niet alleen de woorden.

3. Zelfs met de "Gold Documents" Faalt de AI
De meest schokkende ontdekking kwam toen de onderzoekers de AI de "Gold Documents" gaven — de exacte bestanden die nodig zijn om de vraag te beantwoorden, waarbij het zoeken naar de bestanden werd overgeslagen.

  • Voor gemakkelijke vragen (Niveau 1) kreeg de AI bijna alles goed.
  • Voor middelmoeilijke vragen (Niveau 2) deed de AI het nog steeds goed.
  • Maar voor de moeilijke, latente vragen (Niveau 3) waren 30,4% van de antwoorden nog steeds fout, zelfs terwijl de AI de perfecte documenten voor zich had liggen!

Dit betekent dat het probleem niet alleen is dat de AI niet de juiste bestanden kan vinden; het is dat de AI niet kan redeneren door de onzichtbare organisatorische regels, zelfs wanneer de AI over al het bewijs beschikt. Het is alsof je een detective de foto's van de plaats delict geeft, maar de detective nog steeds faalt om te beseffen dat de butler en de tuinman eigenlijk dezelfde persoon zijn, omdat de foto's dat niet expliciet vermelden.

Waarom Dit Er Toe Doet

Het paper concludeert dat we niet alleen betere zoekmachines voor bedrijven kunnen bouwen. We hebben AI nodig die de "ziel" van een organisatie kan begrijpen — de ongeschreven regels, de projecthiërarchieën en de verborgen verbindingen. ENTLORE bewijst dat de huidige AI hier nog steeds mee worstelt. De AI is erg goed in het lezen van wat er geschreven staat, maar leert nog steeds hoe ze moet nadenken over wat er wordt gesuggereerd.

De onderzoekers hebben hun data en code openbaar gemaakt zodat andere wetenschappers dit puzzelstukje kunnen oplossen. Totdat AI deze "latente organisatorische redenering" beheerst, zal het altijd een beetje lijken op een nieuwe werknemer die wel het handboek kan lezen, maar nog niet begrijpt hoe het bedrijf werkelijk functioneert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →