← Nieuwste papers
💻 computer science

SPIRE: Structure-Preserving Interpretable Retrieval of Evidence

Dit paper introduceert SPIRE, een structure-bewuste zoekpipeline voor HTML-documenten die subdocumenten behoudt en contextueel verrijkt om betere, interpreteerbare en schaalbare resultaten te behalen dan traditionele, lineaire fragmentbenaderingen.

Oorspronkelijke auteurs: Mike Rainey, Umut Acar, Muhammed Sezer

Gepubliceerd 2026-04-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mike Rainey, Umut Acar, Muhammed Sezer

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Kernprobleem: Het "Flatten" van Boeken

Stel je voor dat je een prachtig, complex boek hebt met hoofdstukken, koppen, lijsten en tabellen. Nu, stel je voor dat iemand dit boek neemt en alle pagina's in één lange, ononderbroken strook papier plakt. De koppen zijn weg, de lijsten zijn verbroken en de tabellen zijn een grote brij van tekst geworden.

Dit is wat de meeste huidige AI-systemen (zoals RAG) doen met webpagina's (HTML). Ze nemen een rijk, gestructureerd document en "plat" het af tot een reeks tekstblokjes.

Het gevolg? Als de AI een zinnetje uit dat boek haalt om een vraag te beantwoorden, is dat zinnetje vaak onbegrijpelijk.

  • Het is als een zin uit een lijst: "Deze optie is de beste." (Maar wat is de lijst? Wat zijn de andere opties?)
  • Het is als een getal uit een tabel zonder koppen: "41" (41 wat? 41 parken? 41 mensen? 41 euro?)

Zonder de structuur (de koppen, de lijst, de tabel) is de informatie nutteloos voor de gebruiker.

De Oplossing: SPIRE (De Slimme Bibliotheek)

De auteurs van dit paper, SPIRE, zeggen: "Waarom gooien we de structuur weg? Laten we het juist gebruiken!"

Ze hebben een systeem bedacht dat documenten behandelt als een boomstructuur (met takken, bladeren en wortels), in plaats van als een platte strook.

Hier is hoe het werkt, vertaald naar een simpele analogie:

1. De Boomstructuur (De Documentboom)

Stel je een document voor als een enorme boom.

  • De stam is de titel van het artikel.
  • De grote takken zijn de hoofdstukken (koppen).
  • De kleine takken zijn alinea's of lijsten.
  • De bladeren zijn de zinnen.

Elk onderdeel heeft een uniek adres (een "pad"), net zoals je een huisadres hebt. SPIRE onthoudt niet alleen de tekst, maar ook precies waar die tekst hangt in de boom.

2. Twee soorten "Context" (De Omgeving)

Als je een blad van de boom plukt, moet je weten waar het vandaan komt, anders is het raadselachtig. SPIRE gebruikt twee slimme manieren om context toe te voegen:

  • Globale Context (De "Waarom"-context):
    Stel je plukt een blad. Om te weten wat het is, moet je weten aan welke tak het zit en wat de naam van de boom is.

    • Voorbeeld: Als je een zin leest over "41 parken", voegt SPIRE automatisch de hoofdstuktitel "Key Takeaways" en de documenttitel "Virginia State Parks" toe. Zonder deze toevoeging wist de AI niet waar het over ging. Dit gebeurt automatisch en vastgelegd in de index.
  • Lokale Context (De "Buren"-context):
    Soms is een enkel blad te klein. Je wilt misschien de hele tak zien om de context te begrijpen.

    • Voorbeeld: Als de AI een zin vindt, kijkt het even naar de zinnen erboven en eronder (de buren) om de zin te begrijpen. Maar het plukt alleen de buren die nodig zijn. Het gooit niet de hele boom mee.

3. Het Proces: Hoe SPIRE werkt

Het proces lijkt op het zoeken in een zeer georganiseerde bibliotheek:

  1. Zoeken (De Vraag): Je stelt een vraag. De AI zoekt in de "boom" naar zinnen die lijken op je vraag. Omdat ze op zinnen zoeken (in plaats van grote blokken), vinden ze heel precies.
  2. Samenvoegen (De Slimme Verzameling): Stel, de AI vindt 10 zinnen uit één artikel. In een oud systeem zou het de titel en koppen 10 keer herhalen (wat ruimte kost). SPIRE zegt: "Wacht, dit komt uit dezelfde boom. Laten we de titel maar één keer toevoegen en dan alle 10 de zinnen eronder plakken." Dit bespaart ruimte en maakt het overzichtelijker.
  3. Filteren (De Redacteur): Nu heeft de AI een hoop materiaal. Een menselijke redacteur (een slimme AI) kijkt naar de verzameling en zegt: "Oké, deze zin is relevant, maar die zin hieronder is onbelangrijke ruis. Laten we die weglaten."
  4. Het Eindresultaat: Je krijgt een kort, scherp antwoord met de juiste bronvermelding. Je weet precies waar de informatie vandaan komt (bijvoorbeeld: "Hoofdstuk 3, alinea 2, zin 4"), zelfs als er veel context omheen is toegevoegd.

Waarom is dit beter dan wat we nu hebben?

  • Precisie: Omdat ze op zinnen zoeken, vinden ze het juiste antwoord sneller.
  • Begrijpelijkheid: Door de koppen en lijsten mee te nemen, is het antwoord nooit een raadsel.
  • Efficiëntie: Ze verspillen geen ruimte aan het herhalen van titels en koppen.
  • Betrouwbaarheid: Je kunt altijd terugkijken naar het originele document om te zien of de AI het goed heeft gedaan, omdat elk stukje tekst een vast adres heeft.

Samenvattend

SPIRE is als een slimme bibliotheekmedewerker die niet zomaar een pagina uit een boek scheurt en je die geeft. In plaats daarvan:

  1. Haalt hij de juiste zin.
  2. Plakt er de titel van het hoofdstuk en de naam van het boek bovenop (zodat je weet wat het is).
  3. Voegt hij eventueel de buren-zinnen toe als dat nodig is voor de context.
  4. Controleert hij of het antwoord klopt.
  5. Geeft hij je een perfect, zelfstandig antwoord dat je direct kunt gebruiken.

Het resultaat is dat AI-systemen minder "hallucineren", betere bronvermeldingen geven en antwoorden die echt begrijpelijk zijn voor mensen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →