← Nieuwste papers
💬 NLP

CHOP: Chunkwise Context-Preserving Framework for RAG on Multi Documents

Het CHOP-framework verbetert de nauwkeurigheid van Retrieval-Augmented Generation-systemen bij meerdere documenten door chunksgewijze relevantie-evaluatie en contextbehoud te combineren, wat leidt tot een Top-1 Hit Rate van 90,77% en minder hallucinaties.

Oorspronkelijke auteurs: Hyunseok Park, Jihyeon Kim, Jongeun Kim, Dongsik Yoon

Gepubliceerd 2026-04-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hyunseok Park, Jihyeon Kim, Jongeun Kim, Dongsik Yoon

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek hebt, maar in plaats van boeken, zitten er duizenden losse pagina's in. Je wilt een antwoord op een vraag, zoals "Hoe vervang ik het filter van mijn airco, model X-SERIES?".

Het probleem met de huidige systemen (die we RAG noemen) is dat ze deze bibliotheek vaak slecht ordenen. Als er in die bibliotheek 100 verschillende handleidingen liggen voor verschillende apparaten (airco's, ventilatoren, camera's), en je vraagt om een airco-filter, kan het systeem in de war raken. Het pakt misschien een pagina over een ventilator-filter of een pagina over een andere airco-modellen en denkt: "Oh, dit lijkt wel op wat de gebruiker zoekt!" Dit leidt tot fouten, verzonnen antwoorden (hallucinaties) en frustratie.

De auteurs van dit paper, Hyunseok Park en zijn team, hebben een nieuwe oplossing bedacht genaamd CHOP. Laten we uitleggen hoe dit werkt met een paar simpele analogieën.

Het Probleem: De "Losse Plakkaat"-Bibliotheek

Stel je voor dat je een handleiding voor een airco hebt, maar die is in stukjes van 500 woorden gesneden.

  • Stukje 1: "Dit is de airco, model 225B."
  • Stukje 2: "Vervang het filter."
  • Stukje 3: "Dit is de airco, model 226R." (Een heel ander apparaat!)

Als je de computer vraagt om het filter te vinden, en die kijkt alleen naar de tekst "filter", kan het zijn dat het systeem stukje 3 (van het verkeerde model) pakt, omdat het woord "filter" er ook in staat. De computer weet niet dat stukje 2 en 3 bij verschillende apparaten horen. Ze zijn als losse plakkaatjes zonder context.

De Oplossing: CHOP (De Slimme Boekbinder)

CHOP is als een super-slimme boekbinder die de losse plakkaatjes weer tot een logisch geheel maakt, maar dan in real-time. Het doet dit met twee slimme trucjes:

1. De "Naamplaatjes" (CNM-Extractor)

Voordat CHOP een stukje tekst opslaat in de database, plakt er een naamplaatje bovenop. Dit naamplaatje bevat drie cruciale dingen:

  • Categorie: Wat is het? (Bijv. Airco)
  • Namen: Wat is het specifieke onderdeel? (Bijv. Filter)
  • Model: Welk exact model is het? (Bijv. 225B)

Dit is alsof je bij elke pagina van de handleiding een sticker plakt met: "Airco - Filter - Model 225B".
Als je nu zoekt op "filter", ziet de computer direct: "Ah, dit is voor de 225B, niet voor de 226R!" Dit voorkomt dat de computer in de war raakt tussen vergelijkbare apparaten.

2. De "Vriendelijke Wachter" (Continuity Decision Module)

Nu komt het tweede deel. Stel, je hebt een handleiding die overgaat van "Airco 225B" naar "Airco 226R". Waar zit de grens?
CHOP gebruikt een slimme AI (een "wachter") die elke twee opeenvolgende stukjes tekst bekijkt en vraagt: "Horen deze twee bij elkaar, of is het een heel nieuw verhaal?"

  • Als het antwoord JA is: De AI zegt: "Oké, dit is nog steeds over de 225B." Hij neemt het naamplaatje van het vorige stukje en plakt dat ook op het nieuwe stukje. Zo blijft de context intact.
  • Als het antwoord NEE is: De AI zegt: "Wacht, dit is een nieuw model!" Hij pakt een nieuw naamplaatje voor het nieuwe model en plakt dat erop.

Dit zorgt ervoor dat de computer niet denkt dat een stukje tekst over een nieuw model nog steeds over het oude model gaat. Het houdt de "verhaallijn" schoon.

Waarom werkt dit zo goed?

In het paper hebben ze getest met echte handleidingen (zoals voor camera's en airco's).

  • De oude manier: De computer pakte vaak het verkeerde stukje tekst of zette het verkeerde antwoord bovenaan de lijst.
  • De CHOP-methode: Omdat elk stukje tekst nu een duidelijk "naamplaatje" heeft en de grenzen tussen verschillende modellen scherp zijn, vindt de computer het juiste antwoord veel sneller en plaatst het ook hoger in de lijst.

Het resultaat? De computer maakt veel minder fouten. In plaats van te zeggen: "Hier is een filter voor een airco" (en dan een verkeerd model te laten zien), zegt het: "Hier is het filter voor jouw specifieke airco."

Samenvattend

CHOP is als een slimme bibliothecaris die:

  1. Bij elk document een duidelijk etiket plakt (Wat is het? Welk model?).
  2. Kijkt of twee pagina's bij elkaar horen of niet, zodat je niet per ongeluk een pagina uit een ander boek pakt.

Hierdoor krijgt de AI de juiste informatie, maakt hij minder verzonnen antwoorden, en krijg jij als gebruiker een veel betrouwbaarder antwoord op je vraag. Het is een simpele maar slimme manier om de chaos in grote documenten op te ruimen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →