← Nieuwste papers
💬 NLP

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

PixelRAG introduceert een nieuw retrieval-augmented generation-framework dat volledig in de pixelruimte opereert door ruwe screenshots van websites op te halen en te verwerken in plaats van geparseerde tekst, waardoor lay-outverlies wordt geëlimineerd en een superieure prestatie en efficiëntie over diverse benchmarks wordt bereikt vergeleken met traditionele tekstgebaseerde RAG-systemen.

Oorspronkelijke auteurs: Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

Gepubliceerd 2026-06-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een specifiek feit te vinden in een enorme bibliotheek met miljoenen boeken.

De Oude Manier (Tekst-gebaseerde RAG): De "Blinde Bibliothecaris"
De meeste AI-systemen die het internet doorzoeken, werken momenteel als een blinde bibliothecaris. Wanneer je een vraag stelt, neemt het systeem eerst een webpagina (die vol staat met afbeeldingen, tabellen, vetgedrukte tekst en kleurrijke vakken) en probeert deze te "lezen" door alle visuele vormgeving weg te strippen. Het verandert de pagina in een lange, platte reeks gewone tekst, zoals een transcript van een toespraak.

Het probleem? Dit proces is rommelig. Het is alsof je een complex recept probeert te begrijpen door alleen de ingrediëntenlijst te lezen, terwijl je de foto's van het voltooide gerecht, de stap-voor-stap foto's of de tabel met bereidingstijden negeert.

  • Het Verlies: Wanneer het systeem de pagina afvlakt, gaat de structuur vaak verloren. Een tabel kan veranderen in een chaotische brij van woorden. Een grafiek kan volledig verdwijnen.
  • De Verwarring: Omdat de "tekstversie" van een pagina vaak erg lijkt op andere pagina's (veel van dezelfde trefwoorden), kan de bibliothecaris de verkeerde pagina of het verkeerde tekstblok pakken, zelfs als het juiste antwoord vlak voor zijn neus staat in een afbeelding of een tabel die is afgevlakt.

De Nieuwe Manier (PIXELRAG): De "Scherpzinnige Detective"
De onderzoekers achter dit paper, PIXELRAG, stelden een simpele vraag: Waarom kijken we niet gewoon naar de webpagina precies zoals een mens dat doet?

In plaats van de pagina om te zetten in tekst, maakt PIXELRAG een screenshot van de webpagina. Het behandelt het internet als een enorme collectie afbeeldingen.

  • De Bibliotheek: Stel je voor dat de bibliotheek nu een muur is van 30 miljoen foto's van webpagina's.
  • De Zoektocht: Wanneer je een vraag stelt, zoekt het systeem niet naar trefwoorden in een tekstbestand. Het gebruikt een speciaal "visueel brein" (een Vision-Language Model) om de screenshot te vinden die eruit ziet alsof deze het antwoord bevat. Het kan een tabel, een grafiek of een specifieke lay-out herkennen door simpelweg naar de afbeelding te kijken.
  • Het Lezen: Zodra het de juiste screenshot heeft gevonden, geeft het de afbeelding direct door aan de AI-lezer. De lezer kijkt naar de pixels, leest de tekst binnen de afbeelding en ziet de tabelstructuur precies zoals deze is ontworpen. Geen vertaling, geen afvlakking, geen informatieverlies.

Waarom dit een Groot Ding is (De Analogieën)

  1. Het "Tabel"-probleem:
    Stel je een spreadsheet voor met een lijst van sportstatistieken.
  • De Tekst-manier: Het systeem leest het als: "Team A, 7, Team B, 0, Datum, 22 mei..." Het verliest de connectie dat "7" bij "Team A" hoort.
  • De Pixel-manier: Het systeem ziet een raster. Het weet direct dat de "7" in de kolom van "Team A" staat, omdat het de lijnen en de lay-out ziet.
  1. De "Infobox"-valstrik:
    Op Wikipedia heeft elk artikel een samenvatting aan de zijkant (een infobox) met basisfeiten.
  • De Tekst-manier: Wanneer het systeem de pagina omzet in tekst, wordt deze samenvatting een enorme blok trefwoorden. Als je vraagt "Wie was de manager?", kan het systeem de samenvatting pakken omdat deze vol zit met trefwoorden, zelfs als het antwoord eigenlijk in de hoofdtekst van het verhaal staat. De samenvatting "overstemt" het echte antwoord.
  • De Pixel-manier: Het systeem ziet dat de samenvatting een klein, omlijnd vak aan de zijkant is en dat het hoofdverhaal een groot tekstblok is. Het weet de box te negeren en naar het hoofdverhaal te kijken, waardoor het het antwoord veel sneller vindt.
  1. De "Compressie"-truc:
    Een verrassende bevinding is dat je geen foto's met een hoge definitie nodig hebt om het antwoord te krijgen. De onderzoekers ontdekten dat ze de screenshots konden verkleinen (zoals het omzetten van een 4K-foto naar een kleine thumbnail) en de AI de tekst nog steeds perfect kon lezen. Dit is alsof je een krant van een afstandje leest; je hoeft niet heel dichtbij te staan om de kop te kunnen zien. Dit maakt het systeem veel goedkoper en sneller in gebruik.

De Resultaten
Het paper testte dit op beroemde vraag-antwoord-tests. Zelfs op tests die ontworpen waren voor alleen tekst, versloeg PIXELRAG de tekstgebaseerde systemen.

  • Het was beter in het vinden van antwoorden die verborgen zaten in tabellen.
  • Het was beter in het negeren van "ruis" (irrelevante tekst) die de oude systemen in verwarring bracht.
  • Het werkte beter op nieuwssites en complexe documenten waar afbeeldingen en lay-outs belangrijk zijn.

In een Notendop
PIXELRAG stopt met proberen het internet in een tekstvak te dwingen. In plaats daarvan omarmt het het internet zoals het is: een visuele plek. Door rechtstreeks vanaf screenshots te zoeken en te lezen, vermijdt het de fouten die ontstaan wanneer je probeert een kleurrijke, gestructureerde webpagina om te vormen tot een saaie, platte paragraaf. Het is alsof je overstapt van het lezen van een transcript van een film naar het daadwerkelijk bekijken van de film.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →