← Derniers articles
💬 NLP

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

PixelRAG introduit un nouveau cadre de génération augmentée par la récupération qui opère entièrement dans l'espace des pixels en récupérant et en traitant des captures d'écran brutes de sites web au lieu de texte analysé, éliminant ainsi la perte de mise en page et atteignant une performance et une efficacité supérieures sur divers benchmarks par rapport aux systèmes RAG traditionnels basés sur le texte.

Auteurs originaux : Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

Publié 2026-06-30
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de trouver un fait précis à l'intérieur d'une bibliothèque massive de millions de livres.

L'ancienne méthode (RAG basé sur le texte) : Le « Bibliothécaire aveugle »
Actuellement, la plupart des systèmes d'IA qui parcourent le web fonctionnent comme un bibliothécaire aveugle. Lorsque vous posez une question, le système prend d'abord une page web (qui est pleine d'images, de tableaux, de textes en gras et de boîtes colorées) et tente de la « lire » en supprimant tout le design visuel. Il transforme la page en une longue chaîne plate de texte brut, comme la transcription d'un discours.

Le problème ? Ce processus est désordonné. C'est comme essayer de comprendre une recette complexe en lisant uniquement la liste des ingrédients, mais en ignorant les photos du plat fini, les photos étape par étape ou le tableau indiquant les temps de cuisson.

  • La perte : Lorsque le système aplatit la page, il perd souvent la structure. Un tableau peut se transformer en un mélange confus de mots. Un graphique peut disparaître entièrement.
  • La confusion : Comme la version « texte » d'une page peut ressembler à beaucoup d'autres pages (avec de nombreux mots-clés identiques), le bibliothécaire peut prendre la mauvaise page ou le mauvais paragraphe, même si la bonne réponse se trouve juste là, dans une image ou un tableau qui a été aplati.

La nouvelle méthode (PIXELRAG) : L'« Enquêteur au regard d'aigle »
Les chercheurs derrière ce papier, PIXELRAG, ont posé une question simple : Pourquoi ne pas regarder la page web exactement telle qu'un humain la voit ?

Au lieu de transformer la page en texte, PIXELRAG prend une capture d'écran de la page web. Il traite l'internet comme une immense collection d'images.

  • La bibliothèque : Imaginez que la bibliothèque est désormais un mur de 30 millions de photos de pages web.
  • La recherche : Lorsque vous posez une question, le système ne cherche pas des mots-clés dans un fichier texte. Il utilise un « cerveau visuel » spécial (un modèle de langage-vision) pour trouver la capture d'écran qui ressemble à celle contenant la réponse. Il peut repérer un tableau, un graphique ou une mise en page spécifique simplement en regardant l'image.
  • La lecture : Une fois qu'il a trouvé la bonne capture d'écran, il transmet l'image directement au lecteur IA. Le lecteur regarde les pixels, lit le texte à l'intérieur de l'image et voit la structure du tableau exactement telle qu'elle a été conçue. Pas de traduction, pas d'aplatissement, aucune perte d'information.

Pourquoi c'est une grande avancée (Les analogies)

  1. Le « Problème du Tableau » :
    Imaginez un tableur avec une liste de statistiques sportives.
  • Méthode Texte : Le système lit : « Équipe A, 7, Équipe B, 0, Date, 22 mai... » Il perd la connexion indiquant que le « 7 » appartient à l'« Équipe A ».
  • Méthode Pixel : Le système voit une grille. Il sait instantanément que le « 7 » se trouve dans la colonne « Équipe A » parce qu'il voit les lignes et la mise en page.
  1. Le piège de l'« Infobox » :
    Sur Wikipédia, chaque article possède un encadré de résumé sur le côté (une infobox) avec des faits de base.
  • Méthode Texte : Lorsque le système transforme la page en texte, cet encadré de résumé devient un énorme bloc de mots-clés. Si vous demandez « Qui était le manager ? », le système pourrait saisir l'encadré de résumé car il est rempli de mots-clés, même si la réponse se trouve en réalité dans le paragraphe principal de l'histoire. L'infobox « noie » la véritable réponse.
  • Méthode Pixel : Le système voit que l'infobox est un petit encadré bordé sur le côté, et que l'histoire principale est un grand bloc de texte. Il sait ignorer l'encadré et regarder l'histoire principale, trouvant la réponse beaucoup plus rapidement.
  1. L'astuce de la « Compression » :
    Une découverte surprenante est que vous n'avez pas besoin de photos haute définition pour obtenir la réponse. Les chercheurs ont découvert qu'ils pouvaient réduire la taille des captures d'écran (comme transformer une photo 4K en une petite vignette) et l'IA pouvait toujours lire le texte parfaitement. C'est comme lire un journal depuis l'autre bout de la pièce ; vous n'avez pas besoin d'être tout près pour voir le titre. Cela rend le système beaucoup moins coûteux et plus rapide à exploiter.

Les Résultats
Le papier a testé cela sur des tests de questions-réponses célèbres. Même sur des tests conçus pour des questions uniquement textuelles, PIXELRAG a battu les systèmes basés sur le texte.

  • Il était meilleur pour trouver des réponses cachées dans des tableaux.
  • Il était meilleur pour ignorer le « bruit » (le texte non pertinent) qui confondait les anciens systèmes.
  • Il fonctionnait mieux sur les sites d'actualités et les documents complexes où les images et les mises en page sont cruciales.

En résumé
PIXELRAG cesse d'essayer de forcer l'internet dans une boîte de texte. Au lieu de cela, il embrasse l'internet tel qu'il est : un lieu visuel. En cherchant et en lisant directement à partir de captures d'écran, il évite les erreurs qui surviennent lorsqu'on tente de transformer une page web colorée et structurée en un paragraphe plat et ennuyeux. C'est comme passer de la lecture de la transcription d'un film au visionnage du film lui-même.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →