← 最新论文
💬 NLP

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

PixelRAG 引入了一种全新的检索增强生成框架,该框架完全在像素空间内运行,通过检索和处理原始网站截图而非解析后的文本来进行操作,从而消除了布局丢失问题,并且与传统的基于文本的 RAG 系统相比,在各种基准测试中实现了更卓越的性能和效率。

原作者: Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一座拥有数百万本书籍的巨型图书馆中寻找一个特定的事实。

旧方法(基于文本的 RAG):“盲人图书管理员”
目前,大多数 AI 系统在搜索网页时,其工作方式就像一位盲人图书管理员。当你提出问题时,系统首先获取一个网页(其中充满了图片、表格、加粗文本和彩色方框),然后尝试通过剥离所有的视觉设计来“阅读”它。它将页面转化为一段长长的、平铺的纯文本字符串,就像一份演讲稿的转录文本一样。

问题在于,这个过程非常混乱。这就像是试图通过阅读一份配料表来理解一道复杂的食谱,却忽略了成品图、分步照片或显示烹饪时间的表格。

  • 信息的丢失: 当系统将页面“扁平化”时,它往往会丢失结构。一个表格可能会变成一堆乱七八糟的单词;一个图表可能会完全消失。
  • 造成的困惑: 因为页面的“文本”版本看起来往往与其他页面非常相似(充满了相同的关键词),图书管理员可能会抓错页面或抓错段落,即便正确的答案就坐在那张被扁平化的图片或表格里。

新方法 (PIXELRAG):“鹰眼侦探”
这项论文背后的研究人员提出了一个简单的问题:为什么我们不直接按照人类看到网页的方式去观察它呢?

PIXELRAG 没有将页面转化为文本,而是对网页进行截图。它将互联网视为一个巨大的图像集合。

  • 图书馆: 想象一下,这座图书馆现在是一面挂满了 3000 万张网页照片的墙。
  • 搜索: 当你提问时,系统不再在文本文件中搜索关键词。它使用一种特殊的“视觉大脑”(视觉语言模型)来寻找那张看起来包含答案的截图。它仅凭观察图片,就能识别出其中的表格、图表或特定的布局。
  • 阅读: 一旦它找到了正确的截图,它会将图像直接交给 AI 阅读器。阅读器观察像素,读取图像中的文本,并看到设计时的表格结构。没有转换,没有扁平化,信息没有丢失。

为什么这很重要(类比说明)

  1. “表格”问题:
    想象一张带有运动统计数据的电子表格。
  • 文本方式: 系统将其读作:“A 队,7,B 队,0,日期,5 月 22 日……” 它丢失了“7”属于“A 队”这一关联。
  • 像素方式: 系统看到了一个网格。因为它看到了线条和布局,它能瞬间明白“7”位于“A 队”这一列。
  1. “信息框”陷阱:
    在维基百科上,每篇文章都有一个侧边的摘要框(信息框),其中包含基本事实。
  • 文本方式: 当系统将页面转化为文本时,这个摘要框变成了一个巨大的关键词块。如果你问“谁是经理?”,系统可能会因为摘要框充满了关键词而抓取它,即便真正的答案其实是在正文段落里。摘要框会“淹没”掉真正的答案。
  • 像素方式: 系统看到摘要框是侧边的一个带边框的小盒子,而正文是一个大的文本块。它知道应该忽略那个盒子并看向正文,从而更快地找到答案。
  1. “压缩”技巧:
    一个令人惊讶的发现是,你并不需要高清晰度的照片也能获得答案。研究人员发现,他们可以将截图缩小(就像把 4K 照片变成缩略图),AI 仍然可以完美地阅读其中的文字。这就像是从房间另一头看报纸:你不需要凑得非常近也能看到标题。这使得该系统的运行成本更低,速度更快。

研究结果
该论文在著名的问答测试中对其进行了测试。即使是在那些专为纯文本问题设计的测试中,PIXELRAG 也击败了基于文本的系统。

  • 它更擅长寻找隐藏在表格中的答案。
  • 它更擅长忽略那些会让旧系统感到困惑的“噪声”(无关文本)。
  • 它在新闻网站和布局及图片至关重要的复杂文档上表现更好。

总结
PIXELRAG 不再试图将互联网强行塞进一个文本框里。相反,它拥抱了互联网原本的样子:一个视觉化的世界。通过直接从截图进行搜索和阅读,它避免了试图将色彩斑斓、具有结构的网页转化为枯燥、平铺的段落时所产生的错误。这就像是从阅读电影的文字剧本,转变为直接观看电影。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →