PixelRAG:让 AI 直接理解网页截图的开源视觉 RAG 框架
摘要
PixelRAG 是一个开源视觉 RAG 项目,它突破传统网页文本解析方式,让 AI 通过截图理解网页结构、表格和视觉信息。该项目探索了多模态模型时代知识检索的新方向,为智能搜索和 AI Agent 提供新的技术思路。
PixelRAG是一个探索下一代检索增强生成(RAG)的开源项目,它提出了一种不同于传统文本检索的思路:让 AI不再只读取网页解析后的文字,而是直接理解网页截图中的视觉信息。这个项目的核心论文《PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation》来自 Berkeley SkyLab、BAIR和 Berkeley NLP等团队,项目代码以 Apache 2.0协议开源。

图片来源:github.com
传统 RAG系统一般会先把网页 HTML转换成纯文本,再进行切片、向量化和检索。但网页本身并不是只有文字,很多关键信息依赖页面结构存在,例如表格布局、图表关系、卡片排列、导航层级以及视觉强调区域。PixelRAG认为,这种文本化过程会丢失大量上下文,因此选择保留网页原始视觉形态。
PixelRAG的方法是将网页、PDF和图片等内容渲染成截图,再把这些视觉内容切分成可检索的图像单元,通过视觉嵌入模型建立索引。当用户提出问题时,系统检索相关截图区域,并直接交给视觉语言模型进行理解。这样一来,AI获取的信息更接近人类浏览网页时看到的内容。
项目展示了视觉检索在复杂网页场景中的潜力,尤其适合包含大量表格、流程图、数据图表、产品页面和复杂排版的资料库。相比依赖 HTML解析的传统方案,PixelRAG希望减少内容抽取过程中的信息损失,让 RAG系统从“读取网页文字”转向“理解网页本身”。
目前 PixelRAG主要面向研究人员和 AI工程开发者,项目包含视觉索引、检索流程以及相关工具链。开发者可以利用它构建自己的视觉知识库,也可以探索视觉 Agent如何处理真实互联网内容。
随着多模态模型能力提升,未来 AI获取知识的方式可能不再局限于文本。PixelRAG所代表的方向,是让模型直接理解数字世界中的视觉结构,为网页搜索、文档分析、智能助手和自动化 Agent提供新的技术路线。

图片来源:github.com
同类栏目导航