project
PixelRAG - 伯克利开源的视觉原生 RAG 框架
PixelRAG 是伯克利 SkyLab/BAIR 开源的视觉原生 RAG 框架。框架跳出网页抽成纯文本再检索的传统路线,改用浏览器把网页、PDF 渲染成截图瓦片,通过 LoRA 微调...
PixelRAG是什么
PixelRAG 是伯克利 SkyLab/BAIR 开源的视觉原生 RAG 框架。框架跳出网页抽成纯文本再检索的传统路线,改用浏览器把网页、PDF 渲染成截图瓦片,通过 LoRA 微调的 Qwen3-VL 视觉向量检索,让模型直接读图上的表格、图表和版式,解决传统 RAG 丢表格、丢版式的痛点。
PixelRAG的主要功能
-
页面渲染(pixelshot):用无头 Chromium把网页、PDF 渲染成截图瓦片,完整保留表格、图表、版式;Windows/macOS 自动调用系统 Chrome,支持 URL 与本地文件混用。
-
视觉语义检索:将截图编码为向量,支持文本搜图、以图搜图;本地默认 FAISS,大规模可切换 Qdrant(支持量化压缩、磁盘存储、多服务共享)。
-
像素直接阅读:检索命中的截图直接作为图像输入喂给 VLM 回答问题,全程无文本转换。
-
托管搜索服务:免密钥 API+ 网页 Demo,内置 828 万维基百科页预建索引,开箱即搜。
-
自建索引管线:
pixelrag index / embed / build-index / serve全套命令,可对自己的 PDF、站点建库,Mac(Apple Silicon)即可跑小规模。 -
Agent 集成:Claude Code 插件 pixelbrowse,无 MCP 依赖,让 Claude 截图”看”网页而非吞残缺 HTML。
PixelRAG的技术原理
- 表示层——文档即图像:用无头 Chromium 把网页截图、把 PDF 按页转图并切分为瓦片,使表格行列对齐、图表、信息图等视觉结构原样保留。
- 检索层——视觉向量嵌入:基于 Qwen3-VL-Embedding-2B,用对比学习数据做 LoRA 微调,让截图可被语义检索,查询命中的是”那一块图”而非”那一段字”;向量本地存 FAISS,大规模可切 Qdrant。
- 生成层——VLM 读图作答:检索命中的截图瓦片直接作为像素输入交给视觉语言模型,模型从图上直接读数字和版式,全程无中间文本转换。
- 规模与效率:首个用截图形式覆盖全量维基百科的 RAG 管线;像素表示还带来新的效率杠杆——降低截图分辨率可使 token 成本最多降 3 倍且精度不降,实验上全面超越文本 RAG 基线,最高提升 18.1%。
微信关注回复“开源”,加入AI开源项目交流群
如何使用PixelRAG
- 安装:执行
pip install pixelrag即可获得核心工具(需 Python 3.10+)。 - 渲染页面:运行
pixelshot https://example.com -o ./tiles将网页或 PDF 渲染为截图瓦片。 - 体验托管搜索:无需任何配置,直接 POST 请求
https://api.pixelrag.ai/search即可搜索 828 万维基页索引,或在浏览器打开 pixelrag.ai 在线试用。 - 自建索引:编写
pixelrag.yaml配置(指定文档路径、嵌入模型、输出目录),执行pixelrag index build构建后,用pixelrag serve --index-dir ./my_index --port 30001启动搜索服务(Mac Apple Silicon 即可跑小规模,全量维基索引约 217GB 需 GPU 算力)。 - 对接 Claude Code:执行
uv tool install pixelrag后安装 pixelbrowse 插件(claude plugin marketplace add StarTrail-org/PixelRAG并claude plugin install pixelbrowse@pixelrag-plugins),即可让 Claude 截图”看”网页,无需 MCP。 - 进阶训练:如需自研嵌入模型,进入
train/目录(独立 uv 项目)按 README 微调,或直接复用官方开源的 LoRA 权重与训练数据。
PixelRAG的核心优势
- 信息无损:以截图代替文本抽取,表格行列、图表、版式完整保留,彻底解决传统 RAG看起来有答案、抽完字就没了的痛点。
- 性能更强:论文显示其全面超越文本 RAG 基线,在 NQ、SimpleQA 等纯文本任务上同样更优,多模态与 Agentic 基准最高提升 18.1%。
- 成本更低:像素表示带来独有的效率杠杆,降低截图分辨率可使 token 成本最多降 3 倍且精度不降。
- 管线更简单:省去复杂的 HTML 解析、清洗、切分流程,渲染截图即可入库,工程量大幅缩减。
- 规模已验证:是首个用截图形式覆盖全量维基百科的 RAG 管线,附带 828 万页的免密钥托管索引可即刻体验。
PixelRAG的项目地址
- 项目官网:https://pixelrag.ai/
- GitHub仓库:https://github.com/StarTrail-org/PixelRAG
- arXiv技术论文:https://arxiv.org/pdf/2606.28344
PixelRAG的同类竞品对比
| 对比维度 | PixelRAG | ColPali |
|---|---|---|
| 出品方 | 伯克利 SkyLab / BAIR / NLP Group(2026) | Illuin 科技(2024) |
| 基座模型 | Qwen3-VL-Embedding-2B + LoRA 微调 | PaliGemma(后续有 ColQwen2.5 变体) |
| 检索对象 | 网页截图为主,兼容 PDF | PDF 等静态文档页面图像 |
| 嵌入粒度 | 单向量:每块截图对应一个向量 | Late-interaction:每页保留上千个 patch 级向量 |
| 存储成本 | 单向量方案,存储效率高,易扩展 | 每页约 256KB,大规模部署压力大 |
| 索引规模 | 已验证覆盖全量维基百科,3000 万张截图 | 公开验证以万级页码基准为主 |
| 检索精度 | 在 NQ、SimpleQA、MMSearch 等开放域任务全面超越文本基线,最高提升 18.1% | 版面密集型文档细粒度匹配精度占优,长期占据 ViDoRe 榜首 |
| token 效率 | 降低截图分辨率可降最多 3 倍 token 成本且精度不降 | 无图像压缩效率杠杆 |
| 工程生态 | 全栈工具链:渲染、嵌入、索引、托管 API、Claude Code 插件 | 提供模型与评测代码,检索服务需自建 |
PixelRAG的应用场景
- 财报与数据表问答:直接读取财报页、统计表中的数字,避免文本解析导致的行列错位。
- 仪表盘与图表检索:检索命中包含图表、KPI 面板的截图区域,让模型读图作答。
- 信息图与带图解文档:信息图、流程图等传统文本索引无法覆盖的内容可被搜索。
- 多栏排版产品页:复杂版式的商品对比页、新闻页保持原始布局参与检索。
- Agent 网页阅读:通过 Claude Code 的 pixelbrowse 插件,让 Agent 截图”看”网页而非吞残缺 HTML。