AB
AiBoss站
project

PixelRAG - 伯克利开源的视觉原生 RAG 框架

PixelRAG 是伯克利 SkyLab/BAIR 开源的视觉原生 RAG 框架。框架跳出网页抽成纯文本再检索的传统路线,改用浏览器把网页、PDF 渲染成截图瓦片,通过 LoRA 微调...

PixelRAG是什么

PixelRAG 是伯克利 SkyLab/BAIR 开源的视觉原生 RAG 框架。框架跳出网页抽成纯文本再检索的传统路线,改用浏览器把网页、PDF 渲染成截图瓦片,通过 LoRA 微调的 Qwen3-VL 视觉向量检索,让模型直接读图上的表格、图表和版式,解决传统 RAG 丢表格、丢版式的痛点。

PixelRAG的主要功能

  • 页面渲染(pixelshot):用无头 Chromium把网页、PDF 渲染成截图瓦片,完整保留表格、图表、版式;Windows/macOS 自动调用系统 Chrome,支持 URL 与本地文件混用。
  • 视觉语义检索:将截图编码为向量,支持文本搜图、以图搜图;本地默认 FAISS,大规模可切换 Qdrant(支持量化压缩、磁盘存储、多服务共享)。
  • 像素直接阅读:检索命中的截图直接作为图像输入喂给 VLM 回答问题,全程无文本转换。
  • 托管搜索服务:免密钥 API+ 网页 Demo,内置 828 万维基百科页预建索引,开箱即搜。
  • 自建索引管线pixelrag index / embed / build-index / serve 全套命令,可对自己的 PDF、站点建库,Mac(Apple Silicon)即可跑小规模。
  • Agent 集成:Claude Code 插件 pixelbrowse,无 MCP 依赖,让 Claude 截图”看”网页而非吞残缺 HTML。

PixelRAG的技术原理

  • 表示层——文档即图像:用无头 Chromium 把网页截图、把 PDF 按页转图并切分为瓦片,使表格行列对齐、图表、信息图等视觉结构原样保留。
  • 检索层——视觉向量嵌入:基于 Qwen3-VL-Embedding-2B,用对比学习数据做 LoRA 微调,让截图可被语义检索,查询命中的是”那一块图”而非”那一段字”;向量本地存 FAISS,大规模可切 Qdrant。
  • 生成层——VLM 读图作答:检索命中的截图瓦片直接作为像素输入交给视觉语言模型,模型从图上直接读数字和版式,全程无中间文本转换。
  • 规模与效率:首个用截图形式覆盖全量维基百科的 RAG 管线;像素表示还带来新的效率杠杆——降低截图分辨率可使 token 成本最多降 3 倍且精度不降,实验上全面超越文本 RAG 基线,最高提升 18.1%。

微信关注回复“开源”,加入AI开源项目交流群

如何使用PixelRAG

  • 安装:执行 pip install pixelrag 即可获得核心工具(需 Python 3.10+)。
  • 渲染页面:运行 pixelshot https://example.com -o ./tiles 将网页或 PDF 渲染为截图瓦片。
  • 体验托管搜索:无需任何配置,直接 POST 请求 https://api.pixelrag.ai/search 即可搜索 828 万维基页索引,或在浏览器打开 pixelrag.ai 在线试用。
  • 自建索引:编写 pixelrag.yaml 配置(指定文档路径、嵌入模型、输出目录),执行 pixelrag index build 构建后,用 pixelrag serve --index-dir ./my_index --port 30001 启动搜索服务(Mac Apple Silicon 即可跑小规模,全量维基索引约 217GB 需 GPU 算力)。
  • 对接 Claude Code:执行 uv tool install pixelrag 后安装 pixelbrowse 插件(claude plugin marketplace add StarTrail-org/PixelRAGclaude plugin install pixelbrowse@pixelrag-plugins),即可让 Claude 截图”看”网页,无需 MCP。
  • 进阶训练:如需自研嵌入模型,进入 train/ 目录(独立 uv 项目)按 README 微调,或直接复用官方开源的 LoRA 权重与训练数据。

PixelRAG的核心优势

  • 信息无损:以截图代替文本抽取,表格行列、图表、版式完整保留,彻底解决传统 RAG看起来有答案、抽完字就没了的痛点。
  • 性能更强:论文显示其全面超越文本 RAG 基线,在 NQ、SimpleQA 等纯文本任务上同样更优,多模态与 Agentic 基准最高提升 18.1%。
  • 成本更低:像素表示带来独有的效率杠杆,降低截图分辨率可使 token 成本最多降 3 倍且精度不降。
  • 管线更简单:省去复杂的 HTML 解析、清洗、切分流程,渲染截图即可入库,工程量大幅缩减。
  • 规模已验证:是首个用截图形式覆盖全量维基百科的 RAG 管线,附带 828 万页的免密钥托管索引可即刻体验。

PixelRAG的项目地址

  • 项目官网:https://pixelrag.ai/
  • GitHub仓库:https://github.com/StarTrail-org/PixelRAG
  • arXiv技术论文:https://arxiv.org/pdf/2606.28344

PixelRAG的同类竞品对比

对比维度 PixelRAG ColPali
出品方 伯克利 SkyLab / BAIR / NLP Group(2026) Illuin 科技(2024)
基座模型 Qwen3-VL-Embedding-2B + LoRA 微调 PaliGemma(后续有 ColQwen2.5 变体)
检索对象 网页截图为主,兼容 PDF PDF 等静态文档页面图像
嵌入粒度 单向量:每块截图对应一个向量 Late-interaction:每页保留上千个 patch 级向量
存储成本 单向量方案,存储效率高,易扩展 每页约 256KB,大规模部署压力大
索引规模 已验证覆盖全量维基百科,3000 万张截图 公开验证以万级页码基准为主
检索精度 在 NQ、SimpleQA、MMSearch 等开放域任务全面超越文本基线,最高提升 18.1% 版面密集型文档细粒度匹配精度占优,长期占据 ViDoRe 榜首
token 效率 降低截图分辨率可降最多 3 倍 token 成本且精度不降 无图像压缩效率杠杆
工程生态 全栈工具链:渲染、嵌入、索引、托管 API、Claude Code 插件 提供模型与评测代码,检索服务需自建

PixelRAG的应用场景

  • 财报与数据表问答:直接读取财报页、统计表中的数字,避免文本解析导致的行列错位。
  • 仪表盘与图表检索:检索命中包含图表、KPI 面板的截图区域,让模型读图作答。
  • 信息图与带图解文档:信息图、流程图等传统文本索引无法覆盖的内容可被搜索。
  • 多栏排版产品页:复杂版式的商品对比页、新闻页保持原始布局参与检索。
  • Agent 网页阅读:通过 Claude Code 的 pixelbrowse 插件,让 Agent 截图”看”网页而非吞残缺 HTML。