project
PixelRAG - バークレーを拠点とするオープンソースのビジュアルネイティブRAGフレームワーク
PixelRAGは、バークレーのSkyLab/BAIRが開発したオープンソースのネイティブビジュアルRAGフレームワークです。従来のウェブページをプレーンテキストに抽出して取得するアプローチとは異なり、このフレームワークはブラウザを使用してウェブページやPDFをスクリーンショットタイルにレンダリングし、LoRAを使用して微調整します。
PixelRAGとは何ですか?
PixelRAGは、Berkeley SkyLab/BAIRが開発したオープンソースのネイティブビジュアルRAGフレームワークです。従来のウェブページをプレーンテキストに抽出して検索する手法とは異なり、このフレームワークはブラウザを使用してウェブページやPDFをスクリーンショットタイルにレンダリングします。LoRAで調整されたQwen3-VLビジュアルベクター検索により、画像上の表、グラフ、レイアウトを直接読み取ることができ、従来のRAGが抱えていた表やレイアウトの欠落という問題を解決します。
PixelRAGの主な機能
-
ページレンダリング(ピクセルショット)ヘッドレスChromiumを使用して、WebページやPDFをスクリーンショットタイルにレンダリングし、表、グラフ、レイアウトを完全に保持します。Windows/macOSでは、システムChromeが自動的に呼び出され、URLとローカルファイルの混在をサポートします。
-
視覚的意味検索スクリーンショットをベクトルにエンコードし、テキストベースおよび画像ベースの画像検索をサポートします。デフォルトではローカル環境ではFAISSを使用し、大規模な環境ではQdrantに切り替えることができます(量子化圧縮、ディスクストレージ、マルチサービス共有をサポート)。
-
ピクセル直接読み取り検索中に見つかったスクリーンショットは、テキスト変換されることなく、画像入力として直接VLMに送られ、質問への回答に使用されます。
-
マネージド検索サービスキーレスAPIとウェブページデモ。828万ページのWikipediaインデックスが組み込まれており、すぐに検索が可能です。
-
自作のインデックスパイプライン:
pixelrag index / embed / build-index / serve一連のコマンドを使用すれば、独自のPDFやWebサイト用のライブラリを作成でき、Mac(Apple Silicon)上で小規模に実行することも可能です。 -
エージェント統合Claude Code プラグインの pixelbrowse は、MCP に依存しないため、不完全な HTML を読み込む代わりにスクリーンショットを撮ることで、Claude が Web ページを「閲覧」することを可能にします。
PixelRAGの技術的原理
- プレゼンテーション層 - 画像としてドキュメントを読み込むヘッドレスChromiumを使用してWebページのスクリーンショットを撮影し、PDFをページごとに画像に変換してタイル状に分割することで、表、グラフ、インフォグラフィックなどの視覚構造をそのまま保持します。
- 検索レイヤー - ビジュアルベクター埋め込みQwen3-VL-Embedding-2BをベースとしたLoRAの微調整は、対照学習データを使用して実行され、スクリーンショットを意味的に検索可能にし、「どのテキスト段落」ではなく「画像のどの部分」にクエリがヒットするようにします。ベクトルはFAISSにローカルに保存され、Qdrantは大規模にスライスできます。
- 生成レイヤー – VLM(ビジュアルモデル) – 図に基づいて質問に答える取得したスクリーンショットのタイルは、ピクセル入力として直接ビジュアル言語モデルに渡され、中間的なテキスト変換を行うことなく、画像から直接数値やレイアウトを読み取ります。
- 規模と効率スクリーンショットを使用してWikipediaページ全体をカバーする初のRAGパイプライン。ピクセル表現により新たな効率化も実現。スクリーンショットの解像度を下げることで、精度を落とすことなくトークンコストを最大3分の1に削減でき、実験ではテキストRAGベースラインを包括的に上回り、最大18.1%の改善を達成。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
PixelRAGの使い方
- インストール:埋め込む
pip install pixelragそうすれば、コアツール(Python 3.10以降が必要)を入手できます。 - ページをレンダリングしています:走る
pixelshot https://example.com -o ./tilesウェブページやPDFをスクリーンショットタイルとしてレンダリングします。 - ホスト型検索を体験する設定は不要です。直接POSTリクエストを送信するだけです。
https://api.pixelrag.ai/search828万ページあるWikipediaを検索することもできますし、ブラウザでpixelrag.aiを開いてオンラインで試してみることもできます。 - 自作の索引:書く
pixelrag.yaml設定(ドキュメントパス、埋め込みモデル、出力ディレクトリを指定)して実行します。pixelrag index build組み立て後、pixelrag serve --index-dir ./my_index --port 30001検索サービスを開始します(小規模であればMac Apple Silicon上で実行できますが、約217GBのWikipediaの完全なインデックスを実行するにはGPUの処理能力が必要です)。 - Claude Codeに接続中:埋め込む
uv tool install pixelrag次にpixelbrowseプラグインをインストールします(claude plugin marketplace add StarTrail-org/PixelRAGそしてclaude plugin install pixelbrowse@pixelrag-pluginsこれにより、クロードはMCPなしでスクリーンショットを撮ったり、ウェブページを「閲覧」したりすることができる。 - 高度なトレーニング独自の組み込みモデルを開発する必要がある場合は、[リンク/参考資料]を参照してください。
train/目次(独立したUVプロジェクト)はREADMEに従って若干修正することも、公式のオープンソースLoRAの重みとトレーニングデータをそのまま再利用することもできます。
PixelRAGの主な利点
- 情報ロスレステキスト抽出をスクリーンショットに置き換えることで、表の行、列、グラフ、レイアウト全体を保持し、テキスト抽出後に回答が消えてしまうように見える従来のRAGの問題点を完全に解決します。
- より強力にこの論文では、この手法がテキストRAGベースラインを包括的に上回り、NQやSimpleQAなどの純粋なテキストタスクにおいても優れており、マルチモーダルおよびエージェントベンチマークでは最大18.1%の改善が見られることが示されている。
- 低コストピクセル表現は独自の効率上の利点を提供します。スクリーンショットの解像度を下げることで、精度を損なうことなくトークンコストを最大3分の1に削減できます。
- よりシンプルなパイプライン複雑なHTMLの解析、クリーニング、セグメンテーション処理が不要になり、スクリーンショットをレンダリングしてデータベースに保存するだけで済むため、作業負荷が大幅に軽減されます。
- スケールが検証されましたこれは、Wikipediaのページ全体をスクリーンショット形式で網羅する初のRAGパイプラインであり、すぐに使用できる828万ページのキーレスエスクローインデックスが付属しています。
PixelRAGプロジェクトのアドレス
- プロジェクト公式サイト:https://pixelrag.ai/
- GitHubリポジトリ:https://github.com/StarTrail-org/PixelRAG
- arXiv技術論文:https://arxiv.org/pdf/2606.28344
PixelRAGと類似製品との比較
| 比較対象寸法 | PixelRAG | ColPali |
|---|---|---|
| プロデューサー | バークレー・スカイラボ/BAIR/NLPグループ(2026年) | イルイン・テクノロジー(2024年) |
| 基本モデル | Qwen3-VL-Embedding-2B + LoRA ファインチューニング | PaliGemma(後の派生版ColQwen2.5を含む) |
| 検索対象 | 主にウェブページのスクリーンショットに対応していますが、PDFにも対応しています。 | PDFなどの静的な文書ページ画像 |
| 埋め込みの粒度 | 単一ベクトル:各スクリーンショットは1つのベクトルに対応します。 | 遅延インタラクション:1ページあたり数千のパッチレベルベクトルを保持します。 |
| 保管コスト | 単一ベクトル方式は、高い記憶効率と容易な拡張性を提供します。 | 各ページは約256KBであり、大規模な展開においては大きな課題となる。 |
| インデックスサイズ | Wikipediaページ全体を網羅した検証済みのカバレッジ、3000万枚のスクリーンショット。 | 公開検証は主に数万ページというページ数に基づいて行われる。 |
| 検索精度 | NQ、SimpleQA、MMSearchなどのオープン領域タスクにおいて、テキストベースラインを上回り、最大18.1%の改善を達成した。 | レイアウトが複雑な文書の場合、きめ細かなマッチング精度が優れており、ViDoReランキングで常に上位にランクインしています。 |
| トークン効率 | スクリーンショットの解像度を下げることで、精度を損なうことなくトークンコストを最大3分の1に削減できます。 | 画像圧縮効率レバーなし |
| 工学生態学 | フルスタックツールチェーン:レンダリング、埋め込み、インデックス作成、マネージドAPI、Claude Codeプラグイン | モデルと評価コードを提供してください。検索サービスは別途構築する必要があります。 |
PixelRAGの応用シナリオ
- 財務諸表とデータ表に関するQ&A財務諸表や統計表から数値を直接読み取るため、テキスト解析によって生じる行と列のずれを回避できます。
- ダッシュボードとチャートの検索検索機能は、グラフやKPIパネルを含むスクリーンショットを取得し、モデルが画像を解釈して回答を提供できるようにします。
- インフォグラフィックと図解入り文書インフォグラフィックやフローチャートなど、従来のテキスト索引では網羅できないコンテンツも検索できます。
- 複数列の製品ページ複雑な製品比較ページやニュースページは、検索結果表示のために元のレイアウトを維持する必要があります。
- エージェントのウェブページを読むClaude Code氏のpixelbrowseプラグインを使用することで、エージェントは不完全なHTMLを読み込む代わりに、スクリーンショットを撮ってウェブページを「見る」ことができる。