project
pplx-embed - Perplexityが開発した一連のテキスト埋め込みモデル
pplx-embedは、Perplexityが開発した一連のテキスト埋め込みモデルで、標準的な検索用のpplx-embed-v1と、コンテキスト認識用のpplx-embed-context-v1があり、どちらも0.6Bと4Bのサイズで利用可能です。
pplx-embedとは何ですか?
pplx-embed は Perplexity が提供するテキスト埋め込みモデルシリーズで、標準的な検索用の pplx-embed-v1 とコンテキスト認識用の pplx-embed-context-v1 があり、どちらも 0.6B と 4B のサイズで利用可能です。このモデルは、拡散連続事前学習によって因果デコーダを双方向エンコーダに変換し、全方向の注意理解を実現します。INT8 とバイナリ量子化出力をネイティブにサポートし、ストレージ圧縮率は最大 32 倍です。このモデルは、命令プレフィックスなしの MTEB や ConTEB などのベンチマークで最先端のパフォーマンスを達成し、4B コンテキストモデルは ConTEB で 81.96% という新記録を樹立しました。
pplx-embedの主な機能
-
高密度テキスト検索これは、クエリとドキュメントを共有された意味空間にマッピングすることで、最近傍検索による効率的な検索を可能にする。
-
コンテキスト認識型埋め込みこの手法は、文書内の各段落に対して、全文の文脈を考慮した埋め込み表現を生成することで、孤立した段落の意味理解が不十分であるという問題を解決します。
-
多言語対応このモデルは30言語における多言語検索に対応しており、グローバルなアプリケーションシナリオのニーズを満たしています。
-
高効率ストレージ圧縮ネイティブに生成されたINT8およびバイナリ精度埋め込みは、FP32と比較して、それぞれストレージ要件を4分の1および32分の1に削減します。
-
リアルタイム低遅延推論軽量版の0.6Bは、高速処理シナリオ向けに最適化されており、速度と精度をバランスよく両立させています。
pplx-embedの技術原理
- 拡散ベースの連続事前トレーニングQwen3ベースモデルに基づき、因果的注意マスキングを無効にし、拡散ノイズ除去を使用してランダムマスクのトークンを再構築するようにモデルをトレーニングし、モデルが理解のために双方向コンテキストを使用するように強制し、自己回帰デコーダを双方向エンコーダに変換します。
- 定量的知覚トレーニング対照学習フェーズでは、INT8精度が全体を通して使用されます。微分可能な量子化は、tanh平均プーリングとパススルー勾配推定を組み合わせることで実現され、モデルが低精度に適した表現をネイティブに学習し、後処理圧縮による性能低下を回避できるようにします。
- 多段階比較学習コースこのプロセスでは、ペア学習を順次実行して基本的な意味的整合性を確立し、コンテキスト学習によって文書レベルの情報を統合し、ハードネガティブトリプルを用いて学習して決定境界を最適化し、球面線形補間によってチェックポイントを統合して最終モデルを形成します。
pplx-embedプロジェクトのアドレス
- プロジェクト公式サイト:https://research.perplexity.ai/articles/pplx-embed-state-of-the-art-embedding-models-for-web-scale-retrieval
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/perplexity-ai/pplx-embed
- arXiv技術論文:https://arxiv.org/pdf/2602.11151
pplx-embedの応用シナリオ
- 検索エンジンと質問応答システム数十億のウェブページからなるデータベースの第一段階の検索ツールとして、下流の並べ替えや生成モデルのための候補ドキュメントを迅速に呼び出し、Perplexity独自のリアルタイム検索および質問応答サービスをサポートします。
- RAG知識ベースの構築本モデルは、企業内部文書や知識ベース向けに圧縮埋め込みを生成し、極めて低いストレージコストで効率的な意味検索を実現します。4Bモデルは、BERGENエンドツーエンドRAGベンチマークにおいて、同様の高パラメータモデルを凌駕する性能を発揮します。
- 多言語コンテンツプラットフォームこのモデルは、グローバルなコンテンツ推薦、多言語対応の顧客サービスシステム、多国籍企業の文書管理といったシナリオに適用可能です。
- エッジデバイスとリアルタイムアプリケーションモバイル検索、IoTデバイス上でのローカル検索、高並列処理のリアルタイムレコメンデーションなど、速度が重視されるシナリオに適しています。
- 長文文書のインテリジェント処理コンテキスト認識型バージョンは、遅延チャンキング技術を使用して、法律契約書、学術論文、技術文書などの長文テキストに対して意味的に一貫性のある段落埋め込みを生成することで、長文文書の検索精度を向上させます。