Perplexity 发布 pplx-embed-v2-late:0.6B 边缘模型与 9B 索引模型
Perplexity 发布 pplx-embed-v2-late 系列 ColBERT 式多模态嵌入模型,含 0.6B 与 9B 两个尺寸,共享同一嵌入空间,可检索文本、图像与渲染后的 PDF 页面。权重已上架 Hugging Face,采用 MIT 许可;托管 API 端点据称在规划中但尚未上线。
Perplexity 发布 pplx-embed-v2-late 双尺寸嵌入模型
Perplexity 发布了 pplx-embed-v2-late,一组 ColBERT 式多模态嵌入模型,包含 0.6B 与 9B 两个尺寸:前者面向快速、低成本的查询场景,后者面向最高质量要求。据该来源介绍,两款模型均可检索文本、图像以及渲染后的 PDF 页面,并共享同一个嵌入空间。模型权重已发布在 Hugging Face 上,采用 MIT 许可,允许商业使用;Perplexity 托管的 API 端点据报已在规划中,但尚未上线,因此目前需要自行部署。
性能与部署背景
据该来源引述 Perplexity 公布的数据,9B 模型在 MADQA(智能体式 PDF 问答)上取得 92.4% 的准确率,0.6B 模型为 90.1%;在 72 项领域文本任务上,9B 的 nDCG@10 为 81.3%,0.6B 为 78.0%。该来源同时指出,图像检索并非其最强项:在 ViDoRe v3 图像检索上,0.6B 与 9B 分别为 62.3% 和 65.2%,低于腾讯 EVIE;在 ViDoRe v3 Markdown 上,0.6B 的 61.2% 是文中列出的最低分。模型采用每 token 一个 128 维向量的表示方式,并以 MaxSim 打分,页面以图像形式编码,无需 OCR 步骤。该来源称,0.6B 模型约 594M 总参数,可在笔记本、边缘设备或小型 GPU 上运行;9B 模型面向数据中心或高显存 GPU。使用需 sentence-transformers 6.0.0 及以上、transformers 5.4.0 及以上版本,且模型卡显示使用 CUDA GPU。
限制与来源说明
需要注意的限制包括:由于每个 token 存储一个向量,索引体积会随文档长度增长;单次输入不能混合文本与图像;上述所有分数均为 Perplexity 自行公布,技术报告尚未发布,第三方独立验证情况未知。该来源还提到,0.6B 模型在 ViDoRe v3 图像检索上落后于 EVIE,图像搜索是其相对短板。本文所述参数、许可、硬件要求与可用性均以该来源及官方页面为准,实际部署前请查阅 Hugging Face 模型卡与官网当前信息。本文信息来自 MarkTechPost 的报道,相关数据尚未获独立确认。