↑

Perplexity|开源pplx-embed多模态检索模型,免OCR图文检索

PromptTree|阅读 0
2026/10/08 08:35
Perplexitypplx-embed多模态嵌入检索增强开源模型
Perplexity开源多模态检索模型pplx-embed-v2-late,提供0.6B与9B两档且共享同一嵌入空间,可在不依赖OCR的情况下检索文本、图片与PDF;小模型可直接查询大模型构建的索引以降低在线成本。

「先OCR再检索」一直是文档问答里的一根刺,Perplexity这轮开源想直接把它拔掉。

Perplexity于10月8日前夕开源多模态检索模型pplx-embed-v2-late,提供0.6B与9B两个参数档位。两个档位共享同一嵌入空间,这是设计上的关键点:索引端用9B大模型保证召回质量,查询端换用0.6B小模型压低在线成本,两者产出的向量可以直接互通,小模型「能读」大模型建好的索引。

能力与实测: 该模型面向文本、图片与PDF的免OCR检索——传统流程往往需要先把图片里的文字用OCR识别出来再建索引,而多模态嵌入可以直接对像素级的图文内容编码。公开的ViDoRe v3图像检索指标显示,nDCG@10上9B档约65.2%、0.6B档约62.3%,小模型在明显更省资源的前提下,保持了接近大模型的检索质量。

产业含义: 检索增强(RAG)是当前Agent与知识库产品的核心组件,但「多模态文档」一直是短板——合同扫描件、图表、产品手册往往要先过一道易错的OCR。免OCR的多模态嵌入把这类内容纳入统一检索空间,对文档问答、企业知识库与电商商品检索都有实际价值。开源+双档共享空间的组合,也给了开发者一套「便宜搭索引、贵在查询」的弹性方案。

事实以Hugging Face模型页与Perplexity官方说明为准。