
Q2D-Web:在大规模网页语料上评估第一阶段检索器
Perplexity 发布 1.9 亿文档、69,721 条 agent 查询和三组相关性标签的检索基准 Q2D-Web,并公开排行榜与子语料评估方案。
Q2D-Web:在大规模网页语料上评估第一阶段检索器
来源:Perplexity Engineering,2026 年 9 月 9 日
Perplexity 发布了 Q2D-Web(Query2Doc-Web):一个私有基准加公开排行榜,用来评估 agentic RAG 系统中的检索环节。它在此前 Q2D 基准的基础上,把评估推到更接近生产网页搜索的规模——更大的语料、更多的已标注查询,以及更深的相关性标注。
这个基准瞄准的是「在大规模网页搜索中使用的 embedding 模型」。它由 1.9 亿篇网页文档和 69,721 条由 agent 重写后的查询组成,覆盖十种语言,并采样自九个月的 PII-free 生产搜索流量。更重要的是,它没有把单一来源当成绝对事实,而是同时提供三种相关性标签。
在这种规模下,查询-文档层面的相关性信号必然稀疏。单一标注管线会把自身的偏差悄悄写进评测。因此 Q2D-Web 提供三组相关性判断:agent 引用、生产网页排序,以及对此前未标注候选的额外 LLM 判断。多来源可以限制单一管线的偏差,更深的标注则降低假阴性。
为什么真实检索评估很难
生产级检索系统会在数十亿网页里搜索,然后返回数千个候选文档。这些候选决定了下游 agent 能看到哪些证据,所以第一阶段检索器直接影响整个回答链路。真实评估也必须沿三个维度扩规模:语料中的文档数、已评估的查询数,以及每个查询的相关性判断数。
更大的语料会带来更难的负例:它们在语义上与查询相似,却缺少所需日期、实体、版本、数量或角度。如果缩小语料但保留已知相关文档,这些干扰项会消失,recall 也可能被人为抬高。
更多已标注查询能让性能估计更稳定。查询集太小,结果就依赖「正好抽到了哪些查询」,很难精确区分模型。更深的标注则减少假阴性:检索器召回了相关页,但该页没有被标注,就会被错误计为不相关。原文引用 MS MARCO 的经验证据——人工检查其中被排在前列但未标注的段落,70% 实际上相关。
现有基准往往只在一两个维度上扩:网页级语料常常缺少足够的已标注查询;查询多的数据集又常常语料小、标签稀。而且多数基准使用人工查询,agentic RAG 检索时用的是 agent 重写后的查询,其措辞、结构和具体程度都与用户原话不同。
Q2D-Web 同时覆盖三个维度:1.9 亿文档、69,721 条 agent 查询,Combined 标签集平均每查询 99.6 个正样本。最接近的公开对照是 MS MARCO Web Search:1.009 亿文档、9,374 条测试查询,但每查询只有一个来自点击的正标签。
基准是怎么建出来的
Q2D-Web 从九个月内收集的 23,000 条 PII-free 生产搜索出发,覆盖十种语言和数十个领域。这里的「一次搜索」是 agent 响应用户消息时执行的所有网页搜索工具调用;每次工具调用可能包含多条查询。
查询分两类角色。primary query 重述用户的信息需求;support queries 探索替代表述、背景信息或相关实体。即便它们来自同一次用户请求,也可能需要不同文档,所以每条查询都独立评估,并拥有自己的相关性标签。
入库前经过严格隐私过滤:查询必须来自允许数据被使用的用户,使用 perplexity-ai/pplx-pii-masking 做 PII 检测并排除包含个人信息的查询,同时移除完全重复项、过短查询,以及含有 site: 或引号短语等搜索运算符的查询。
语言分布上,英语占 65.8%,随后是西班牙语、俄语、德语、法语、葡萄牙语、意大利语、韩语、日语和中文。主题横跨消费品、编程、法律、健康、商业、科学、教育、技术、金融、旅行、娱乐、政治、本地信息和新闻。
语料构建时,Perplexity 用生产检索系统为每条查询取前 5,000 篇文档,再取所有结果集的并集。随后用 MinHash–LSH 去重:当文档的 token 5-gram 集合的 Jaccard 相似度不低于 0.975 时聚为一个簇。
这个语料不是随机网页样本。每篇文档都至少曾是一条基准查询的合理候选。这样就形成一个密集的困难干扰项池:页面与查询的主题或语言匹配,却可能缺少所需日期、实体、版本、数量或角度。
三组标签,而不是一个「真相」
Citation:agent 在回答中引用了某个文档,就将其标为相关。这是最接近下游使用的信号,但天然高精确率、低召回率——agent 一旦拿到足够支撑,就没有理由把所有其他相关页都引用一遍。
Web Ranking:每查询最多 50 篇文档,平均 43.1 篇。由内部检索栈识别:第一阶段使用 BM25 和稠密检索,随后用 cross-encoder 重排。它能捕捉「有用但未被引用」的页面。
Combined + LLM-Judged:先取 Citation 与 Web Ranking 的并集,再对此前未标注的候选补 LLM 判断。管线汇总 BM25、ColBERTv2 和 2025 年 1 月 1 日前发布的七个稠密检索器的结果,用倒数排序融合(RRF)合并排名,选取前 500 篇未标注文档,并使用 DeepSeek-V4-Flash 执行严格的二值相关性判断。
用子语料把评估做到可负担
全语料评估非常昂贵:pplx-embed-v1-4b 在 Q2D-Web 上完整跑一次需要 4,608 个 H200 GPU 小时,连 EmbeddingGemma-300M 也要接近 200 个。为了让评估可执行,Perplexity 构建了子采样语料。
所有策略都会保留全部正样本,只在「如何选取未标注干扰项」上变化。真正重要的干扰项,是检索器可能排到相关文档前面的那些,因为只有它们会改变得分和榜单位置。
团队比较了均匀随机采样、跨构建检索器的固定深度池化,以及不同深度的 per-query RRF。基于 RRF 的采样只使用全语料的 31.7%,却保留了全语料模型排名,并且更接近绝对分数:它只把平均 Recall@1000 抬高 4.5 分,而同规模随机采样会抬高 11.1 分。
RRF 子语料把成本降到约三分之一:pplx-embed-v1-4b 约需 1,500 个 H200 GPU 小时,EmbeddingGemma-300M 少于 70 个。每次提交先在子语料版本上评估,并按总参数量分成最多 1B 与大于 1B 两组。模型进入所在组前十后再跑全语料;组外前十只发布在子语料排行榜上。
首批结果说明什么
Q2D-Web 的主要指标是 Recall@1000:第一阶段检索器只需把相关文档送进候选池,最终顺序由后续重排决定。三组标签给出的整体结论一致,同时排行榜也并排展示更窄的引用标签与更广的相关性标签下结果如何变化。
表 1. 十三个检索器在 Citation、Web Ranking 和 Combined 标签集上的 Recall@1000 与 nDCG@10。分数越高越好。
| 模型 | Recall@1000:Citation | Recall@1000:Web Ranking | Recall@1000:Combined | nDCG@10:Citation | nDCG@10:Web Ranking | nDCG@10:Combined |
|---|---|---|---|---|---|---|
| BM25-tantivy | 43.92 | 42.50 | 44.77 | 5.74 | 11.45 | 30.30 |
| EmbeddingGemma-300M | 58.17 | 58.93 | 65.45 | 9.20 | 17.30 | 43.56 |
| mDenseOn | 51.78 | 52.56 | 59.31 | 7.63 | 15.06 | 40.20 |
| Nemotron-3-Embed-1B | 54.40 | 54.37 | 61.68 | 7.54 | 14.83 | 40.21 |
| Nemotron-3-Embed-8B | 61.68 | 61.73 | 68.58 | 10.16 | 18.69 | 47.44 |
| pplx-embed-v1-0.6b | 58.35 | 62.15 | 67.02 | 9.37 | 19.76 | 44.36 |
| pplx-embed-v1-4b | 61.22 | 65.73 | 69.11 | 10.33 | 21.29 | 45.84 |
| Qwen3-Embedding-0.6B | 50.10 | 51.82 | 57.89 | 6.58 | 14.11 | 37.38 |
| Qwen3-Embedding-4B | 54.95 | 55.60 | 62.01 | 7.67 | 14.97 | 40.21 |
| Qwen3-Embedding-8B | 57.38 | 58.34 | 64.53 | 8.30 | 16.27 | 42.69 |
| voyage-4-nano | 49.38 | 50.14 | 56.67 | 5.41 | 11.77 | 31.63 |
| mLateOn | 52.85 | 53.12 | 60.98 | 8.44 | 15.51 | 43.11 |
| pplx-embed-v1-late-0.6b | 56.56 | 58.14 | 63.40 | 9.13 | 17.25 | 43.39 |
没有任何模型在全部三组标签上领先。Recall@1000 方面,pplx-embed-v1-4b 在 Web Ranking(65.73)和 Combined(69.11)最高,Nemotron-3-Embed-8B 在 Citation(61.68)最高。但把注意力转到 Combined Recall@100 和 nDCG@10 时,次序改变:Nemotron-3-Embed-8B 得到 30.03 和 47.44,超过 pplx-embed-v1-4b 的 29.82 和 45.84。
在模型家族内部,更大的模型在 Combined Recall@1000 上更高:Qwen3-Embedding 从 0.6B 的 57.89 升到 8B 的 64.53;Nemotron-3-Embed 从 1B 的 61.68 升到 8B 的 68.58;pplx-embed-v1 从 0.6B 的 67.02 升到 4B 的 69.11。
Perplexity 自家模型与其他提交模型使用同一条评测管线。不过 Q2D-Web 来自 Perplexity 生产流量,这些模型可能享有 in-distribution 优势。虽然评测查询和语料已从模型训练中排除,解释结果时仍要考虑这个潜在优势。
如何提交模型
想请求评估,需要通过评估申请表提交一个公开可用的 Hugging Face 模型。Perplexity 会按模型卡执行推理设置,包括推荐的 query/document 指令或前缀、pooling、归一化和相似度函数。所有查询和文档都会用模型自身 tokenizer 截断到 512 token——指令、前缀和特殊 token 都计入,所以支持更长上下文没有优势。
合格模型必须能通过标准 transformers 或 sentence-transformers API 加载。如果模型不能在 trust_remote_code=False 下运行,则要对自定义代码和提交者做人工审核,耗时明显更长。私有或 gated 仓库不合格。方法细节与当前结果见技术报告和公开排行榜。
来源:Q2D-Web: Evaluating First-Stage Retrievers at Scale,Perplexity Engineering,2026 年 9 月 9 日。
原文来源:Perplexity Engineeringhttps://www.perplexity.ai/hub/blog/q2d-web