AIGC

行业资讯

AIGC模式解析(3)

  • 发布时间
  • 点击次数

混合检索与重排

核心问题:BM25 擅长精确匹配(型号、人名、编号),向量检索擅长语义近似(同义改写、概念查询),盲区互补,单用任何一个都会失败。

  • BM25 盲区:"自动挡的车"搜不到"AT"

  • 向量盲区:"ZX-450B"、"TLS1.3" 语义对了但事实错了

  • WANDS 实测:BM25 单独 0.698 NDCG vs 纯 KNN 0.695,混合后 0.75(+7.4%)

标准三阶段流水线(2026 默认架构)

  1. 召回:BM25 稀疏路 + 向量稠密路各自取 top 50-100

  1. 融合:RRF(Reciprocal Rank Fusion,k=60)基于排名不基于分数,天然解决分数不可比问题,零成本无模型调用

  1. 精排:cross-encoder 对 (query, doc) 联合打分,top 5 进 LLM 上下文

重排为什么有效:bi-encoder 独立编码 query 和 doc,丢掉交互信息;cross-encoder 同时过同一个 Transformer,产生真实相关性分数。100-300ms 延迟换来 15-30% 召回提升。

2025-2026 新进展

  • 混合检索从"高级选项"变成厂商默认(Qdrant Universal Query、Weaviate hybrid、ES RRF retriever)

  • 学习型稀疏检索 SPLADE 替代裸 BM25,保留倒排索引同时缩小词汇鸿沟

  • 三路召回:dense + sparse + ColBERT 多向量

  • BGE-M3 统一编码器:一个模型同时输出稠密/稀疏/多向量

  • 指令跟随重排(Voyage rerank-2.5):自然语言指令引导相关性判断,+7.9% vs Cohere Rerank v3.5

调参指南

  • 精确代码/ID 类查询:加重 BM25(alpha 低)

  • 口语化/改写类查询:加重向量(alpha 高)

  • 通用企业 RAG:alpha≈0.5 或 RRF k=60 起步,用评估数据调

  • 无标注数据:直接用 RRF,无需调参

最低可用生产栈:BM25(ES)+ 稠密 ANN(Qdrant/Weaviate)+ RRF → top50 + cross-encoder 重排 → top5。总延迟增加 100-300ms,ROI 高于 Prompt 优化/分块策略。


JK小助手
转人工 ×