Embedding模型演进
三代演进
Word2Vec/GloVe:词级静态向量,无法处理多义词 ❌
ELMo/BERT:上下文动态向量,但检索要两两拼接太慢 ❌
SBERT/BGE/E5:句子级 bi-encoder,对比学习 ✅ RAG 标配
2025-2026 变局:开源平价化
闭源价格墙从两侧崩裂:性能追平(上方)、成本崩塌(下方)
Qwen3-Embedding-8B(Apache 2.0):MTEB 70.6 登顶开源,100+ 语言,4096 维,自托管成本
0.001/百万 token vs OpenAI0.13(便宜 100 倍)
NV-Embed v2、BGE-M3(dense+sparse+multi-vector 混合)持续主流
架构转向:decoder 架构(复用 LLM 当编码器)取代专用 bi-encoder
新能力维度
多模态统一:Gemini Embedding 2(文本/图像/视频/音频/PDF 五模态,跨语言 R@1 0.997 满分);Cohere v4 首个商用多模态;Qwen3-VL-2B 跨模态 0.945 反超闭源(模态间隙 0.25 vs 0.73 是关键)
长文档:4K-32K 上下文;8K 内 API+大开源模型基本满分,335M 以下小模型 4K 就开始退化
MRL 维度压缩(行业标准):一次生成 3072 维,可截断 256/1536 用——存储成本减半,质量优雅衰减(Voyage/Jina 训练时专门优化,裁到 256 维衰减 <1%)
选型建议:中文/开源优先 Qwen3-Embedding/BGE-M3;多模态→Gemini 2/Cohere v4;域专精(法律/代码)→Voyage 或领域微调;存储敏感→MRL 优化模型;闭源 API 锁定担忧→自托管开源($0.001/百万 token)。
趋势:Embedding 从独立 API 变成数据库原生能力(MongoDB $220M 收购 Voyage)——向量搜索正成为数据库基本原语。
