AIGC

行业资讯

AIGC模式解析(10)

  • 发布时间
  • 点击次数

Embedding模型演进

三代演进

  1. Word2Vec/GloVe:词级静态向量,无法处理多义词 ❌

  1. ELMo/BERT:上下文动态向量,但检索要两两拼接太慢 ❌

  1. SBERT/BGE/E5:句子级 bi-encoder,对比学习 ✅ RAG 标配

2025-2026 变局:开源平价化

  • 闭源价格墙从两侧崩裂:性能追平(上方)、成本崩塌(下方)

  • Qwen3-Embedding-8B(Apache 2.0):MTEB 70.6 登顶开源,100+ 语言,4096 维,自托管成本 0.001/百万 token vs OpenAI 0.13(便宜 100 倍)

  • NV-Embed v2、BGE-M3(dense+sparse+multi-vector 混合)持续主流

  • 架构转向:decoder 架构(复用 LLM 当编码器)取代专用 bi-encoder

新能力维度

  • 多模态统一:Gemini Embedding 2(文本/图像/视频/音频/PDF 五模态,跨语言 R@1 0.997 满分);Cohere v4 首个商用多模态;Qwen3-VL-2B 跨模态 0.945 反超闭源(模态间隙 0.25 vs 0.73 是关键)

  • 长文档:4K-32K 上下文;8K 内 API+大开源模型基本满分,335M 以下小模型 4K 就开始退化

  • MRL 维度压缩(行业标准):一次生成 3072 维,可截断 256/1536 用——存储成本减半,质量优雅衰减(Voyage/Jina 训练时专门优化,裁到 256 维衰减 <1%)

选型建议:中文/开源优先 Qwen3-Embedding/BGE-M3;多模态→Gemini 2/Cohere v4;域专精(法律/代码)→Voyage 或领域微调;存储敏感→MRL 优化模型;闭源 API 锁定担忧→自托管开源($0.001/百万 token)。

趋势:Embedding 从独立 API 变成数据库原生能力(MongoDB $220M 收购 Voyage)——向量搜索正成为数据库基本原语。


JK小助手
转人工 ×