AIGC

行业资讯

AIGC模式解析(4)

  • 发布时间
  • 点击次数

多模态理解与VLM

定义:VLM = 视觉编码器(ViT)+ 跨模态连接器 + LLM,把图像转成 token 序列与文本联合推理。与第四篇"多模态生成"对应——这篇讲"看懂",那篇讲"生成"。

三种架构

架构

代表

优点

缺点

MLP 连接器

LLaVA

可解释、可自由换组件

视觉编码器与 LLM 表征不匹配

Cross-attention

Flamingo/Llama 3.2

不灌入海量图像 token

需额外训练

原生统一

GPT-4o/Gemini

性能最强、无模态切换

训练成本极高

2026 格局:Qwen3.5-VL MMMU 85.0 超越 GPT-5(84.2);InternVL3.5 级联强化学习推理 +16%;端侧 FastVLM-0.5B(苹果)、SmolVLM-256M,TTFT 降 53-93%。

杀手级应用:文档理解。2025-2026 RAG 最大变化——VLM 取代传统文档解析器。传统管线(PyMuPDF→文本)在多栏、表格、图表、扫描件、手写标注上大量丢失信息;VLM 直接"看"整页布局,输出带结构的 Markdown/JSON。代价是 1-3 秒/页+API 费,但对复杂文档是质变。

企业落地:发票/合同/财务报表结构化抽取(准确率媲美人工)、截图问答("14号营收为什么跌")、UI 截图→代码、长视频理解(Qwen2.5-VL 支持 1 小时+)、医疗影像初筛。

成本关键:单页高清图可消耗数千视觉 token。优化:缩放+分块限 token、两级检索(bi-encoder 召回→VLM 只读 top 页)、端侧 VLM 处理隐私数据。Qwen2.5-VL 72B $0.2/百万输入 token,比 GPT-4o 便宜 10 倍+。

能力边界:精确空间推理("X 在图像哪个位置")、低清小字、密集计数、像素级测量仍弱;别让 VLM 数繁忙照片里的物品。幻觉依然严重——长文本复杂场景生成内容与图像不符,生产环境必须有确定性验证器兜底。


JK小助手
转人工 ×