世界模型与具身智能
范式跃迁:2025 年 VLA(视觉-语言-行动)主导 → 2026 年世界模型成为机器人基础。VLA 是"模仿人类指令",世界模型是"理解物理因果"——在脑内模拟行动后果再决策。
为什么需要世界模型:机器人没有互联网级训练数据,真机采集贵、慢、危险。世界模型用合成数据让机器人在"想象中"经历百万次搬运场景(含罕见边角案例),再上真机。
格局(2026)
NVIDIA Cosmos 3:首个统一世界生成+视觉推理+动作仿真的世界基础模型,2000 万小时真实数据训练,下载量 200 万+
Google Genie 3:24fps 实时生成可交互 3D 环境,无显式物理引擎却习得物理规律
Meta V-JEPA 2 / LeCun AMI Labs(JEPA 路线,$10 亿融资):预测抽象表征而非像素
国内:北大 WoW、智元 EVAC、大晓"开悟" 3.0(首个开源商用世界模型,端侧 4B 可控实体机器人)
真实工程链路(纠正常见误解):VLA 不直接输出关节电流。四层分工——
层 | 职责 | 频率 |
VLM+世界模型(慢思考) | 语义理解/子任务规划 | 1-5 Hz |
VLA 动作头(快规划) | 轨迹/位置目标 | 10-50 Hz |
MPC/RL 小脑 | 关节角度/速度 | 100-500 Hz |
伺服驱动 | 电流/力矩 | 500-1000 Hz |
趋势:WAM(世界动作模型)用世界模型骨干直接生成策略,替代"VLM+动作头";训练数据从真机演示转向互联网图文(学物理定律)+ 真实交互数据补全。
判断:具身智能的"ChatGPT 时刻"尚未到来,但世界模型方向"看不到天花板"(宇树王兴兴);关注 sim-to-real 一致性指标,别信单点演示视频
