AIGC

行业资讯

AIGC 进阶实战指南(19)

  • 发布时间
  • 点击次数

世界模型与具身智能

范式跃迁:2025 年 VLA(视觉-语言-行动)主导 → 2026 年世界模型成为机器人基础。VLA 是"模仿人类指令",世界模型是"理解物理因果"——在脑内模拟行动后果再决策。

为什么需要世界模型:机器人没有互联网级训练数据,真机采集贵、慢、危险。世界模型用合成数据让机器人在"想象中"经历百万次搬运场景(含罕见边角案例),再上真机。

格局(2026)

  • NVIDIA Cosmos 3:首个统一世界生成+视觉推理+动作仿真的世界基础模型,2000 万小时真实数据训练,下载量 200 万+

  • Google Genie 3:24fps 实时生成可交互 3D 环境,无显式物理引擎却习得物理规律

  • Meta V-JEPA 2 / LeCun AMI Labs(JEPA 路线,$10 亿融资):预测抽象表征而非像素

  • 国内:北大 WoW、智元 EVAC、大晓"开悟" 3.0(首个开源商用世界模型,端侧 4B 可控实体机器人)

真实工程链路(纠正常见误解):VLA 不直接输出关节电流。四层分工——

职责

频率

VLM+世界模型(慢思考)

语义理解/子任务规划

1-5 Hz

VLA 动作头(快规划)

轨迹/位置目标

10-50 Hz

MPC/RL 小脑

关节角度/速度

100-500 Hz

伺服驱动

电流/力矩

500-1000 Hz

趋势:WAM(世界动作模型)用世界模型骨干直接生成策略,替代"VLM+动作头";训练数据从真机演示转向互联网图文(学物理定律)+ 真实交互数据补全。

判断:具身智能的"ChatGPT 时刻"尚未到来,但世界模型方向"看不到天花板"(宇树王兴兴);关注 sim-to-real 一致性指标,别信单点演示视频


JK小助手
转人工 ×