aiwillknow.AI 前沿观察每日 08:00 开始整理
世界模型全文深读与原图讲解

MiniWAM:世界动作模型可以预测更小、与控制更相关的未来

PRISM用逆动力学与特征重建学习目标;65倍特征压缩不等于65倍Transformer缩短

IN A NUTSHELL

MiniWAM先从当前与未来视觉特征学习PRISM紧凑表示,再冻结编码器,把这个表示作为世界动作模型的预测目标。逆动力学监督保留动作相关信息,特征重建保留未来内容;第二阶段同时去噪未来表示与动作。0.25B策略在多项仿真中有竞争力,但模型尺寸不包含冻结视觉/文本编码器,加速也不是从原始视频开始的端到端计时。

01

图解主要方法

世界动作模型能否通过预测紧凑转移表示,减少训练成本且保留控制信息?

左侧使用真实当前未来学习逆动力学和重建瓶颈;右侧冻结瓶颈目标并联合去噪世界与动作。
图2|PRISM表征学习与MiniWAM联合预测的两个阶段查看大图 ↗
新加坡国立大学、南洋理工大学、A*STAR IAIC,arXiv:2610.12194v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · 版权归作者;arXiv非独占托管许可不等于图片再分发许可
  1. 1

    先用有未来的转移学习瓶颈

    冻结WAN2.1 VAE或DINOv3,把当前帧与16未来帧交给轻量3D卷积编码器;默认每相机输出3×4×4×64,48个token。对角高斯后验重参数采样,KL权重10⁻⁶。第一阶段训练可见未来,部署不可见。

  2. 2

    让瓶颈解释动作,也重建视觉特征

    第一阶段世界token保持干净、动作token加噪,逆动力学预测动作;移除直接当前观察与语言条件,迫使相关视觉信息经过瓶颈。动作可看世界,世界不能看动作。解码器以MSE重建未来特征而非RGB,和逆动力学共同塑造表征。

  3. 3

    冻结目标编码器,重新训练联合策略

    第二阶段取后验均值作确定目标;第一阶段逆动力学策略不转移,而是重新初始化0.25B策略。12层MoT的世界/动作专家各768宽、12头,动作与世界互相注意,分别采独立噪声和时刻;当前图像、语言、本体状态提供条件,两个flow loss权重均为1。

  4. 4

    部署时共同去噪并执行动作

    无需PRISM编码器或未来图像,仅当前观察初始化世界/动作高斯噪声,用20步Euler联合去噪。LIBERO预测16动作执行前10再规划;RoboTwin主结果预测并执行24动作。效率profile用16动作、16/32视觉时域,是另一组负载。

02

实验与证据

完整正文与附录A–E、表征分析协议、图2及作者项目页已核查;未独立复现。

来源证据每相机原生未来网格3,136位置→48,约65.3倍;原生经patch后Transformer未来token784→48,约16.3倍。 附录A ↗

我的解读两个压缩率不同;总序列还包含当前观察、动作、文本。WAN标量50,176→3,072,DINO2,408,448→3,072,通道数也影响比较。

来源证据DINO原生/PRISM:LIBERO93.2/97.2、Plus-2K60.9/74.1;完整Plus为73.6(10,030任务),RoboTwin为46.1。 表1/3;附录C ↗

我的解读2K子集与完整Plus分开计。π0.5完整Plus85.7、RoboTwin58.4仍更高;不应称全面最强。

来源证据单RTX PRO6000 96GB、batch256:RoboTwin WAN32帧第二阶段10.48倍,含第一阶段估算8.46倍。 表2;附录D ↗

我的解读全训练估算假设两阶段单步成本相近,profile只2预热/6测量更新;不包含离线特征目标提取,也不是推理加速。

来源证据LIBERO第一/二阶段15/50epoch=16,260/54,200更新;RoboTwin6/25epoch。247.5M参数为策略模块。 附录A–B ↗

我的解读冻结视觉骨干与文本编码器是外部模块;“无预训练视频生成骨干初始化”不等于完全不用预训练模型。

来源证据未见LIBERO-90任务上的腕视角去混淆CKA0.071→0.393;DINO仅重建到完整PRISM邻居动作RMSE0.326→0.266。 表5/10;附录E ↗

我的解读4,500转移、1,800 CKA子集、882查询/3,618图库且排同任务。邻域动作一致性支持表征有控制信息,但不是长程世界预测或因果中介实验。

03

开放情况与使用许可

作者项目页明确Code & models Coming soon before Nov 2026,论文说接收后发布实现、配置、权重和评估脚本;当前未确认已释放这些材料。

LICENSE论文使用arXiv非独占托管许可;图2版权归作者,引用用于方法讲解。未来代码/权重及DINOv3、WAN、UMT5各有独立许可边界。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

同视觉特征、相同第二阶段更新数,DINOv3原生未来预测LIBERO-Plus-2K为60.9%,PRISM74.1%;WAN为50.2→56.5%,说明收益不只来自换视觉骨干。

同容量仅重建、仅逆动力学、两者结合分别69.5/70.5/74.1%,组合目标有独立消融支持。

反方 · 哪些结论还不够

PRISM另有第一阶段学习,控制实验匹配第二阶段而非总优化预算;世界分支投影和头随目标改变,精确参数也未必相同。

无co-train对照只是世界flow权重设0,仍保留世界token与双向注意力,动作loss仍能更新世界专家,不是删去整个世界分支。

原生表征做空间平均,PRISM保留粗空间网格;去混淆只去掉指定线性可预测因素,CKA和邻居相似不等于证明因果控制机制。

综合判断

紧凑控制相关目标对性能/训练吞吐的折中有较完整证据;宣传中的压缩、规模和加速都应限定口径,跨场景与真实机器人效果仍待验证。

我会先做的验证

建议实验(尚未执行):按含离线特征提取的总GPU小时匹配预算,报告完整系统参数和端到端延时;多seed重复并测试同一PRISM跨任务/机器人迁移,加入等空间池化的表征对照和无世界分支策略。

继续探索世界模型