aiwillknow.AI 前沿观察每日 08:00 开始整理
世界模型全文深读与原图讲解

CausalWM:先预测运动和几何,再生成未来画面

时序因果掩码的意义,以及开放版本的实际边界

IN A NUTSHELL

CausalWM 将光流、点图和未来 RGB 依序生成,以中间运动和几何约束画面。这里的“因果”主要指信息访问顺序,不能等同因果发现或真实干预推理;公开版本也只覆盖单视图推理。

01

图解主要方法

图 4 为什么先生成光流和点图,各阶段又能看到哪些信息?

原论文图 4:运动、几何与未来画面的因果生成流
原论文图 4:运动、几何与未来画面的因果生成流查看大图 ↗
Ziming Xu 等,arXiv 2609.23184v2;原图内容未改动。 · 原始来源与图注 ↗ · 版权归作者;arXiv 非独占分发许可不是开放图片许可。为方法评论仅引用必要原图,不授予进一步使用权。
  1. 1

    从视频骨干建立三种生成流

    使用 LTX-2.3-22B 去掉音频后的约 16B 视频骨干,冻结 Gemma3-12B 文本编码及 VAE。RGB、光流与点图经统一视觉 VAE 编码为 128 通道潜变量,但用各自投影与调制保留模态差别。

  2. 2

    用跨流因果掩码固定依赖顺序

    先预测光流,再点图,最后 RGB;单种模态内部可双向注意,跨模态只允许后者读取前者,避免 RGB 信息泄漏给先生成的中间量。这是架构条件,不自动证明模型学到了环境的结构因果机制。

  3. 3

    以估计的运动和几何进行监督

    SEA-RAFT 提供光流,VGGT-Omega 估计深度、点图和相机。数据从收集的 31230.8 小时筛到 19916.2 小时,不能把全部收集量写成实际训练量;伪几何仍携带估计器偏差。

  4. 4

    分阶段学习再接控制条件

    先训练语言、潜动作与多视图能力,再进行中间流联合训练和多奖励优化。机器人控制以 URDF 等渲染条件接入并另行微调约 34000 步,不能把动作条件实验称为未经训练的零样本控制。

  5. 5

    用少步生成降低推理成本

    光流、点图、RGB 各用一步意味着总共三阶段,而不是整个系统一次去噪。官方推理代码在未提供光流时设置占位后生成,未借用未来真值;点图按首帧尺度归一化,不直接表示公制距离。

02

实验与证据

以下为作者报告;已阅读 v2 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。

来源证据【训练规模】语言阶段 60000 步、128 H100,另有潜动作、多视图及 50000 步中间流训练,部分使用 32/64 H200。 实现细节

我的解读我的解读:这是大规模多阶段训练;单个推理 checkpoint 不能代表训练管线全部可复现。

来源证据【TWB 快照】500 episodes、50 任务、三相机,09-11 榜单分数 66.04;完整表次高 Dream4Act 65.66。 主表及附录完整榜单

我的解读我的解读:优势约 0.38 分,不能依据只列部分模型的主表扩大差距,也不是今日实时榜首证明。

来源证据【PAI】174 提示、913 二元问题、五种子,Qwen3-VL-235B 评判,89.9 对 Cosmos 89.7。 PAI 评估

我的解读我的解读:CausalWM 使用改写提示,部分基线来自历史榜单;小差距缺少足够显著性与真实控制验证。

来源证据【步数消融】20/20/20 步得分 86.54、76.43 秒;1/1/1 为 88.84、14.81 秒,约快 5.16 倍。 少步消融

我的解读我的解读:这些消融分数与主表 89.9 条件不能混用;测得时间也不是所有硬件的通用速度。

来源证据【开放范围】仓库含实际 inference.py 与采样器;模型卡列出单视图 TI2V checkpoint,下载需同意条件。 官方代码与模型卡

我的解读我的解读:没有据此确认多视图、动作条件或全部训练代码已发布。

03

开放情况与使用许可

已检查实际推理实现、模型卡及权重文件清单,未下载权重。当前是单视图 PAI TI2V 推理,权重 gated,需同意模型条款;不是完整训练、多视图或动作模型发布。

LICENSE代码及权重使用 LTX-2 Community License,含商业规模条件;上游 Gemma 条款另行适用,不能称无条件可商用。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

显式预测运动和几何,并用掩码控制信息顺序,让未来画面的中间约束可以检查。

反方 · 哪些结论还不够

伪标签、评判器和提示差异限制物理结论;因果命名不代表干预能力,公开单视图制品不能复现全部论文结果。

综合判断

值得用于运动—几何—外观分解的世界预测研究;应用到仿真或控制前应以真实状态和干预数据校验。

我会先做的验证

未执行的验证方案:固定提示和采样预算,比较直接 RGB、无顺序联合预测及顺序预测;测物体碰撞、遮挡回访与公制轨迹,并给出多随机种子的差异区间。

继续探索世界模型