CausalWM:先预测运动和几何,再生成未来画面
时序因果掩码的意义,以及开放版本的实际边界
CausalWM 将光流、点图和未来 RGB 依序生成,以中间运动和几何约束画面。这里的“因果”主要指信息访问顺序,不能等同因果发现或真实干预推理;公开版本也只覆盖单视图推理。
图解主要方法
图 4 为什么先生成光流和点图,各阶段又能看到哪些信息?

- 1
从视频骨干建立三种生成流
使用 LTX-2.3-22B 去掉音频后的约 16B 视频骨干,冻结 Gemma3-12B 文本编码及 VAE。RGB、光流与点图经统一视觉 VAE 编码为 128 通道潜变量,但用各自投影与调制保留模态差别。
- 2
用跨流因果掩码固定依赖顺序
先预测光流,再点图,最后 RGB;单种模态内部可双向注意,跨模态只允许后者读取前者,避免 RGB 信息泄漏给先生成的中间量。这是架构条件,不自动证明模型学到了环境的结构因果机制。
- 3
以估计的运动和几何进行监督
SEA-RAFT 提供光流,VGGT-Omega 估计深度、点图和相机。数据从收集的 31230.8 小时筛到 19916.2 小时,不能把全部收集量写成实际训练量;伪几何仍携带估计器偏差。
- 4
分阶段学习再接控制条件
先训练语言、潜动作与多视图能力,再进行中间流联合训练和多奖励优化。机器人控制以 URDF 等渲染条件接入并另行微调约 34000 步,不能把动作条件实验称为未经训练的零样本控制。
- 5
用少步生成降低推理成本
光流、点图、RGB 各用一步意味着总共三阶段,而不是整个系统一次去噪。官方推理代码在未提供光流时设置占位后生成,未借用未来真值;点图按首帧尺度归一化,不直接表示公制距离。
实验与证据
以下为作者报告;已阅读 v2 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。
来源证据【训练规模】语言阶段 60000 步、128 H100,另有潜动作、多视图及 50000 步中间流训练,部分使用 32/64 H200。 实现细节 ↗
我的解读我的解读:这是大规模多阶段训练;单个推理 checkpoint 不能代表训练管线全部可复现。
来源证据【TWB 快照】500 episodes、50 任务、三相机,09-11 榜单分数 66.04;完整表次高 Dream4Act 65.66。 主表及附录完整榜单 ↗
我的解读我的解读:优势约 0.38 分,不能依据只列部分模型的主表扩大差距,也不是今日实时榜首证明。
来源证据【PAI】174 提示、913 二元问题、五种子,Qwen3-VL-235B 评判,89.9 对 Cosmos 89.7。 PAI 评估 ↗
我的解读我的解读:CausalWM 使用改写提示,部分基线来自历史榜单;小差距缺少足够显著性与真实控制验证。
来源证据【步数消融】20/20/20 步得分 86.54、76.43 秒;1/1/1 为 88.84、14.81 秒,约快 5.16 倍。 少步消融 ↗
我的解读我的解读:这些消融分数与主表 89.9 条件不能混用;测得时间也不是所有硬件的通用速度。
来源证据【开放范围】仓库含实际 inference.py 与采样器;模型卡列出单视图 TI2V checkpoint,下载需同意条件。 官方代码与模型卡 ↗
我的解读我的解读:没有据此确认多视图、动作条件或全部训练代码已发布。
开放情况与使用许可
已检查实际推理实现、模型卡及权重文件清单,未下载权重。当前是单视图 PAI TI2V 推理,权重 gated,需同意模型条款;不是完整训练、多视图或动作模型发布。
LICENSE代码及权重使用 LTX-2 Community License,含商业规模条件;上游 Gemma 条款另行适用,不能称无条件可商用。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
显式预测运动和几何,并用掩码控制信息顺序,让未来画面的中间约束可以检查。
反方 · 哪些结论还不够
伪标签、评判器和提示差异限制物理结论;因果命名不代表干预能力,公开单视图制品不能复现全部论文结果。
综合判断
值得用于运动—几何—外观分解的世界预测研究;应用到仿真或控制前应以真实状态和干预数据校验。
我会先做的验证
未执行的验证方案:固定提示和采样预算,比较直接 RGB、无顺序联合预测及顺序预测;测物体碰撞、遮挡回访与公制轨迹,并给出多随机种子的差异区间。