Rolling-WAM:让未来动作分几轮逐渐去噪
保留滚动想象降低稳态重规划延迟,突变环境仍可能使旧未来过时
普通联合世界动作模型每次重规划都重新生成整段视频和动作。Rolling-WAM保留一个噪声程度错开的未来窗口,只把最近动作去噪完成,执行后接入新观察、移动窗口并补入噪声,从而把计算分摊到多个控制周期。
图解主要方法
图2中滚动窗口、噪声调度和注意力掩码怎样共同减少等待?

- 1
给未来片段分配不同噪声水平
图2a组合Wan2.2 TI2V-5B视频专家与约1B动作专家,视频VAE和文本编码器冻结,视频/动作主干共同训练。默认五个片段、每段16动作,总未来范围80动作;每段对应的视频和动作共享噪声阶段。
- 2
先初始化,再循环完成最近片段
图2b初始化需要完整10步;进入稳态后每轮只做10/5=2步,使第一段动作可执行,远处片段继续保留部分噪声。两步是每轮更新量,不是每个片段从纯噪声到完成总共只需两步。
- 3
执行、观察、移窗并保留未来
执行首段后接入最新相机观察,丢弃已执行段,其他预测继续去噪,尾部补高斯噪声。它减少从零重来,也引入历史预测惯性;突然接触、物体被移动时,保留未来可能需要快速修正。
- 4
用非对称掩码控制信息流
图2c中动作能看全部未来视频,动作之间只在同片段相互注意;视频不能看动作。训练混合80%滚动和20%初始化噪声模式。所谓联合生成并非所有模态双向完全互通,也不是直接学习真实物理转移保证。
实验与证据
以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。
来源证据【仿真】LIBERO平均98.1%,Joint-WAM为98.5%;RoboTwin为93.3%对90.6%。 表1、表2与训练配置 ↗
我的解读我的解读:速度改善没有处处带来成功率提升;不同基准应分别判断。未增加机器人预训练不等于没有预训练视频先验。
来源证据【真实硬件】G1三任务各50条示范、各20次评测,平均成功率85.0%,Joint-WAM为78.3%;动作按10Hz执行。 真实机器人设置与结果 ↗
我的解读我的解读:实际证据为60次试验,10Hz是底层动作节拍,不能当作每秒10次全新视觉重规划。
来源证据【速度口径】单A100、384×320,稳态编码加去噪215ms,对照978ms,约4.5倍;不含预热和初始化。 运行时表与窗口消融 ↗
我的解读我的解读:延迟收益有明确边界;窗口过长会过时,另一组窗口消融中W8比W5更差,且那组总去噪步数为15,不能混用计时。
开放情况与使用许可
作者项目页与仓库可访问;实际仓库仅README、许可和框架图,明确声明代码及检查点准备中,不能标为实现已开源。
LICENSE占位仓库含Apache-2.0文本,但尚无模型实现与权重可供该许可覆盖;上游组件另有条款,论文原图许可见图注。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
把去噪计算和闭环执行交错安排,在保留视觉未来的同时降低单轮等待,有仿真和真实G1证据。
反方 · 哪些结论还不够
初始化和失败恢复成本未包含在4.5倍中,保留预测可能对快速扰动反应迟缓,真实试验规模较小。
综合判断
值得作为WAM控制循环的调度方案研究,部署验收应测突发扰动下的反应而非只看稳态平均速度。
我会先做的验证
未执行的验证方案:统一硬件与总计算,比较每轮重启、滚动保留及遇扰动重置;加入突然阻挡和物体挪动,测首轮/P95延迟、恢复时间、碰撞与成功率,并单列初始化成本。