aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

Rolling-WAM:让未来动作分几轮逐渐去噪

保留滚动想象降低稳态重规划延迟,突变环境仍可能使旧未来过时

IN A NUTSHELL

普通联合世界动作模型每次重规划都重新生成整段视频和动作。Rolling-WAM保留一个噪声程度错开的未来窗口,只把最近动作去噪完成,执行后接入新观察、移动窗口并补入噪声,从而把计算分摊到多个控制周期。

01

图解主要方法

图2中滚动窗口、噪声调度和注意力掩码怎样共同减少等待?

原论文图2:视频动作专家、滚动去噪与注意力掩码
原论文图2:视频动作专家、滚动去噪与注意力掩码查看大图 ↗
Yinghua Zhou 等,arXiv 2609.30247v1;原图内容未改动。 处理记录:原图内容未改动,白底 PNG 转码 · 原始来源与图注 ↗ · CC BY 4.0
  1. 1

    给未来片段分配不同噪声水平

    图2a组合Wan2.2 TI2V-5B视频专家与约1B动作专家,视频VAE和文本编码器冻结,视频/动作主干共同训练。默认五个片段、每段16动作,总未来范围80动作;每段对应的视频和动作共享噪声阶段。

  2. 2

    先初始化,再循环完成最近片段

    图2b初始化需要完整10步;进入稳态后每轮只做10/5=2步,使第一段动作可执行,远处片段继续保留部分噪声。两步是每轮更新量,不是每个片段从纯噪声到完成总共只需两步。

  3. 3

    执行、观察、移窗并保留未来

    执行首段后接入最新相机观察,丢弃已执行段,其他预测继续去噪,尾部补高斯噪声。它减少从零重来,也引入历史预测惯性;突然接触、物体被移动时,保留未来可能需要快速修正。

  4. 4

    用非对称掩码控制信息流

    图2c中动作能看全部未来视频,动作之间只在同片段相互注意;视频不能看动作。训练混合80%滚动和20%初始化噪声模式。所谓联合生成并非所有模态双向完全互通,也不是直接学习真实物理转移保证。

02

实验与证据

以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。

来源证据【仿真】LIBERO平均98.1%,Joint-WAM为98.5%;RoboTwin为93.3%对90.6%。 表1、表2与训练配置 ↗

我的解读我的解读:速度改善没有处处带来成功率提升;不同基准应分别判断。未增加机器人预训练不等于没有预训练视频先验。

来源证据【真实硬件】G1三任务各50条示范、各20次评测,平均成功率85.0%,Joint-WAM为78.3%;动作按10Hz执行。 真实机器人设置与结果 ↗

我的解读我的解读:实际证据为60次试验,10Hz是底层动作节拍,不能当作每秒10次全新视觉重规划。

来源证据【速度口径】单A100、384×320,稳态编码加去噪215ms,对照978ms,约4.5倍;不含预热和初始化。 运行时表与窗口消融 ↗

我的解读我的解读:延迟收益有明确边界;窗口过长会过时,另一组窗口消融中W8比W5更差,且那组总去噪步数为15,不能混用计时。

03

开放情况与使用许可

作者项目页与仓库可访问;实际仓库仅README、许可和框架图,明确声明代码及检查点准备中,不能标为实现已开源。

LICENSE占位仓库含Apache-2.0文本,但尚无模型实现与权重可供该许可覆盖;上游组件另有条款,论文原图许可见图注。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

把去噪计算和闭环执行交错安排,在保留视觉未来的同时降低单轮等待,有仿真和真实G1证据。

反方 · 哪些结论还不够

初始化和失败恢复成本未包含在4.5倍中,保留预测可能对快速扰动反应迟缓,真实试验规模较小。

综合判断

值得作为WAM控制循环的调度方案研究,部署验收应测突发扰动下的反应而非只看稳态平均速度。

我会先做的验证

未执行的验证方案:统一硬件与总计算,比较每轮重启、滚动保留及遇扰动重置;加入突然阻挡和物体挪动,测首轮/P95延迟、恢复时间、碰撞与成功率,并单列初始化成本。

继续探索具身智能