aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

ARPS:让世界动作模型只传递对动作有用的预测状态

32个状态token、两种未来目标,较大收益出现在分布偏移测试

IN A NUTSHELL

预测视频容易不等于表示适合控制。ARPS 先诊断不同教师表示能读出多少动作信息,再用 V-JEPA2 的未来绝对状态与变化量监督紧凑接口;部署只看当前观察,不需要生成未来视频或运行教师。

01

图解主要方法

图 1 的诊断怎样转化为右侧紧凑状态,而不是把真实未来偷给策略?

原论文图 1:预测状态诊断与紧凑动作接口示意
原论文图 1:预测状态诊断与紧凑动作接口示意查看大图 ↗
Qiwen Gu 等,arXiv 2609.23369v1;原图内容未改动。 处理记录:原图内容未改动,白底 PNG 转码 · 原始来源与图注 ↗ · CC BY 4.0
  1. 1

    区分未来可预测与动作可读

    图1A/B用线性探针比较V-JEPA2、DINOv2与VGGT:几何教师未来变化更好预测,却不一定更容易解码动作。C把真实未来加入探针仅作信息上限诊断,不能当部署输入;D显示空间信息集中,启发容量瓶颈。

  2. 2

    从中间层聚合32个状态

    图1E在Wan5B视频专家第15层提取当前帧特征,三层预测器用32个学习查询交叉注意力聚合。查询分到两个未来时间组,但组间自注意力共享信息;动作专家的全部视觉上下文都必须通过状态Z,文本与本体状态另保留。

  3. 3

    训练时同时监督绝对未来与差分

    每个时间组用独立位置查询头预测冻结V-JEPA2的未来表征及相对当前的变化,用余弦加Smooth-L1约束。教师用因果四帧片段、训练集逐通道标准化;两个h是视频latent时间范围,不是两张瞬时未来帧。原视频与动作flow损失仍保留。

  4. 4

    部署删除教师并提前结束视频专家

    推理按当前观察→中间特征→Z→动作块执行,教师和监督头删除,视频专家在提取层停止。未来监督塑造了表示,但状态不是已观测未来;32token只是被测最优容量,不意味着越小或越大必然更好。

02

实验与证据

以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。

来源证据【主要结果】LIBERO99.2%;未适配LIBERO-Plus87.3%,作者重跑Fast-WAM48.1%。Plus含10030扰动变体、每变体一次;RoboTwin两组各5000次,平均均为90.7%。 表 1–3、附录 A/B ↗

我的解读我的解读:OOD收益明显,但双臂平均未提升,Random组略降。全部为仿真,不能转述成真实机器人可靠性。

来源证据【控制消融】同教师的当前目标49.0%、近未来72.4%、双未来87.3%;相同监督的稠密接口76.8%,去视频损失64.6%。 表 4 与附录 C ↗

我的解读我的解读:未来目标、紧凑接口和视频共同训练都贡献收益;线性探针分数本身仍不足以完全解释泛化差异。

来源证据【速度与机制】H20完整动作块306ms,对照353ms;噪声干预状态会改变成功率,但未单独隔离未来信息。 第 5.3 节与附录 D/F ↗

我的解读我的解读:约13%时延改善是动作块生成,不是机器人底层控制频率。状态与轨迹相似性是关联证据,不能单凭噪声干预证明未来因果机制。

03

开放情况与使用许可

09-20 首发回顾补收;全文附录已读。未核实专属实现或权重公开。HTML架构段的图引用缺失,本页使用实际存在的图1及正文方法解释,不虚构另一幅图。

LICENSE论文及图 1 为 CC BY 4.0;模型及实现许可未确认。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

用部署动作任务反过来设计世界模型表示,而非假定视频重建越好控制就越好,且有同架构消融支撑。

反方 · 哪些结论还不够

只有一个骨干和仿真评测;真实接触、跨本体及多种子统计稳定性未被解决,表示噪声试验不等于未来信息消融。

综合判断

适合研究低延迟WAM的动作接口;真实部署价值应由接触任务与分布偏移的独立闭环测试确定。

我会先做的验证

未执行的验证方案:保持教师、参数和训练预算,比较32token、稠密接口、当前/未来/打乱未来监督;在真实多物体任务和统一扰动集上多种子报告成功率、碰撞、P95延迟及失效类型。

继续探索具身智能