动作编码换一种写法,世界模型为何会改变预测
绝对与相对动作的等价性,需要模型和接口共同满足
这项研究检查同一物理动作改用绝对或相对编码后,潜空间世界模型是否保持预测一致。简单的成对一致性损失能降低差异,但也可能牺牲原本较好的预测,不能只看一致性指标。
图解主要方法
图 1 的失败案例说明了什么,又不能说明什么?

- 1
先定义有条件的动作等价
相对动作由绝对目标减去当前状态得到,两者在状态、单位与坐标约定已知时可互换。论文的状态探针支持可恢复性,但这不证明只给动作而不给必要状态也等价;上线接口必须保留转换条件。
- 2
固定视觉表示,只改变动作表达
I-JEPA ViT-H/14 冻结,将图像中间层 patch 均值及标准差作为状态;两层、每层 1024 的 MLP 接收潜状态与动作,在约四秒、十六采样点的预测窗口上学习 InfoNCE。这样能隔离部分动作编码效应。
- 3
用成对视图与一致性共同训练
对绝对和相对编码各计算预测损失,再加入余弦一致性约束。归一化预测的平均只是汇合表示,不保证优于两个原预测;一致性变高也可能是两个分支一起丢失有用信息。
- 4
同时检查排名、检索与最坏差异
未来检索排名和 32 候选动作识别用于检查行为信息;最坏余弦相似度则看视图差异。后者是有限测试集上的观测,不是任意动作都满足不变性的数学保证。
- 5
不要把潜状态滚动当作闭环控制
多步实验递归使用预测潜状态,但仍提供真实状态或动作条件,未让模型自行规划并执行机器人任务。更直接的基线是按已知约定先将动作规范化,论文尚未充分比较这条工程路径。
实验与证据
以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。
来源证据【数据】ALOHAcabinet 85 段按 68/17 分,coffee 50 段按 40/10,Push 206 段按 165/41;1200 训练、384 测试窗口、三种子、RTX 5090。 实验设置 ↗
我的解读我的解读:是小规模受控离线研究,不覆盖广泛机器人动作接口。
来源证据【恢复与排名】状态辅助动作恢复 R² 0.996,仅动作约 0.757;原模型 cabinet 未来排名从 6.19 恶化到 61.5。 等价认证与主表 ↗
我的解读我的解读:“可逆”依赖可用状态。严重的编码敏感性值得修复,但需分清模型缺陷与接口信息缺失。
来源证据【一致性代价】λ=16 时典型/转换视图 top-1 均为 41.1%;原教师典型视图约 53.1%,转换后约 15.4%。 正则强度实验 ↗
我的解读我的解读:修复大幅缩小落差,也降低强分支表现,不能只展示两边相等。
来源证据【有限集最坏值】最坏余弦约 0.779→0.995;Push 多步最坏末步从 −0.348 改善到 0.139。 多步与最坏情形表 ↗
我的解读我的解读:接近一致仍未使所有长轨迹稳定,平均指标会掩盖较差序列。
来源证据【附加反例】Push 的典型视图排名约 66.2→79.2;表 3 的平均末步余弦为 0.872。 表 3 ↗
我的解读我的解读:不能把正文所述首步值 0.946 移作末步效果,修复存在任务依赖的精度代价。
开放情况与使用许可
全文提及 Mezzanine 发布,但本次未找到能够对应本研究的可核实代码、权重及许可入口;不据此标为开源。
LICENSE实现许可未核实。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
将表示不变性与实际预测质量同时量化,揭示看似等价的控制接口可能成为世界模型失效源。
反方 · 哪些结论还不够
可逆性需要状态条件,三种子和有限窗口不能支持普遍保证;规范化接口基线及闭环规划仍缺失。
综合判断
适合成为动作条件模型的接口压力测试;训练一致性之前,应先确保坐标、单位和状态信息定义清楚。
我会先做的验证
未执行的验证方案:在同信息预算下比较显式坐标规范化、成对训练与一致性正则,测试新尺度、旋转和未见轨迹,再以闭环控制成功率确认收益。