aiwillknow.AI 前沿观察每日 08:00 开始整理
世界模型全文深读与原图讲解

SplitJEPA:不重建像素,怎样分出世界中不变与变化的部分

可识别的是子空间;配对覆盖、白化和全局预测最优缺一不可

IN A NUTSHELL

SplitJEPA把预测表示和配对不变性结合:前者保留完整状态,后者决定哪些方向在相关观测间应保持不变。论文在受限高斯动态下证明两个潜在子空间可识别,并以合成系统及两种机器人仿真验证。它没有证明真实世界因素逐一可解释,控制测试的10cm阈值也应单独看待。

01

图解主要方法

保留整个状态的信息之后,还需要什么条件才能把扰动与任务内容分开?

论文图3展示预测配对、不变配对和正交块分解之间的关系
图3|预测恢复、配对不变性与块识别查看大图 ↗
伊利诺伊大学厄巴纳—香槟分校、卡内基梅隆大学、芝加哥大学,arXiv:2610.12349v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · 版权归作者;arXiv非独占托管许可不等于图片再分发许可
  1. 1

    用预测先缩小表示歧义

    图3上方的预测配对在潜空间对齐,不重建像素。证明用平稳高斯转移的Hermite谱:0<ρ<1时一次项相关性高于高阶项;精确中心化与白化约束下,全局最优表示只能是原状态的正交变换Qz。此时两块仍可能混合。

  2. 2

    用共享内容的配对找到不变方向

    图3中部的不变配对固定zH,只改变zL。若这些差分的二阶矩满秩,不变块保持一致就要求A12ΔzL=0,进而A12=0;没有变化的方向无法被排除,单纯增加相似样本不一定解决问题。

  3. 3

    利用完整白化消除反向串扰

    Q的正交性使A12为零后A21也必须为零,因此两个块各自在自身内部允许旋转,但不再跨块混合。近似一致时泄漏上界与sqrt(误差/最小变化特征值)有关;变化太弱会让界变松。

  4. 4

    区分合成谱求解与机器人联合训练

    合成实验冻结预测编码器,ZCA白化后对配对差分求最小特征值子空间。机器人改为ResNet-50双投影头、动作条件下一状态预测、方差/协方差正则与配对约束联合训练;这是理论启发的有限数据实现,不是精确定理条件自动成立。

02

实验与证据

完整阅读正文、证明与附录A–D,检查合成代码、机器人训练代码、Lean覆盖范围和数据发布边界。

来源证据合成主实验8维、每块4维、ρ=0.5,编码器1万次更新;用3万表示白化、3万配对求分块,独立探针与测试各1.5万,五种种子。 表1、附录C.1–C.3 ↗

我的解读全局恢复相同而分块改善支持组织结构的贡献;扩展维数和样本预算曲线只用seed 0,不能当作多种子稳健结论。

来源证据效率比较达到两块平均R²≥0.99:SplitJEPA五次全达到,V3仅三次;未达到者按全预算计入,封顶时间3.16±1.14秒对8.54±3.05秒。 附录C.4、图12 ↗

我的解读这是64与272个可训练参数的小型实现、不同原生配对结构,且排除构建和评估时间;2.70倍不应推广到大型视频模型。

来源证据每个ManiSkill任务800条成功轨迹,100组×8,组内保留20%轨迹验证;三种下游种子,每策略每条件100回合。相机方位±10°、光强0.6。 表2与附录D.1 ↗

我的解读跨轨迹按进度近似对齐,跨视图才是同一物理状态;这比理论精确不变配对弱。SR@10cm是任一时刻进入宽阈值,GRASP和CONTACT也只要求至少发生一次。

来源证据去掉跨轨迹多样性后PushCube相机测试可由71.5升到78.0%,PickCube却由30.3降到21.7%。 表6 ↗

我的解读数据多样性与配对准确性存在权衡;不支持“增加跨轨迹配对总会更好”。全表示在部分任务上优于只读不变块,变化信息仍可能对控制有用。

来源证据论文C.1使用未中心化差分二阶矩;当前simulation/splitjepa.py先减去差分均值再求协方差。 附录C.1、官方谱恢复代码与Lean README ↗

我的解读对理论零均值差分总体可一致,有限样本或有偏差分不一定相同。这是复现需核对的实现差异,尚未运行对照;Lean说明也未覆盖Hermite预测恢复的全部概率分析。

03

开放情况与使用许可

仓库a8d65ecbc3dd173d3130f588e685861551a79294确有合成实验、机器人训练及Lean文件;未发现LICENSE或权重。README明确机器人演示和配对文件不在仓库中;Lean只覆盖预测线性恢复之后的代数分块和不变性环节。

LICENSE论文arXiv非独占托管许可;可读源码未声明许可,不能据此宣称可自由复用。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

同一冻结编码器全局R²约0.9977,正确配对后不变/变化块R²达0.9979/0.9973;打乱配对后约0.71,隔离了配对结构的作用。

PushCube联合视觉扰动下只读不变块SR@10cm为64.5±12.7%,去不变性约束后15.7±11.0%。

反方 · 哪些结论还不够

SR@10cm定义为回合任一时刻进入目标10cm范围,不是精确放置且稳定保持;PickCube完整表示ID也只有46.3±4.9%。

只破坏一个策略根本不读取的变化块,保留近100%表现主要验证接口隔离;不能单凭这个实验证明像素扰动已经被正确分到该块。

理论是总体子空间识别,块内仍可正交混合;有限样本、近似配对、弱变化方向都可能留下串扰。

综合判断

这是一项值得纳入世界模型表示研究的理论与小规模实证工作。优势在于把条件讲清并给出可审计分解,不应包装为已解决开放世界因果解耦。

我会先做的验证

建议实验,未执行:固定编码器,逐渐减少配对变化方向并增加错配;比较未中心化二阶矩与当前代码中心化协方差,记录最小特征值、两块泄漏、不同维数以及严格2cm稳定到达率。

继续探索世界模型