aiwillknow.AI 前沿观察每日 08:00 开始整理
世界模型全文深读与原图讲解

H-JEPA:用多层时间抽象规划,而不是逐帧生成未来

上层决定慢变化的子目标,下层细化动作;真实视频实验测轨迹相似度,并未执行机器人闭环

IN A NUTSHELL

H-JEPA把动作条件JEPA叠成不同时间尺度的潜在世界模型,先规划高层子目标,再向下细化到实际动作。AntMaze成功率从单层18.0%提高到三层73.3%,但Push-T三层反降至17.3%。论文还解释了一个关键失败:表示可以记住静态背景、满足分布正则,却完全丢掉机械臂运动;DROID因此需要逆动力学监督。

01

图解主要方法

潜在表示的时间层级,能否让长程规划既省搜索又保留真正可控制的信息?

三层模型分别以20、10、5个环境步预测,最高层子目标约束较低层,右侧比较规划TFLOPs与成功率。
图1|高层子目标向下传递与规划计算预算查看大图 ↗
纽约大学、AMI、Inria、布朗大学,arXiv:2610.06805v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · CC BY 4.0;保留作者署名,原图用于方法评论
  1. 1

    各层学习不同的状态与动作表示

    底层视觉编码器产生状态潜变量;上层MLP再编码下层状态,并把一段下层动作汇成宏动作。模拟任务每层时间跨度乘2,图1分别对应5、10、20个环境步;状态窗口为1,不应误读成直接把多帧状态池化。

  2. 2

    在潜在空间预测并控制坍塌

    各层预测器利用动作预测未来表示,端到端训练,不用像素重建、奖励或EMA目标。SIGReg将随机投影的表示分布推向标准高斯;但跨场景变化的背景也能满足此目标,不能单靠分布满秩保证动作有用。

  3. 3

    真实视频另加逆动力学

    DROID通过相邻状态预测动作,迫使表示保留与控制有关的信息,并对动作表示加入正则。附录给出的下界只针对精确静态坍塌,依赖动作不能由场景身份充分预测;它不是排除所有近坍塌或干扰特征的保证。

  4. 4

    先优化宏动作,再逐层兑现子目标

    高层用梯度优化搜索宏动作序列;下层通过自己的预测器,让预测状态投影到上层后接近子目标。并非直接把高层向量逆映射为物理动作;初始化、截断与多起点优化减少离分布搜索,但不证明可达。

  5. 5

    按评测环境区分闭环与离线

    模拟任务执行短动作段后重新观测和规划。DROID则在5fps的36步区间一次开环规划,以累积末端位置轨迹与录制专家的Fréchet距离评分,未将动作交给真实机器人执行。

02

实验与证据

完整正文和A–M附录已读;图1视觉核验;官方代码、模型文件清单、数据卡及许可已打开。未训练或运行规划器。

来源证据模拟4环境,各50个固定规划任务,训练/规划配对种子42、43、44;报告均值与标准误。 图6;评测附录;README 3.2 ↗

我的解读规划预算与参数经过验证选择,结果不是无调参部署;公开FourRoom任务可独立生成,不能把探针数据重叠直接推广到此任务集。

来源证据AntMaze单层18.0±3.5%,三层73.3±3.5%,四层63.3±7.7%。 图6 ↗

我的解读三层改善明显而四层回落;Ant还输入27维本体信息,不能描述成完全仅RGB。

来源证据FourRoom单层40.7%、三层96.0%;Cube32.0%到60.0%;Push-T40.0%到17.3%。 图6及训练消融 ↗

我的解读不同任务的时间抽象适配程度不同。增加层数也改变有效训练样本和预测跨度,尚非隔离的机制实验。

来源证据同一个三层AntMaze检查点:底层规划16.7%,底层规划但用最高层代价22.0%,完整层级73.3%。 表1 ↗

我的解读较好的代价表示只能解释部分改善,多时间尺度搜索贡献更大;不能与其他模型18.0基线混作同一消融。

来源证据DROID评测16个片段,3个训练种子及3个规划种子;0分对应不动,100分为专家路径完全相符。 4.3及DROID附录 ↗

我的解读Fréchet相似度可为负;不是成功率。位置相似不保证姿态、夹爪和接触正确。

来源证据DROID采用100epoch、每epoch292步、全局批量256;公开README列74896条训练CSV,数据卡记录74516个实际目录和缺失文件。 DROID训练附录;官方数据卡 ↗

我的解读论文正文与发布数据统计不完全一致,加载失败时替换随机episode改变有效采样,复现应记录实际读取数据而非只引用名义条数。

来源证据FourRoom验证/探针文件是训练前150/600/150集;DROID监控验证64集中的62集也在训练CSV。 官方数据卡 ↗

我的解读明确影响验证和探针泛化证据;16个DROID规划评测片段声明被训练排除,二者不能混淆。

来源证据无逆动力学时,时间排斥可以恢复动作敏感性,但所测配置未超过不动基线;强排斥也会保留无意义快变化。 附录L表12 ↗

我的解读让表示随时间变化不等于学到可控制的前景,理论分析和这一负结果相互补充。

来源证据额外阶段训练在AntMaze低层探索/高层拼接得到67%,反向组合2%。 阶段训练附录 ↗

我的解读说明各层数据分工重要;该实验配置不同于主表,不能直接当作73.3%的同条件替代。

03

开放情况与使用许可

GitHub包含训练、分层规划和评测实现;Hugging Face实际列出84个模拟与9个DROID检查点及数据。仅检查文件清单和文档,未下载全部权重。公开数据目录与论文统计有差异,复现应锁定版本与manifest。

LICENSE代码与模型卡MIT;论文和数据卡CC BY 4.0。DROID需同时保留原数据作者署名;Push-T/Cube沿用所列上游许可。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

同一三层AntMaze模型,底层平面规划16.7%,仅换高层代价22.0%,完整层级73.3%,表明收益不仅是更好的距离度量。

与层级规划搭配的可学习上层表示,在多个任务优于共享潜在空间的受控基线;作者公开了跨种子模型和评测入口。

消融与理论共同指出边缘分布正则不能排除只编码静态背景的解,逆动力学为丢失动作信息引入额外代价。

反方 · 哪些结论还不够

Push-T由单层40.0%到三层17.3%、四层0.7%;更深模型可用训练转移仅约58%与14%,不能把深度效果完全归因于抽象能力。

数据卡说明FourRoom验证与探针文件取自训练文件前若干集,DROID监控验证64集有62集在训练CSV中;这影响这些验证/探针指标的泛化解释,但不能据此断言另行生成的50个规划任务或排除的16个DROID评测片段也泄漏。

DROID选择16个光照和物体可见性较好的片段,以位置路径评分,不测方向、夹爪和接触,且不同基线视频采样设置不完全一致。

综合判断

支持用独立潜在空间和时间尺度改进部分长程规划,也提供了值得复现的坍塌诊断;不足以宣称通用真实机器人任务成功或层数越多越好。

我会先做的验证

建议实验(尚未执行):锁定公开检查点和数据manifest,重新生成完全独立的验证/探针集;按有效转移数、训练FLOPs及规划FLOPs匹配各层数,在未参与调参的新DROID片段和真实闭环任务上同时报告路径、抓取与完整成功率。

继续探索世界模型