aiwillknow.AI 前沿观察每日 08:00 开始整理
世界模型全文深读与原图讲解

HWAM:把人形机器人的实际身体状态也放进动作生成

联合预测不是额外的物理保证;三路径训练与状态目标存在明显交互

IN A NUTSHELL

高层策略给出关节参考,不等于低层全身控制器最终执行到的姿态。HWAM把下一采样时刻的本体状态与当前参考动作拼成联合生成目标,同时训练从轨迹预测视频、从视频重建轨迹、只看当前观测生成策略三条路径。三个OLI真机任务取得最高观察成功率,但状态监督单独加入另一种视频训练配方反而降分,证据支持组合设计而非状态预测总会改善控制。

01

图解主要方法

将执行后的本体状态与参考动作联合建模,何时能改善层级人形控制?

原图展示共同语言/当前状态条件与按路径通信;未来视频仅在相应训练路径生成,部署只下发动作。
图2|视频专家与联合状态—动作专家查看大图 ↗
LimX Dynamics、南方科技大学、浙江大学,arXiv:2610.12026v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · 版权归作者;arXiv非独占托管许可不等于图片再分发许可
  1. 1

    把命令与下一采样状态配对

    每个时间token先拼接[s(t+h+1);a(t+h)]再投影;状态是下一同步示范采样而非保证动作已完全收敛。两通道共享去噪时间与轨迹表示,状态信息可在每步影响动作。

  2. 2

    让视觉与轨迹专家共享条件、按路径交换信息

    冻结Wan2.2因果视频VAE,UMT5-XXL编码语言;WanVideoDiT和ActionDiT参数分开,通过路径掩码交叉注意力通信。当前多视角图像、本体状态、语言构成条件。

  3. 3

    用互补方向训练,再补部署一致的策略路径

    FDM用干净联合轨迹预测未来视频;IDM用干净当前/未来视觉重建联合轨迹;Policy只看当前条件,隐藏未来视频,仅去噪联合轨迹。每minibatch三选一且等概率,各路径权重1,状态动作MSE合并平均,无额外通道加权。

  4. 4

    部署只下发参考动作

    未来本体状态仍参与联合去噪,但只将动作送低层控制器;不把预测状态当实际测量,不在部署生成未来视频,也没有独立约束保证动作与状态物理一致。

02

实验与证据

已读正文和附录A–D,核对原图2、逐项试验数与区间;查看官方项目页开放状态,未独立复现。

来源证据OLI动作/下一状态MAE4.420°、稳态2.885°;ALOHA为0.648°/0.402°。 4.1;附录A表3 ↗

我的解读说明跟踪不是完美,但正文称附录提供完整协议、逐关节统计,实际附录A主要为汇总表;同步延迟等混杂尚不能排除。

来源证据OLI三个任务分别1,783/4,220/404训练episode;Candy另422离线验证。16张A800、全局batch128、AdamW学习率10⁻⁴、六epoch。 4.2;附录B ↗

我的解读任务特定训练;“无额外机器人预训练”不代表无视频预训练,也不是所有基线预训练预算匹配。

来源证据Candy HWAM84/119=70.6%,95%Wilson[61.9,78.0];π0.5为75/120=62.5%,[53.6,70.6];Fast-WAM52/120=43.3%。 表1;附录C.2表7 ↗

我的解读区间假定独立Bernoulli试验,不包含训练seed变化;另两任务未给同样完整计数,不能自行推算分母。

来源证据Plush消融VGM/Policy动作60.0%、加状态45.5%;FDM/IDM/Policy动作55.0%、加状态73.3%。 4.5表2 ↗

我的解读两个状态效应相差32.8个百分点;支持交互,但未拆开FDM与IDM或架构因素,也未给此消融不确定性。

来源证据四去噪步、32步chunk、31公共关节,HWAM平均动作MAE3.816°,三路径仅动作4.024°。 4.4图5 ↗

我的解读是held-out示范的开环预测诊断,不能等同于闭环碰撞或成功率;状态误差与另一状态模型相近。

来源证据12段抓合前验证片段,预测轨迹条件下各模型PSNR20.345–20.844,HWAM20.501;真实轨迹条件动作20.559,状态+动作23.336。 附录C.1表5–6 ↗

我的解读真实状态帮助解释图像,但完整端到端预测没有视频质量领先,不能用oracle诊断解释控制增益。

来源证据ALOHA另用640示范训练,HWAM折衣得分86.00,GR00T N1.5为78.75、π0.5为77.00。 附录D表9 ↗

我的解读0–100分含阶段部分分,不是86%完整成功率;这不是OLI到ALOHA零样本迁移,且未给足试验数/误差。

来源证据Candy按方向和工作区的拆分中,HWAM并非每方向最高。 附录C.3表8 ↗

我的解读这些是任务内子组,不是保留空间分布的域外泛化试验。

03

开放情况与使用许可

官方hwam.vercel.app将Code、Dataset、Video列为Coming soon;模板仓库不是研究代码。论文以FluxVLA Engine为基础,不等于HWAM实现或权重已公开。

LICENSEarXiv为非独占分发许可;图2用于必要方法评论并明确署名来源,不表示获得通用复用许可。项目网页模板CC BY-SA 4.0不能推定为模型、数据或论文插图许可。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

完整配方在OLI三个任务观察成功率70.6%、46.7%、73.3%,均为表中最高。

匹配的2×2消融中,三路径配方加入状态预测55.0%→73.3%,支持联合状态与该配方搭配。

反方 · 哪些结论还不够

另一配方加入状态预测60.0%→45.5%,不能把完整模型增益归因于状态目标单独作用。

Candy对π0.5提升8.1个百分点,但两个Wilson区间重叠,且未给配对检验或训练种子不确定性;不声称显著胜出。

预测条件下未来视频PSNR没有优势,使用真实未来状态的23.336属于诊断上界,部署得不到这些未来条件。

综合判断

联合动作与执行状态是可检验的建模选择,最强证据是配方交互而非更逼真的视频;目前不足以证明跨任务普遍优势或真正识别了低层物理。

我会先做的验证

建议实验(尚未执行):固定训练预算、采样率和控制器,复现实验全部2×2条件并加入仅FDM/仅IDM消融;多训练种子、随机化真机试验顺序,报告成功差区间,同时扰动延迟与控制器增益测状态预测是否仍有价值。

继续探索世界模型