LAC-WM:用有监督潜动作连接人手与不同机器人
从动作条件转向共享运动表征;灵巧任务增益46.7%是相对值,实际成功率15%到22%
LAC-WM从相邻视觉状态推断连续潜动作,以运动解码监督和交叉增强限制视觉捷径,再把未见机器人显式动作映射进共享空间。三类人/机器人数据预训练后,在新灵巧操作形态上选择VLA候选动作的平均成功率为22%,显式动作模型为15%;修改后的LIBERO为92%对82.4%。这些结果来自仿真与有目标示范的动作筛选,并非无需标注的零样本实机迁移。
图解主要方法
不同机器人是否能共享动作意义,而不只是把不兼容的动作维度补齐?

- 1
把视觉变化编码为连续潜动作
冻结V-JEPA2视觉编码器,逆动力学IDM读取当前与后继状态,输出64维潜动作;前向动力学FDM以当前视觉与潜动作预测未来特征。连续表示没有向量量化,但仍可能编码外观捷径。
- 2
用交叉增强和运动标签约束捷径
IDM读取一套增强后的前后帧,FDM读取另一套增强的当前帧并使用同一潜动作,预测第二套后继特征。运动解码器再监督末端/手指与相机运动,潜动作前后半分别解码两类;这显式使用标签,不是纯视频无监督。
- 3
为新机器人分三阶段适配
先LoRA秩2微调IDM/FDM共20k步,再冻结FDM训练原始动作到潜动作的投影器5k步,最后投影器与FDM联合35k步。测试没有未来帧,必须靠动作投影器生成潜动作;总60k步不等于零样本。
- 4
以目标图筛选策略候选
从VLA采样动作,世界模型想象后继,与示范子目标在特征空间比较。灵巧设置每轮500候选、100动作长度,选最好3条取动作平均并执行整块;平均后的动作未必等于某条已评估轨迹。
- 5
把视频质量和闭环决策分别验收
BFA评8帧图像质量,再检验接触、抬起与最终放置;LIBERO换Cosmos编码器、π0.5策略和40步想象,选一条后仅执行25步。两套设置的数据与模型都变,不能只归因于编码器。
实验与证据
已读全文及附录A.1–A.7,核对图1、数据和训练阶段、表1/2/4/6;原图视觉核验;未独立训练或运行机器人。
来源证据EgoDex、Agibot、DROID各50k轨迹,合150k;BFA微调7265轨迹,仅约20%成功。 4.2–4.3;A.1–A.2 ↗
我的解读人类和双臂资料能共享训练,但BFA虽然双Franka/Allegro装置,实验只用右臂;不是双手协作验证。
来源证据预训练80k步,先60k去FDM时间注意力,后20k加回、时域8;64 H200约4天。 A.4 ↗
我的解读比较应计入预训练成本和稳定动作条件的训练日程,不能只报推理小批耗时。
来源证据未见实例PSNR27.484、LPIPS0.037、FVD23.213;EAC为24.252、0.057、30.349。 表1;A.3 ↗
我的解读像素由另训153.8M图像解码器重建,图像质量反映组合系统;512测试窗口并非512完整机器人任务。
来源证据BFA每划分100回合、3种子:实例成功25%±3%、新类别18%±2%;EAC16%±4%、14%±4%。 表2 ↗
我的解读论文两划分等权平均22%对15%,提高7个百分点即46.7%相对;不是按25个类别加权,也不是提高46.7个百分点。
来源证据平均接触85%、抬起58%、最终成功22%。 表2 ↗
我的解读世界模型选择动作改善部分接触,不代表已经解决后续持握、移动和放置。
来源证据修改LIBERO五变体各25回合,共125:LAC92%、EAC82.4%、VLA均值81.6%。 6.2;表4 ↗
我的解读提高9.6个百分点或11.7%相对;每任务25次,且为新对象/位置变体,不是全套原版LIBERO官方榜单。
来源证据LIBERO适配2000原任务轨迹与200扰动π0.5轨迹;后者110成功90失败。 6.2 ↗
我的解读额外失败数据有利于候选筛选,应同样计入训练数据预算,不是只看成功示范。
来源证据固定24k轨迹两来源换三来源,以及三来源从24k增至150k均改善;删MD与交叉增强联合后新类别13%对18%。 图4–5;表3 ↗
我的解读前者部分分离规模与多样性,后者同时改两机制,无法单独量化解码监督的因果贡献。
来源证据改为从训练集采动作:每划分50回合×3种子,LAC新类别10%、EAC8%、从零3%。 A.5;表6 ↗
我的解读这与VLA候选22%的主结果不可混用;候选质量显著制约最终上限。表6平均特征距离24.50与两划分24.60/25.39的算术均值不符,本文不据该格主张优势大小。
来源证据附录VLA用2000成功示范,15Hz、动作块100;L40S批10预测8帧约0.1秒。 A.4、A.6 ↗
我的解读约6.7秒整块执行可能放大模型误差;单批世界模型耗时不含500候选、子目标、编码和控制开销。
开放情况与使用许可
官方项目页提供论文与视频,但Code没有可访问仓库链接,未核实训练代码、检查点或模型卡。OpenReview条目访问遇浏览器验证,无法确认更早首发日;按既有会议工作补收。
LICENSEarXiv论文CC BY 4.0,图1按署名保留原图;代码和权重许可尚不能确认。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
相同VLA候选来源下,LAC-WM在两个灵巧划分及五个LIBERO变体均高于显式动作世界模型,支持共享潜动作对适配的实用价值。
固定24k总轨迹的两/三来源对照与固定来源增数据对照,分别检验形态多样性与数据规模,较单纯堆数据更有解释力。
反方 · 哪些结论还不够
预训练不是无标注:运动解码器监督末端、手指与相机运动;UMAP重叠不证明因果解耦。
每回合需要目标示范图,VLA-only不使用该信息,不能把全部提升归于世界模型架构。
灵巧平均成功率仅22%,接触85%、抬起58%到最终任务之间仍有大落差。
综合判断
证据支持潜动作和运动辅助监督改善有限形态的仿真适配;尚不足以宣称通用机器人动力学或零样本真实迁移。
我会先做的验证
建议实验(尚未执行):固定轨迹总量、标注量和算力增加更多形态,给所有策略相同目标信息;分别去掉运动解码与交叉增强,报告500候选的端到端延迟、置信区间及真实接触成功率。