aiwillknow.AI 前沿观察每日 08:00 开始整理
世界模型全文深读与原图讲解

ForeAct3D:让动作策略学习自己将改变的三维场景

训练时预测深度、语义与腕部位姿;几何闭合约束不等于可独立运行的物理模拟器

IN A NUTSHELL

ForeAct3D从VLA共享特征中解码当前与未来三维场景,并让未来查询读取策略生成的动作块,以背景静止、实例刚性和末端运动学约束训练表示。推理只输出动作,不必生成未来。LIBERO平均成功率从96.6%到98.3%,CALVIN平均连续任务数从2.94到3.73;真实机器人总成功从3/45到17/45,仍有明显失败空间。

01

图解主要方法

让未来预测读到策略自己的动作,能否用三维约束训练出更可靠的操控表示?

当前和未来查询解码深度、语义与腕部位姿,未来分支读取动作块,三维几何闭合约束回传到共享策略。
图2|策略动作、语义三维预测与物理闭合的训练数据流查看大图 ↗
University of Illinois Urbana-Champaign、University of Illinois Chicago、Cisco,arXiv:2610.04607v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · 版权归作者;arXiv非独占托管许可不等于图片再分发许可
  1. 1

    用六个查询表示两个时刻的几何

    外部相机和腕部相机图像进入StarVLA-OFT骨干,当前与未来分别设置深度、三类语义、腕部位姿查询。语义只有背景、机器人、物体三类,物体类不等于逐实例识别;未来是8步动作块的终点。

  2. 2

    把策略动作反馈给未来查询

    未来查询通过交叉注意力读取骨干特征和经MLP编码的策略生成动作块,再解码深度、分割、腕部位置和六维旋转表示。训练使用未来观测监督,推理仍直接预测动作,不需滚动模拟未来。

  3. 3

    以真值标定将深度反投影到共同坐标系

    背景在两个时刻有效且同像素的点至少32个时计算静止约束;物体按真值实例编号分组,以Kabsch刚体变换拟合再计算残差。这是依赖标签的训练正则,不是由预测三类分割独立恢复实例物理。

  4. 4

    加入运动学与近似接触权重

    腕部位姿由运动学和手眼标定监督;闭合夹爪且物体质心距真值腕部相机位置0.10米以内时使用接触启发式权重。该代理不测量真实接触力,位姿误差在场景监督与闭合目标中叠加。

  5. 5

    联合优化策略与辅助损失

    深度L1加0.5倍梯度项、分割交叉熵加Dice、位姿误差与动作目标共同训练;闭合权重前2000步从0升到0.1。总30000步、全局批量128、16张A100 40GB,不把辅助预测当额外测试时规划器。

02

实验与证据

全文及附录A1–A7已读;图2视觉核验;官方仓库递归文件树和MIT许可已检查。未训练或执行作者模型。

来源证据LIBERO一套策略覆盖40任务,每任务50次,共2000次评估;平均96.6%到98.3%。 表1;A1 ↗

我的解读属于相同基础策略的1.7个百分点改善;另一些按套件训练的方法到98.5%,不能称跨协议统一最高。

来源证据CALVIN ABC→D,1000条最长5任务链:平均2.94到3.73,完成五任务比例54.8%。 表2 ↗

我的解读无机器人预训练组有优势,但使用机器人预训练的DreamVLA达4.44,组别差异必须保留。

来源证据几何对照的未来跨度:本文8步、CLOVER5步、DreamVLA3步。 表3;A4 ↗

我的解读不是严格同预测难度;CALVIN场景Chamfer本文0.0206反而高于CLOVER0.0195,不能称全部指标领先。

来源证据固定8步,CALVIN加入动作条件后实例Chamfer0.0183到0.0137,质心1.77到1.25厘米。 动作消融表 ↗

我的解读支持动作信息对预测有帮助,但没有测试相同场景不同动作的独立反事实正确性。

来源证据CALVIN使用预测语义筛选后质心误差1.25到3.49厘米、召回92.8%到65.9%。 A4 ↗

我的解读实际预测掩码显著削弱优势,评估仍依赖真值实例编号,不能称完全无标签定位。

来源证据LIBERO预测掩码质心误差1.06到0.87厘米,但无效预测深度和不足点数实例会被排除。 A4 ↗

我的解读数值变好可能包含保留样本改变,未给完整覆盖率前不能推断预测掩码优于真值。

来源证据未来分割总体mIoU:LIBERO88.8、CALVIN85.8;Spatial物体类IoU45.7。 分割明细表 ↗

我的解读背景和机器人较容易,会掩盖关键物体类别的不足。

来源证据CALVIN移除运动学、背景、刚性、全部闭合分别得到3.68、3.65、3.55、3.45,完整3.73。 闭合消融 ↗

我的解读刚性目标的消融降幅最大,但耦合损失和单次结果不构成通用因果排序。

来源证据真实AgileX三任务各50演示,每配置每任务15测试;基础3/45,完整17/45。 真实实验及A7 ↗

我的解读提高31.1个百分点;4种配置总180试验,不应把某到达阶段5/5成功概括为总体100%。

来源证据插笔任务15次中基础3、语义7、几何9、完整9成功;长程任务基础0、完整3。 真实任务表 ↗

我的解读动作条件的收益因任务而异,长程完整成功仍仅20%,需保留失败和样本量。

03

开放情况与使用许可

截至核查,官方仓库只有README、LICENSE和4张展示图,未发现训练代码、模型检查点或数据下载。README标MIT不代表不存在的实现已开源。

LICENSE展示仓库MIT;本文引用论文图2,论文为arXiv非独占托管许可,非通用图片再分发授权。模型与数据许可未知。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

同一基础策略的累计消融由96.6%到97.3%、97.9%、98.3%,与语义、几何约束、动作条件逐步加入相对应。

固定预测跨度的动作消融中,CALVIN未来实例质心误差从1.77厘米到1.25厘米,定位召回从79.9%到92.8%,支持动作条件提高几何预测。

反方 · 哪些结论还不够

相同像素的实例对应不等于物体表面追踪;物理闭合依赖真值标签和刚体近似,不能证明学到通用接触物理。

几何指标筛掉无效预测深度和不足点数实例,遗漏部分未统一计入失败,需与覆盖率一起读。

真实机器人每设置每任务15次、共3任务,没有种子区间;最终37.8%成功率尚不足以称可靠部署。

综合判断

证据支持把受动作约束的三维辅助预测作为VLA训练信号;尚不能将其当作经过反事实检验的世界模拟器,或宣称消除碰撞、接触与长程控制错误。

我会先做的验证

建议实验(尚未执行):固定视觉骨干和训练预算,对同一初始状态执行多种动作分支,用真实轨迹检验未来预测;同时报告未预测实例和无效深度比例,在大物体位移、铰接、柔性物体及标定噪声下做多种子对照。

继续探索世界模型