aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

Dex-X补收:从人类视频借轨迹,从仿真补接触力

视觉触觉融合改善抓取,已知网格与动作参考仍是部署条件

IN A NUTSHELL

Dex-X先从人类视频恢复手和物体轨迹,在仿真中训练带触觉的特权教师,再蒸馏到点云与触觉融合的学生策略。9月7日首发,今天补收v2;关键贡献是用仿真补视频缺失的接触信息,不能解释为仅看任意视频就能自主操作未知物体。

01

图解主要方法

图2中教师拥有而学生没有的状态是什么,触觉怎样进入统一点云?

原论文图2:特权教师、接触点云与视觉触觉学生
原论文图2:特权教师、接触点云与视觉触觉学生查看大图 ↗
Ruoqu Chen 等,arXiv 2609.07747v2;原图内容未改动。 处理记录:原图内容未改动,白底 PNG 转码 · 原始来源与图注 ↗ · CC BY 4.0
  1. 1

    恢复示范并重定向到机器人

    预先扫描或重建物体网格,用FoundationPose估物体、WiLoR/MANO估手,再消除穿透并平滑轨迹。重定向先臂后手,拇指食指加权;示范做位置和偏航扰动。这些几何与标定准备不包含在“零样本上真机”的说法里。

  2. 2

    让仿真教师学习接触丰富的跟踪

    4096个并行环境以30Hz训练PPO教师,控制7臂加22手自由度。教师用特权状态及未来动作参考;五指力来自仿真,不是人类视频实际测量出的接触力,并加入动力学、PD与触觉噪声随机化。

  3. 3

    把触觉放到手指接触点坐标

    学生融合1024场景点、6手点和25触觉点,共1055点,每点含XYZ、类型和力值,经PointNet汇总后结合417维向量。相比教师移除部分物体特权描述,但仍有动作参考和任务目标信息,不能称完全无先验端到端模仿。

  4. 4

    用DAgger蒸馏再做真实闭环

    学生在自身访问状态上向教师取标签,30Hz输出臂增量与手目标。真实迁移不微调策略,但仍做相机及机械臂增益标定;五指力幅值不能完整感知剪切或滑移,未知类别与接触模式仍可能失败。

02

实验与证据

以下为作者报告;已阅读 v2 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。

来源证据【仿真教师】六类平均65.9%,ManipTrans21.9%;但旋转36.8低于对照56.9,插销43.1低于DAPG52.8。 教师结果与分任务表 ↗

我的解读我的解读:平均领先不代表每类最好;DAPG只测五类,其40.6须与相同五类Dex-X61.7比较。

来源证据【真实学生】抓方块28/30,杯子倒水24/30、抬举22/30,刮板16/30;去视觉14/30、去触觉11/30、仅本体8/30。 实机结果与模态消融 ↗

我的解读我的解读:融合信息有价值,但复杂工具操作仍弱,不能把教师仿真均值当学生真机结果。

来源证据【公开复现范围】仓库有教师/学生三个pth文件;检查点说明明确额外数据增强未随发布,默认仿真与检查点训练时的臂高也不同。 作者checkpoints/README与论文附录 ↗

我的解读我的解读:教程跑通不等于精确复现论文,须锁定配置并分别报告公开版本基线。

03

开放情况与使用许可

官方仓库已有训练、蒸馏、部署源码与教师/学生检查点文件;额外数据增强未完整发布,教程仿真与原训练设置有差异。本站未加载权重或执行机器人试验。

LICENSE项目自有代码MIT;Franka和Sharpa资产等第三方材料另有Apache-2.0及各自条款,不能用根MIT覆盖所有上游。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

用仿真接触补足视频监督盲区,并以有空间位置的触觉点云融合视觉与力,机制明确。

反方 · 哪些结论还不够

依赖已知网格、轨迹参考与标定;类别迁移、剪切滑移感知和发布数据完整性仍有限。

综合判断

适合有物体模型和示范的灵巧操作研究,部署验收应看学生真实闭环及新物体,而不是只看教师成绩。

我会先做的验证

未执行的验证方案:固定公开视频与公开检查点,在相同标定和动作参考下做视觉/触觉/力噪声消融;对新类别、滑移、透明物体分层,报告30次以上成功、接触力峰值和失败恢复,并单列未发布增强的影响。

继续探索具身智能