Dex-X补收:从人类视频借轨迹,从仿真补接触力
视觉触觉融合改善抓取,已知网格与动作参考仍是部署条件
Dex-X先从人类视频恢复手和物体轨迹,在仿真中训练带触觉的特权教师,再蒸馏到点云与触觉融合的学生策略。9月7日首发,今天补收v2;关键贡献是用仿真补视频缺失的接触信息,不能解释为仅看任意视频就能自主操作未知物体。
图解主要方法
图2中教师拥有而学生没有的状态是什么,触觉怎样进入统一点云?

- 1
恢复示范并重定向到机器人
预先扫描或重建物体网格,用FoundationPose估物体、WiLoR/MANO估手,再消除穿透并平滑轨迹。重定向先臂后手,拇指食指加权;示范做位置和偏航扰动。这些几何与标定准备不包含在“零样本上真机”的说法里。
- 2
让仿真教师学习接触丰富的跟踪
4096个并行环境以30Hz训练PPO教师,控制7臂加22手自由度。教师用特权状态及未来动作参考;五指力来自仿真,不是人类视频实际测量出的接触力,并加入动力学、PD与触觉噪声随机化。
- 3
把触觉放到手指接触点坐标
学生融合1024场景点、6手点和25触觉点,共1055点,每点含XYZ、类型和力值,经PointNet汇总后结合417维向量。相比教师移除部分物体特权描述,但仍有动作参考和任务目标信息,不能称完全无先验端到端模仿。
- 4
用DAgger蒸馏再做真实闭环
学生在自身访问状态上向教师取标签,30Hz输出臂增量与手目标。真实迁移不微调策略,但仍做相机及机械臂增益标定;五指力幅值不能完整感知剪切或滑移,未知类别与接触模式仍可能失败。
实验与证据
以下为作者报告;已阅读 v2 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。
来源证据【仿真教师】六类平均65.9%,ManipTrans21.9%;但旋转36.8低于对照56.9,插销43.1低于DAPG52.8。 教师结果与分任务表 ↗
我的解读我的解读:平均领先不代表每类最好;DAPG只测五类,其40.6须与相同五类Dex-X61.7比较。
来源证据【真实学生】抓方块28/30,杯子倒水24/30、抬举22/30,刮板16/30;去视觉14/30、去触觉11/30、仅本体8/30。 实机结果与模态消融 ↗
我的解读我的解读:融合信息有价值,但复杂工具操作仍弱,不能把教师仿真均值当学生真机结果。
来源证据【公开复现范围】仓库有教师/学生三个pth文件;检查点说明明确额外数据增强未随发布,默认仿真与检查点训练时的臂高也不同。 作者checkpoints/README与论文附录 ↗
我的解读我的解读:教程跑通不等于精确复现论文,须锁定配置并分别报告公开版本基线。
开放情况与使用许可
官方仓库已有训练、蒸馏、部署源码与教师/学生检查点文件;额外数据增强未完整发布,教程仿真与原训练设置有差异。本站未加载权重或执行机器人试验。
LICENSE项目自有代码MIT;Franka和Sharpa资产等第三方材料另有Apache-2.0及各自条款,不能用根MIT覆盖所有上游。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
用仿真接触补足视频监督盲区,并以有空间位置的触觉点云融合视觉与力,机制明确。
反方 · 哪些结论还不够
依赖已知网格、轨迹参考与标定;类别迁移、剪切滑移感知和发布数据完整性仍有限。
综合判断
适合有物体模型和示范的灵巧操作研究,部署验收应看学生真实闭环及新物体,而不是只看教师成绩。
我会先做的验证
未执行的验证方案:固定公开视频与公开检查点,在相同标定和动作参考下做视觉/触觉/力噪声消融;对新类别、滑移、透明物体分层,报告30次以上成功、接触力峰值和失败恢复,并单列未发布增强的影响。