Morphometric Imitation:先改变人手形态,再找回接触并训练机器人
三类手的运动学与动力学验证,Sharpa真机268/300;接触位置与接触手指数是不同约束
方法先将MANO按目标手掌和手指比例变形,再恢复原人手在物体表面的接触位置,最后把骨架转成机器人关节轨迹。残差强化学习负责物理可执行性,点云学生策略再迁移真机。结果有明确跨手参考收益,但真实部署仍是每类别单策略、单种硬件,并非任意视频到通用灵巧操作。
图解主要方法
怎样跨越人手与机器人形态差异,同时保留物体上的接触并获得可执行策略?

- 1
让MANO先接近目标机器人的比例
六个缩放量独立控制手掌和五指,URDF长度比初始化;优化全局姿态与指关节,使对应骨架和指尖对齐。少指手把多个人类手指合并,缺失关节用插值虚拟点,形态匹配每种手只做一次。
- 2
在同拓扑网格上恢复原接触
v2用4.5毫米提取参考接触顶点,逐帧优化变形后MANO的姿态,兼顾接触位置、合并手指相对距离、桌面穿透和姿态正则。无接触帧沿用最大接触帧的顶点身份,但目标取当前帧位置,维持预抓取连续性。
- 3
把变形骨架转成机器人关节
热扩散求骨架混合权重,线性混合人手关节变换产生稠密机器人关节/指尖目标,再恢复姿态并联合求臂手IK。添加手表面采样桌面检查,逐帧以前帧初始化;运动学仍不能保证动力可行。
- 4
用特权状态残差PPO修正参考
关节命令等于参考加残差。物体ADD追踪奖励乘以接触手指数一致性奖励,同时观察未来参考、物体参数和接触;过大追踪偏差经EMA终止,桌面碰撞和过大接触力立即终止。
- 5
将物理演示蒸馏为点云控制
每类别一万条仿真演示,学生接收前后两帧点云、关节和前次动作,采用ManiFlow编码与流匹配。点云去桌面、加入残留和噪声,512点输入;每次执行三步、10Hz控制后重规划,不访问教师特权物理参数。
实验与证据
v1全文112486字符与A–D已读,v2全文112331字符逐项比对修订和新增统计;图3核验,项目及GitHub实际目录核查。
来源证据三手各十条GRAB轨迹;5毫米位置感知F1:Dex3 38.0、Allegro30.3、Sharpa37.2。 表II;A ↗
我的解读相对最强基线均值增益27.8、8.3、10.5点;不是触觉传感器准确率,也不证明动态抓取成功。
来源证据失败接触分数记零;连续距离只在所有方法成功的交集8/9/10条比较。 A.D;表VII ↗
我的解读不能把失败轨迹距离记零,否则会奖励失败;F1宏平均也不等于表中平均精确率与召回率的调和平均。
来源证据Sharpa相对Contact PyRoki的F1差10.5点,95%区间[-7.1,26.6];对Position[-4.5,28.3]。 表VIII ↗
我的解读13/15对照区间不跨零,但没有多重校正;反映十条演示的差异,不是独立训练种子误差。
来源证据每类别2048仿真轨迹:Dex3 SR82.5%、Allegro69.9%、Sharpa91.8%,最强基线53.2%、68.2%、56.5%。 表III;v2表X ↗
我的解读Allegro增益很小且类别波动大;其对Position配对增益1.6点区间[-27.1,29.0],不能泛称每种手显著提高35点。
来源证据移除接触信息,三手SR降至51.2/47.6/76.6%;移除物体信息则42.5/41.6/54.3%。 表IV ↗
我的解读同时改观察、奖励和终止,不是只移除单个奖励;两源互补,但无法定位各个接口的独立贡献。
来源证据动力学后Allegro全轨迹接触F1本方法6.7,Position8.3,去物体位姿变体8.7。 表IX ↗
我的解读任务成功率高并不保证最忠实重现接触位置;奖励只约束手指数,需保留这种任务与模仿保真的区别。
来源证据教师仿真91.78%,学生93.75%,真机89.33%=268/300;教师每类别2048、学生64次仿真。 表V;D ↗
我的解读测试量和具体采样不同,学生更高不直接证明超过教师;真机也没有所有基线的同硬件比较。
来源证据每类别三实例各十姿态:九点为10×10厘米区域中心/边界固定网格,第十点为更大偏航或区域外压力测试。 VII.A;D;图10 ↗
我的解读v2纠正了随机姿态的笼统措辞。270网格试验失败29次,其中22次位于靠近机器人的一排,位置泛化仍不均匀。
来源证据酒杯玻璃无LiDAR返回,杯中乒乓球是唯一可见物体部分;成功28/30。 VII.A;D;图9 ↗
我的解读证明辅助部分观测下可操作,不能宣称看不见透明物体也能无辅助定位。
来源证据真机成功要求无硬桌碰撞、抬升至少5厘米、完成指定轨迹并稳持5秒;报告无硬碰撞失败。 VII.B、VII.F;D ↗
我的解读这是该300次试验的观测,不是形式安全保证。薄胶带环和厚闹钟失败体现尺度随机化未覆盖形状拓扑。
开放情况与使用许可
官方仓库只有README及展示GIF/MP4,明确代码即将发布;未核实到训练代码或权重,不标开源。论文指向的补充内容公开在附录A–D,部分正文所提训练细节未见完整参数表。
LICENSE论文和图3CC BY 4.0;占位代码仓库未见LICENSE。MANO、GRAB及机器人资产另有许可,不能把论文许可延伸到它们。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
统一残差RL与超参数比较不同运动学参考,三手成功率均提升,较纯几何指标更接近实际用途。
接触指标同时匹配时间、手指和物体表面位置,并以表面积加权,避免只接近物体就算正确。
300次真机实验列出物体实例、位置分布和失败类型,清楚揭示透明物体与局部工作空间条件。
反方 · 哪些结论还不够
Sharpa接触F1对两个基线的95%配对区间跨零,Allegro多数成功率对照也未显著,不能把最高均值写成全面确定胜出。
RL接触奖励只数接触手指,不约束具体表面位置;动力学后Allegro接触保真并非最好。
逐类别策略、人工选择的十条动捕演示和辅助可观测酒杯,离任意自然视频规模化仍有距离。
综合判断
形态—接触—动力学的分阶段思路有充分机制与实验证据;最扎实的是限定任务的参考质量和仿真到真机可行性,而非通用跨形态策略或无条件物理安全。
我会先做的验证
建议实验(尚未执行):公开实现后用多训练种子复核,统一多类别学生并换机器人硬件;增加真实单目重建噪声、透明物体无辅助感知、工作空间外位置和不同接触拓扑,分别量化接触位置、力和任务成功。