GOTT:用一个跨手接触基元连接物体轨迹与灵巧执行
到达、建立接触、再跟踪;跨手复用不等于无需模型和规划
GOTT把任务拆成Reach–Acquire–Move:上游给物体轨迹与大致接近姿态,共享闭环策略修正手指和手腕以建立稳定接触,之后按物体位姿误差跟踪。21关键点和26关节槽映射支持多手联合训练,把局部接触技能与手臂可达性规划分离。
图解主要方法
能否把稳定接触做成跨机器人手复用的中间技能,而让任务轨迹和手臂规划各司其职?

- 1
生成任务相关接近方案
四视角VLM定位持握区域并回投网格,区域内采样10个近似初始姿态;cuRobo规划进场,沿完整物体轨迹做IK筛选,选择总关节移动最小可行解。
- 2
统一多手观测动作
21手关键点、26关节槽和二值mask处理不同手;输入五帧关节位置/目标/关键点历史,加各链接到512物体表面点的最近位移,输出6D手腕与关节增量。
- 3
在仿真学习局部接触
16个YCB物体、每物体静止姿态4000有效种子,PPO4096环境2000轮;奖励鼓励拇指对指接触、5cm提起、物体稳定,随机质量摩擦和执行增益。
- 4
以独立接触预测切换
冻结策略后训练本体感觉MLP,预测各指接触;拇指与至少一其他手指概率>0.5持续五个10Hz步骤才进入跟踪,避免单帧误触发。
- 5
物体位姿闭环追踪
SAM2初始分割与FoundationPose约45Hz供位姿,抓牢后短提起,以近似固定手物变换和当前物体误差修正末端目标;高层来源可替换而接触策略不微调。
实验与证据
全文及附录A–F、基线再现、接触预测及运行时读完,图1核验,作者项目页实际查看。
来源证据仿真9588资产、54149物体尺度姿态实例,每实例20共同初始姿态;统一策略平均78.7±1.1%,CrossDex适配51.7±1.5%。 表1;附录E ↗
我的解读±为三训练种子标准差,所有物理评测摩擦1.5、质量100g;不是原始基线论文条件直接复用的分数。
来源证据三种未见Allegro删链变体统一三手零样本72.1±6.9%,变体专家72.2±1.2%,只训原Allegro17.2±12.1%。 表2 ↗
我的解读多形态训练很关键;匹配专家均值不等于统计等价,变体范围仍有限。
来源证据真实三平台各10物体×5次,Franka两组合45/50,Tianji-XHand48/50;其中五物体已见五未见。 表11 ↗
我的解读同一接触检查点复用,但两种主要手是训练形态,不能全部叫未见手零样本。
来源证据Franka-Sharpa四任务各10次,抓取87.5%、下游任务80%,两开环基线任务均35%。 表3 ↗
我的解读基线模块固定增强因果可比性,但任务小样本;扫、擦、倒转、钻头摆姿不同于所有真实工具使用。
来源证据499条左手DexYCB:GOTT在MuJoCo69.7%,运动学回放12.6%,逐演示优化SPIDER76.0%。 第4.5节 ↗
我的解读GOTT不做每演示优化,但并未超过有额外优化的SPIDER;跨仿真71.5/72.9/69.7仍是仿真。
来源证据工作空间原配置SimToolReal98.3%高于GOTT79.2%;低台面其.2%、GOTT91.4%。 图7 ↗
我的解读分解有利分布外空间变化,也有原分布损失;这一测试仅橡皮擦5cm提起,不是全部任务。
来源证据初始化29.6秒,其中VLM14.9秒;接触策略.752ms、预测器.085ms,闭环10Hz。 表14;附录F ↗
我的解读在线网络快不代表从指令到动作亚秒;接触开关95.3–96.0%只在训练物体的新仿真rollout测得。
开放情况与使用许可
官方项目页代码按钮明确Coming Soon,仅论文及视频可核实;未核实统一策略权重或训练代码下载。项目页额外展示Allegro V5真实迁移,但没有统计试验数。
LICENSE论文CC BY 4.0;新代码与权重许可尚未核实,基础感知、仿真及资产各按上游许可。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
多手统一和单手专家、三训练种子以及未见删链手变体提供可比证据。
真实全流程对照固定感知、区域推理、IK和轨迹跟踪,替换接触获取模块。
反方 · 哪些结论还不够
真实四任务每项仅10次;钻头任务是旋转到工作姿态,不等于真的完成钻孔。
CrossDex与OHRA为适配重实现,不能当原方法所有能力的直接排名。
接触预测噪声测试只改已录轨迹的预测器输入,不是噪声下重新闭环执行。
综合判断
明确的模块分工与闭环接触带来可信的跨手复用收益;适用范围是有网格与位姿反馈的刚体任务,尚非通用灵巧操作系统。
我会先做的验证
建议实验(尚未执行):真实多种子/多场景统计与新手硬件盲测;在线注入感知噪声、遮挡和接触滑移,报告规划失败、重试、总耗时及最终功能任务成功。