aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

GOTT:用一个跨手接触基元连接物体轨迹与灵巧执行

到达、建立接触、再跟踪;跨手复用不等于无需模型和规划

IN A NUTSHELL

GOTT把任务拆成Reach–Acquire–Move:上游给物体轨迹与大致接近姿态,共享闭环策略修正手指和手腕以建立稳定接触,之后按物体位姿误差跟踪。21关键点和26关节槽映射支持多手联合训练,把局部接触技能与手臂可达性规划分离。

01

图解主要方法

能否把稳定接触做成跨机器人手复用的中间技能,而让任务轨迹和手臂规划各司其职?

左侧从随机初始手物配置学习接触;右侧按固定关键点和关节槽填充、mask输入及输出,让同一策略适配不同手。
图1|局部接触训练与统一跨手表示查看大图 ↗
Amazon FAR、UC San Diego、University of Chicago、UC Berkeley,arXiv:2610.03861v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · CC BY 4.0
  1. 1

    生成任务相关接近方案

    四视角VLM定位持握区域并回投网格,区域内采样10个近似初始姿态;cuRobo规划进场,沿完整物体轨迹做IK筛选,选择总关节移动最小可行解。

  2. 2

    统一多手观测动作

    21手关键点、26关节槽和二值mask处理不同手;输入五帧关节位置/目标/关键点历史,加各链接到512物体表面点的最近位移,输出6D手腕与关节增量。

  3. 3

    在仿真学习局部接触

    16个YCB物体、每物体静止姿态4000有效种子,PPO4096环境2000轮;奖励鼓励拇指对指接触、5cm提起、物体稳定,随机质量摩擦和执行增益。

  4. 4

    以独立接触预测切换

    冻结策略后训练本体感觉MLP,预测各指接触;拇指与至少一其他手指概率>0.5持续五个10Hz步骤才进入跟踪,避免单帧误触发。

  5. 5

    物体位姿闭环追踪

    SAM2初始分割与FoundationPose约45Hz供位姿,抓牢后短提起,以近似固定手物变换和当前物体误差修正末端目标;高层来源可替换而接触策略不微调。

02

实验与证据

全文及附录A–F、基线再现、接触预测及运行时读完,图1核验,作者项目页实际查看。

来源证据仿真9588资产、54149物体尺度姿态实例,每实例20共同初始姿态;统一策略平均78.7±1.1%,CrossDex适配51.7±1.5%。 表1;附录E ↗

我的解读±为三训练种子标准差,所有物理评测摩擦1.5、质量100g;不是原始基线论文条件直接复用的分数。

来源证据三种未见Allegro删链变体统一三手零样本72.1±6.9%,变体专家72.2±1.2%,只训原Allegro17.2±12.1%。 表2 ↗

我的解读多形态训练很关键;匹配专家均值不等于统计等价,变体范围仍有限。

来源证据真实三平台各10物体×5次,Franka两组合45/50,Tianji-XHand48/50;其中五物体已见五未见。 表11 ↗

我的解读同一接触检查点复用,但两种主要手是训练形态,不能全部叫未见手零样本。

来源证据Franka-Sharpa四任务各10次,抓取87.5%、下游任务80%,两开环基线任务均35%。 表3 ↗

我的解读基线模块固定增强因果可比性,但任务小样本;扫、擦、倒转、钻头摆姿不同于所有真实工具使用。

来源证据499条左手DexYCB:GOTT在MuJoCo69.7%,运动学回放12.6%,逐演示优化SPIDER76.0%。 第4.5节 ↗

我的解读GOTT不做每演示优化,但并未超过有额外优化的SPIDER;跨仿真71.5/72.9/69.7仍是仿真。

来源证据工作空间原配置SimToolReal98.3%高于GOTT79.2%;低台面其.2%、GOTT91.4%。 图7 ↗

我的解读分解有利分布外空间变化,也有原分布损失;这一测试仅橡皮擦5cm提起,不是全部任务。

来源证据初始化29.6秒,其中VLM14.9秒;接触策略.752ms、预测器.085ms,闭环10Hz。 表14;附录F ↗

我的解读在线网络快不代表从指令到动作亚秒;接触开关95.3–96.0%只在训练物体的新仿真rollout测得。

03

开放情况与使用许可

官方项目页代码按钮明确Coming Soon,仅论文及视频可核实;未核实统一策略权重或训练代码下载。项目页额外展示Allegro V5真实迁移,但没有统计试验数。

LICENSE论文CC BY 4.0;新代码与权重许可尚未核实,基础感知、仿真及资产各按上游许可。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

多手统一和单手专家、三训练种子以及未见删链手变体提供可比证据。

真实全流程对照固定感知、区域推理、IK和轨迹跟踪,替换接触获取模块。

反方 · 哪些结论还不够

真实四任务每项仅10次;钻头任务是旋转到工作姿态,不等于真的完成钻孔。

CrossDex与OHRA为适配重实现,不能当原方法所有能力的直接排名。

接触预测噪声测试只改已录轨迹的预测器输入,不是噪声下重新闭环执行。

综合判断

明确的模块分工与闭环接触带来可信的跨手复用收益;适用范围是有网格与位姿反馈的刚体任务,尚非通用灵巧操作系统。

我会先做的验证

建议实验(尚未执行):真实多种子/多场景统计与新手硬件盲测;在线注入感知噪声、遮挡和接触滑移,报告规划失败、重试、总耗时及最终功能任务成功。

继续探索具身智能