aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

SkillWeave:把遥操作与手把手示教接成灵巧长任务

掩码处理人手遮挡,候选动作筛选处理技能交接;87%组合效率仍对应约27%整任务成功

IN A NUTSHELL

SkillWeave为伸手和搬运采遥操作,为旋转、拧螺母和按钮接触采动觉示教。物体掩码引导视觉注意力,减轻训练中示教者手臂、部署时无人手的分布变化;技能结束时从前驱策略采多个动作块,选择接近后继示范起始状态的候选。三项真实任务各20次,有引导45%/15%/20%,无引导10%/0%/5%。

01

图解主要方法

单独能做的技能,为什么拼起来会失败,如何把前一技能带到后一技能认识的起点?

两路ResNet视觉特征以物体掩码构建query,与本体状态共同条件化动作块去噪。
图2|物体掩码条件化扩散策略查看大图 ↗
Ryosei Tamura等,SkillWeave图2;官方项目网站CC BY-SA 4.0,原图未改动。 · 原始来源与图注 ↗ · 官方项目网站CC BY-SA 4.0;保留原图及署名
  1. 1

    按接触要求分配示教方式

    任务由人工分成2或3段,每段100示范。SpaceMouse控制手臂、MediaPipe重定向手指用于大范围运动;机器人柔顺模式下直接摆手指用于精细接触,各自训练扩散策略。

  2. 2

    保留RGB,用物体掩码引导注意力

    双视角ResNet18特征在物体掩码内池化成query,再cross-attention汇聚全部空间特征;以归一化掩码监督注意力。物体不可见时用均值query且不计该视角注意力损失,避免凭空补人手遮住的像素。

  3. 3

    训练离线分割,部署轻量预测

    SAM3只为训练帧提供离线物体掩码,每视角训练U-Net在部署预测掩码。视觉加末端、手臂与手指本体状态,条件化1D U-Net生成动作块;不是在线运行SAM3。

  4. 4

    构建后继可开始的状态集合

    取后继每条示范前H_s个状态,含腕姿和关节,分项归一化;候选端点到K近邻的平均距离作为兼容性分数。这个经验支持集仅近似可执行域,不包含完整物体动力学。

  5. 5

    用前驱自身动作完成交接

    到终端阶段,每轮采L个前驱动作块,选端点距离最小者执行后重新观测;达到阈值后切后继,最大时域防无限引导。无需另训过渡策略,但采自前驱并不构成安全或成功保证。

02

实验与证据

已读完整论文、方法公式和全部实验,无独立附录;PDF第6页原表视觉复核,纠正HTML列错位;图2原图核验。未执行实机实验。

来源证据真实7自由度xArm7、16自由度LEAP Hand,外部与腕部RGB,本体状态6+7+16维,30Hz记录。 V-A ↗

我的解读30Hz是数据记录频率,论文没有足够信息把它当完整策略部署闭环频率。

来源证据转块需至少90°;螺母须脱螺栓并入容器;水壶须开盖并稳定放桌上。 表I、IIa ↗

我的解读是三类任务,分2/3/3技能,共8段;65%精细成功率来自表中的3个接触子技能,不是独立报告4个任务。

来源证据精细技能Mask-Kin70%/75%/50%,Teleop10%/5%/0%,原始Kin30%/0%/0%。 表IIa;V-D ↗

我的解读结果支持对应数据与视觉设计;遥操作训练包括失败示范,未控制成功轨迹质量。

来源证据20次整任务:引导45%/15%/20%,无引导10%/0%/5%,合60次约26.7%对5%。 PDF第6页表IIb、III ↗

我的解读PDF表IIb、表III和正文一致;HTML表IIb列标题错位,若照抄会把干预方向反过来。

来源证据孤立技能乘积为49%、约19%、22%;整任务比值约92%、79%、91%,宏平均87%。 V-C;表III ↗

我的解读87%是对乘积参考的保留比例,不是任务成功率;比值与分母都由小样本估计,未给区间。

来源证据机器人状态距离不显式包含物体位姿;候选端点如何预测未给完整实现。 IV-B ↗

我的解读交接可在相同腕指配置但不同物体接触时失败,应验证物体条件化评分。

来源证据默认lambda、K、L、H_s、epsilon、最大引导时域以及训练预算未完整报告。 IV-A–B ↗

我的解读不能从概念公式推定复现配置;后续需真实代码确认。

来源证据项目代码标Coming Soon,视频为占位路径,论文无独立附录。 官方项目页 ↗

我的解读公开论文不等于完整可复现发布;不能以模板内视频文件名当实际实机证据。

03

开放情况与使用许可

官方页仍写Code (Coming Soon),视频位置多为placeholder;虽然摘要称代码视频可用,当前不能确认可下载实现、权重或演示视频,不标开源。

LICENSE论文为arXiv非独占许可;所用图2来自官方项目,网站声明CC BY-SA 4.0,保留原图和署名;代码/权重没有可验证许可。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

同一组子策略,有无终端引导的整任务结果明显不同,直接对应技能边界的分布偏移。

三项接触技能掩码示教70%/75%/50%,平均65%;原始动觉10%、修图KineDex20%,支持物体条件化视觉设计。

反方 · 哪些结论还不够

遥操作基线保留失败示范,因此模态对比同时包含数据质量差异,不能推成遥操作的一般上限。

组合效率把孤立成功率相乘当参考,不是独立性已被证明的概率模型;87%不等于87%整任务成功。

缺少掩码预测精度、背景变化专项测试、控制延迟和候选评分细节,难以完整复现。

综合判断

这是小规模实机证据支持的示教与技能交接方案,价值在诊断边界而非已经解决长程灵巧操作;平均整任务仍约27%。

我会先做的验证

建议实验(尚未执行):用同量成功示范公平比较两模态,加入物体/接触状态的交接距离;固定候选数报告延迟及多种子区间,并对真实背景、遮挡和掩码错分独立测评。

继续探索具身智能