SkillWeave:把遥操作与手把手示教接成灵巧长任务
掩码处理人手遮挡,候选动作筛选处理技能交接;87%组合效率仍对应约27%整任务成功
SkillWeave为伸手和搬运采遥操作,为旋转、拧螺母和按钮接触采动觉示教。物体掩码引导视觉注意力,减轻训练中示教者手臂、部署时无人手的分布变化;技能结束时从前驱策略采多个动作块,选择接近后继示范起始状态的候选。三项真实任务各20次,有引导45%/15%/20%,无引导10%/0%/5%。
图解主要方法
单独能做的技能,为什么拼起来会失败,如何把前一技能带到后一技能认识的起点?

- 1
按接触要求分配示教方式
任务由人工分成2或3段,每段100示范。SpaceMouse控制手臂、MediaPipe重定向手指用于大范围运动;机器人柔顺模式下直接摆手指用于精细接触,各自训练扩散策略。
- 2
保留RGB,用物体掩码引导注意力
双视角ResNet18特征在物体掩码内池化成query,再cross-attention汇聚全部空间特征;以归一化掩码监督注意力。物体不可见时用均值query且不计该视角注意力损失,避免凭空补人手遮住的像素。
- 3
训练离线分割,部署轻量预测
SAM3只为训练帧提供离线物体掩码,每视角训练U-Net在部署预测掩码。视觉加末端、手臂与手指本体状态,条件化1D U-Net生成动作块;不是在线运行SAM3。
- 4
构建后继可开始的状态集合
取后继每条示范前H_s个状态,含腕姿和关节,分项归一化;候选端点到K近邻的平均距离作为兼容性分数。这个经验支持集仅近似可执行域,不包含完整物体动力学。
- 5
用前驱自身动作完成交接
到终端阶段,每轮采L个前驱动作块,选端点距离最小者执行后重新观测;达到阈值后切后继,最大时域防无限引导。无需另训过渡策略,但采自前驱并不构成安全或成功保证。
实验与证据
已读完整论文、方法公式和全部实验,无独立附录;PDF第6页原表视觉复核,纠正HTML列错位;图2原图核验。未执行实机实验。
来源证据真实7自由度xArm7、16自由度LEAP Hand,外部与腕部RGB,本体状态6+7+16维,30Hz记录。 V-A ↗
我的解读30Hz是数据记录频率,论文没有足够信息把它当完整策略部署闭环频率。
来源证据转块需至少90°;螺母须脱螺栓并入容器;水壶须开盖并稳定放桌上。 表I、IIa ↗
我的解读是三类任务,分2/3/3技能,共8段;65%精细成功率来自表中的3个接触子技能,不是独立报告4个任务。
来源证据精细技能Mask-Kin70%/75%/50%,Teleop10%/5%/0%,原始Kin30%/0%/0%。 表IIa;V-D ↗
我的解读结果支持对应数据与视觉设计;遥操作训练包括失败示范,未控制成功轨迹质量。
来源证据20次整任务:引导45%/15%/20%,无引导10%/0%/5%,合60次约26.7%对5%。 PDF第6页表IIb、III ↗
我的解读PDF表IIb、表III和正文一致;HTML表IIb列标题错位,若照抄会把干预方向反过来。
来源证据孤立技能乘积为49%、约19%、22%;整任务比值约92%、79%、91%,宏平均87%。 V-C;表III ↗
我的解读87%是对乘积参考的保留比例,不是任务成功率;比值与分母都由小样本估计,未给区间。
来源证据机器人状态距离不显式包含物体位姿;候选端点如何预测未给完整实现。 IV-B ↗
我的解读交接可在相同腕指配置但不同物体接触时失败,应验证物体条件化评分。
来源证据默认lambda、K、L、H_s、epsilon、最大引导时域以及训练预算未完整报告。 IV-A–B ↗
我的解读不能从概念公式推定复现配置;后续需真实代码确认。
来源证据项目代码标Coming Soon,视频为占位路径,论文无独立附录。 官方项目页 ↗
我的解读公开论文不等于完整可复现发布;不能以模板内视频文件名当实际实机证据。
开放情况与使用许可
官方页仍写Code (Coming Soon),视频位置多为placeholder;虽然摘要称代码视频可用,当前不能确认可下载实现、权重或演示视频,不标开源。
LICENSE论文为arXiv非独占许可;所用图2来自官方项目,网站声明CC BY-SA 4.0,保留原图和署名;代码/权重没有可验证许可。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
同一组子策略,有无终端引导的整任务结果明显不同,直接对应技能边界的分布偏移。
三项接触技能掩码示教70%/75%/50%,平均65%;原始动觉10%、修图KineDex20%,支持物体条件化视觉设计。
反方 · 哪些结论还不够
遥操作基线保留失败示范,因此模态对比同时包含数据质量差异,不能推成遥操作的一般上限。
组合效率把孤立成功率相乘当参考,不是独立性已被证明的概率模型;87%不等于87%整任务成功。
缺少掩码预测精度、背景变化专项测试、控制延迟和候选评分细节,难以完整复现。
综合判断
这是小规模实机证据支持的示教与技能交接方案,价值在诊断边界而非已经解决长程灵巧操作;平均整任务仍约27%。
我会先做的验证
建议实验(尚未执行):用同量成功示范公平比较两模态,加入物体/接触状态的交接距离;固定候选数报告延迟及多种子区间,并对真实背景、遮挡和掩码错分独立测评。