aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

TouchScale:统一硬件采500小时人类视觉与触觉,先训练触觉预测再适配机器人

代码可见,当前数据页仅100小时;机器人收益仍需真机示范

IN A NUTSHELL

TouchScale以同一代头部RGB-D、双腕RGB和每手880触点手套,采集500小时、约87000段交互。人类数据无需动作重定向,只训练未来触觉变化,再用每任务50条机器人示范后训练。四任务平均成功从22.5%到57.5%,但数据规模曲线只覆盖一个平台,不能推广为免机器人数据的通用操控。

01

图解主要方法

人类触觉不带机器人动作,能否先学可迁移接触表示,再帮助真机策略?

左侧头部RGB-D、双腕相机和双手触觉手套;右侧拧湿布前中后展示同步RGB、深度和左右触觉。
图2|统一穿戴采集与时间对齐观测查看大图 ↗
Texas A&M、Google DeepMind、CMU、斯坦福等;Overfit Lab与Noitom参与数据采集,arXiv:2610.10288v2。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · 版权归作者;arXiv非独占托管许可不等于图片再分发许可
  1. 1

    统一多模态采集

    头部RGB-D、双腕RGB均30Hz,双手各880法向压力taxel,手套支持50Hz无线/100Hz有线。约2000任务描述、1500物体、800场景配置,数据保留原始时间戳。

  2. 2

    用视觉独立检查触觉

    先仅看腕部视频确认接触,再查长期沉默手指;确认多指失效拒绝,单指不确定人工复核。接触外噪声另二次核验并记录,不单独决定拒绝;小指和掌部排除缺失判断。

  3. 3

    跨传感器用12解剖区域评价

    各数据保留原生格点训练,只在评估按区域汇聚。序列最大压力归一化,taxel阈值0.1且区域活跃比例超过0.2判接触,按序列宏平均,不能当绝对测力精度。

  4. 4

    冻结主干做人类触觉中训

    N0-VTLA的3.71B主干冻结,只更新约123.8M投影、预测器和重建头。五潜在token预测50帧约1.67秒后的触觉变化,以停止梯度目标做对称InfoNCE和0.5倍8×8 L1重建。

  5. 5

    机器人示范后训与执行

    人类没有动作标签或重定向,中训后的模型再以每任务50条机器人示范适配xArm6+Revo2;同样基座直接后训作为对照。此阶段才学具体机器人动作。

02

实验与证据

全文及附录6–11全部指标、质检和训练细节读完;v2增加数据购买方说明;图2视觉核验,代码LICENSE、MID_TRAIN、HF元数据及分片实际查看。

来源证据约16小时匹配源数据:EgoTactile零样本cIoU0.134→0.181,vIoU0.185→0.243;完整500小时cIoU0.383。 表2;图4;附录6 ↗

我的解读来源比较的35.1%相对增益与完整数据规模增益不是同一对照;区域指标不能声称新硬件每taxel精确预测。

来源证据相同Hiera-B初始化与训练预算,三个动作识别基准线性均值24.45%、微调49.62%,OpenTouch22.97/48.28。 表3 ↗

我的解读视觉表征迁移有增益但绝对差有限,各预训练数据规模不同,不能单独归因硬件密度。

来源证据每任务20次,软硬分类2→12次、瓶盖8→14、试管6→12、擦板2→8;平均22.5→57.5%。 表4;4.3 ↗

我的解读+35个百分点是四任务观察结果,无区间;瓶盖任务文本主要拾取转移,不能自动理解为旋拧瓶盖。

来源证据中训数据0/20/40/60/80/100%对应均值22.5/30/32.5/50/50/57.5%。 图6 ↗

我的解读支持范围内总体上升,不是已拟合普适幂律,60与80%持平。

来源证据未来触觉Train Top-10从0.18%到3.31%,候选5469;Val3070、合池8539,合池100%为2.49%,80%2.69%。 附录9;表5 ↗

我的解读这是潜表示检索,不是3.31%任务成功或物理触觉准确率;不同候选池不可直接比较。

来源证据触觉误差与动作误差r0.119、p0.020,对照r0.003。 4.3 ↗

我的解读弱相关不构成触觉预测改善导致动作改善的机制证明。

03

开放情况与使用许可

仓库有qc与n0-vtla实现及训练文档。HF数据卡明确当前100小时、完整500小时计划11月前;430个tar分片可列出,gated=auto,未登录原始README请求401,未下载或检验全部数据。未核实TouchScale训练后权重发布,基础N0权重另有条款。

LICENSE根代码MIT;n0-vtla目录CC BY-SA 4.0及第三方通知,基础模型受Gemma条款;HF数据标CC BY-NC 4.0。论文arXiv非独占,原图2必要评论署名引用。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

规模匹配16小时跨数据比较,以及同硬件50–500小时规模实验,区分来源和数量。

中训冻结主干、只学触觉路径,机器人对照用相同50条示范和后训流程。

反方 · 哪些结论还不够

57.5%仅80次真机试验的四任务均值;未证明跨形态、未见任务迁移或消除机器人示范。

未来触觉所谓准确率是候选检索Top-10,3.31%不是压力重建准确率;池合并结果不单调。

论文InfoNCE温度0.07,已发布MID_TRAIN文档写1.0;仓库称剪切力但论文只法向压力,复现前需核实配置与数据。

综合判断

统一采集的人类触觉规模化有明确实验价值,机器人收益也值得复核;应将500小时研究集合、100小时当前可申请数据、开源代码与基础模型许可分开。

我会先做的验证

建议实验(尚未执行):复核发布配置温度和压力通道,按参与者/物体/场景留出,多机器人与多训练种子比较;固定总计算量测试规模,独立人工标注质检误拒漏拒并报告实际同步误差。

继续探索具身智能