aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

DexTacWAM:把指尖触觉写进世界动作模型

触觉压缩、预测表示与策略头的作用要分别验证

IN A NUTSHELL

DexTacWAM 将双手光学触觉压成两个潜在视图,与视频共同预测,再用中间特征生成动作。主表 70.6 分混合了二元和分步得分,不应直接写成 70.6% 任务成功率。

01

图解主要方法

图 1 中触觉进入预测模型之后,动作头究竟读取什么?

原论文图 1:视触觉世界预测与动作模型
原论文图 1:视触觉世界预测与动作模型查看大图 ↗
Haoran Yuan 等,arXiv 2609.24976v1;原图内容未改动。 · 原始来源与图注 ↗ · 版权归作者;arXiv 非独占分发许可不是开放图片许可。为方法评论仅引用必要原图,不授予进一步使用权。
  1. 1

    把五指密集触觉压成一个手部视图

    22 自由度 Sharpa 手的十个指尖提供灰度光学标记图,经 1×1 灰度转 RGB 适配器和冻结视觉 VAE 编码。每手五指加查询 token,经位置与手指身份编码、时空注意力池化为 6×8×128 潜变量,残差初始为零以保留视觉先验。

  2. 2

    先学习触觉重建与接触变化

    488 段、约四小时数据分 464 训练和 24 测试,用流式预测前后的触觉重建训练编码器。四小时是采集数据时长,不是总训练耗时;压缩目标要同时保留静态接触和变化。

  3. 3

    将视觉与双手触觉共同预测

    2B 世界模型把视觉和左右触觉作为三种视图输入 DiT,模态内自注意力后做跨模态交互。每任务约百段成功演示用于适配,没有依靠大规模触觉中期预训练,也没有充分覆盖失败恢复。

  4. 4

    从预测特征直接接动作头

    160M 动作模型通过跨注意力读取世界模型的单次前向特征,视觉与触觉键值分别做 RMS 归一化。并非先生成一段完全去噪的未来视频再执行;力、动作、状态多头辅助训练,60 维力仅为监督,推理时不作为力输入。

  5. 5

    用模态压缩降低计算但保留测量范围

    将逐指视图压到双手视图,把相关 token 从 3168 减至 864。运行速度取决于相机配置、动作分块和模型头;论文的头部计时不等于全机器人从传感器到电机的端到端延迟。

02

实验与证据

以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。

来源证据【六任务】每项二十次,综合分数 70.6,对比 RDP 38.0;交接三步、擦拭五步得分与二元任务混合。 主实验表

我的解读我的解读:应分开报告评分和成功率,避免百分号改变指标含义。

来源证据【二元子集】四任务合计 55/80=68.8%,对照 24/80=30.0%;Wilson 区间约 57.9–77.8% 与 21.1–40.8%。 二元任务统计与基线设置

我的解读我的解读:子集支持显著差距,但外部对照使用六维力而非同样密集触觉图,动作约定也不同。

来源证据【匹配消融】四任务保持触觉数据、编码器和动作空间,去除世界预测后分数 74.7→26.6。 世界模型消融

我的解读我的解读:比异构外部基线更直接支持预测表示对策略的贡献。

来源证据【RTX 4090】动作头相关推理 363→281.6 ms,约 1.29 倍;每块覆盖 54 步、30Hz,即 1.8 秒。 效率实验

我的解读我的解读:较长动作块给推理留出时间,但不能由此推出每一步都有实时触觉纠错。

来源证据【泛化与编码】未见碗色 13/20、堆叠 12/20;触觉事件召回 0.725、保留比 0.894。 泛化及编码器实验

我的解读我的解读:保留比不是 89.4% 的绝对召回率;新硬件和失败恢复仍缺证据。

03

开放情况与使用许可

已打开作者项目页及其链接,当前未找到本研究可核实的训练代码或模型权重;网页模板和作者链接不构成实现发布。

LICENSE代码、权重许可证尚未确认。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

匹配消融和明确的模态压缩设计使世界预测的控制贡献较容易定位。

反方 · 哪些结论还不够

成功演示、异构基线、分块延迟与有限硬件覆盖限制普适性;视频保持实验中的置信区间不能证明所有视觉能力都无损。

综合判断

值得用于研究密集触觉如何补足遮挡下的视觉状态;部署前要专门验证接触突变与失败恢复。

我会先做的验证

未执行的验证方案:在同动作空间、同密集触觉输入和等算力下比较预测与直接策略,插入滑移、掉落及材质变化,记录每次接触修正延迟与恢复成功率。

继续探索具身智能