aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

Dex-One2Many:把一次人类演示变成关系约束,再让灵巧手自己学动作

分阶段重置缓解探索,但单视频不意味着低仿真成本或无需资产先验

IN A NUTSHELL

Dex-One2Many不追踪演示者的手轨迹,而把抓住、接触、放入等关系提取成阶段场景图,再按图生成不同物体位置与抓法的训练初态。每阶段1万个物理筛选重置加上谓词密集奖励,使PPO能直接练习后半段任务。UR3加Wuji 1实机五任务未见配置平均成功75%,但这是任务内位置和抓法变化,依赖RGB-D感知、仿真资产、部分CAD替代和大规模并行训练。

01

图解主要方法

如何保留视频的任务结构,同时让灵巧手摆脱单一演示抓法与轨迹?

上方视频抽象成关系,左下物体与抓法形成阶段重置,中部PPO通过QP控制,下方右侧实机执行未见位置配置。
图2|阶段场景图生成重置与奖励,再进行零样本实机部署查看大图 ↗
首尔大学、马里兰大学、KAIST等,arXiv:2610.12470v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · CC BY 4.0;原图署名引用,未改动
  1. 1

    提取关系变化,舍弃演示轨迹

    Gemini 3.1 Pro从视频提取对象、功能部位、角色和依次成立的谓词;接近阶段由规则派生。on_top/inside/contact/seat使用几何距离,grasp使用验证抓法;固定词汇提供可执行语义,而不是模型任意发明任务语言。

  2. 2

    把功能区域与抓法落到可仿真资产

    首帧RGB-D经分割和SAM 3D重建,部分对象改用CAD。34视角分割投票定位把手/工作面,再用Dexonomy的33抓型生成候选;按全部后续阶段可用性挑前4种,保存关节状态及维持接触力的闭合命令。

  3. 3

    从目标向前生成每阶段重置

    先放锚点,再按关系放其他对象,末阶段从成功态扰动到近目标;逆向继承已验证后继的锚点和抓法。每阶段保留1万状态,检查6秒中最后2秒静止、无非法碰撞及两手链仍持物,避免只有局部关系成立却无法继续任务。

  4. 4

    用谓词进展训练任务空间PPO

    距离奖励只给刷新历史最好距离的进步;抓取用wrench方向覆盖和最弱方向质量,至少两指、正质量且抬升5cm后才开后续操作奖励。actor含LSTM,critic见特权状态,策略输出手掌和指尖速度而非直接关节动作。

  5. 5

    双视感知与QP接到真实硬件

    FoundationPose++双RGB-D跟踪按深度一致性加权,差异超过3cm/20°不混合;双失效最多外推0.5秒再保持。QP转为关节速度并约束位置、速度与手桌间距,可在部署时收紧而不重训策略。

02

实验与证据

全文、附录A–E、提示词、重置/控制/感知参数已读;图2和图4原图已检查;官方项目代码状态已核对,未训练、控制硬件或调用论文API。

来源证据五段人类视频总27.11秒;关系抽取81.9秒、0.171美元,单查询约12–21秒。 附录B表2、6 ↗

我的解读成本只含一次阶段图查询,排除资产、部位分割、物性推断、抓法合成和RL训练;首帧另需深度,不能宣传全流程不足0.2美元。

来源证据锅/桶、印章、锤/钉/块/支架用CAD,其他对象从首帧重建。 表4;附录B.3 ↗

我的解读数字资产不完全由单视频自动恢复;论文承认关节对象需人工资产,布偶也按刚体模拟。

来源证据49,152环境、rollout32、每更新5学习轮;120Hz仿真、10Hz策略、16秒/160步回合。 附录C.5表9 ↗

我的解读每更新约157万采样步,规模是重要成本;正文没有完整训练硬件/墙钟预算,不能只以视频长度衡量效率。

来源证据实机UR3/Wuji 1五任务各Seen10、Unseen20;未见成功80/75/85/60/75%,平均75%。 4.2;图4原图 ↗

我的解读图4中CHORD Hammer缺测;对Do as I Do五任务平均4%为+71个百分点。Seen上本方法并非每任务最强,例如Sweep80%低于其100%。

来源证据四手型仿真每任务500回合,均值94.6/96.6/96.8/96.0%。 4.3表1 ↗

我的解读每种手型单独训练;位置在可达工作区[0.3,0.7]×[−0.17,0.4]米抽样,不是无重训跨本体泛化。

来源证据Sweep2k更新完整超过90%;去重置约16%、去密集奖励0%、不恢复闭合命令约48%。 4.4图7 ↗

我的解读闭合命令恢复主动接触力,单有几何接触姿态不足以稳定衔接;消融只一任务,不是所有场景效果估计。

来源证据并行数49,152超过90%,24,576和12,288在相同更新数下低于25%。 4.4图7 ↗

我的解读该实验同时增加总采样量,不能独立归因为并行数量;应再做等交互预算对照。

来源证据抓法先以六方向重力及min(0.5m_max g,0.5N)外力、0.02米力臂筛选;重置用最大质量/最低摩擦。 附录C.3 ↗

我的解读通过有限扰动筛选不是所有接触参数组合下的形式保证;逆向兼容也不证明每对状态动力学可达。

来源证据物体位置噪声标准差1cm截3cm;尺寸±10%,姿态±5°;物体观测延迟0–150ms。 附录B.4;C.5表10 ↗

我的解读物性由文本模型按类别/实测尺寸估计,不是真实辨识。附录B称动态摩擦为静态0.9倍,表10又写估值±10%,复现需核对实现。

来源证据目标条件模式允许多个谓词,但表5写RL成功测试使用第一个。 附录B.2表5 ↗

我的解读当前任务单目标可工作,不能直接声称通用多条件合取任务验收;预定义谓词组合范围仍有限。

03

开放情况与使用许可

官方项目提供论文与多手型视频,Code明确Coming soon,未见训练代码、策略权重或重置集下载。没有运行其Gemini/OpenAI查询;文中的API成本仅是作者报告。

LICENSE论文CC BY 4.0,图2依此署名引用且不改动;网站CC BY-SA 4.0不等于未发布策略、数据或代码的许可。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

实机未见配置五任务为80/75/85/60/75%,平均75%,所有评测从空手开始完成全程,不靠测试时中途重置。

Sweep消融取消阶段重置约降至16%、取消密集奖励为0,支持同时缓解长程探索与提供局部进展信号。

反方 · 哪些结论还不够

每任务只20次实机未见试验,没有多训练种子置信区间;CHORD Hammer因硬件故障缺测,均值比较的分母需说明。

49,152并行环境明显优于较小配置,但同PPO更新数意味着不同总交互量,不能当作等样本效率优势。

只替换URDF与抓法集后仍需分别训练策略;一视频还用首帧深度、CAD资产、既有谓词和物性模型,不是无先验纯RGB学习。

综合判断

证据支持以关系定义任务、以阶段重置释放抓法自由度;最可迁移的经验是训练状态设计,而非已经解决任意演示到通用灵巧策略。

我会先做的验证

建议实验(尚未执行):固定总仿真步数比较并行规模;用多种子与更多真实配置估计区间,并逐项替换CAD、真实深度和手工谓词,测试物体更换、错误场景图及长序列关系对策略的影响。

继续探索具身智能