aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

Workhorse:从五点人体示范学习全身搬运、踢箱与攀爬

视觉规划与全身跟踪分别学习,再用互相模拟的误差增强接成闭环

IN A NUTSHELL

Workhorse把躯干、双腕、双脚的位姿作为共同接口:5Hz视觉规划器生成1.16秒目标片段,50Hz跟踪器输出关节目标。两个策略都从同一人体示范分别学习,用输入漂移与重规划跳变增强应对闭环误差。G1展示搬箱、接箱和推倒后攀爬行李箱,但论文成功率只来自仿真。

01

图解主要方法

图2如何用同一五点接口连接不同速度的规划器与跟踪器?

Workhorse图2展示人体五点示范、5Hz视觉规划和50Hz全身跟踪
原论文图2:五点人体运动训练与双速闭环控制查看大图 ↗
Songbo Hu等,UC Berkeley,arXiv:2610.09117v1,第2页图2。由原始PDF渲染并截取图及图注,未重绘或改动图内内容。 · 原始来源与图注 ↗ · 版权归作者;arXiv非独占托管许可不等于图片再分发许可
  1. 1

    用五点位姿对齐人体与机器人

    图2虚线表示同一组人类躯干、腕和足位姿分别训练两个策略。穿戴追踪器60Hz与胸前相机30Hz经三次拍手对时,再重采样到50Hz;固定刚体偏移把追踪器变成机器人目标。原运动不做尺度重定向,但每个新机器人仍需量五个安装偏移及重新训练。

  2. 2

    训练视觉规划,并让历史带有闭环误差

    规划器读取四帧图像和九个五点历史样本,输出58步、间隔0.02秒的目标。离线分割并擦除人像,以IK姿态渲染机器人替换;训练向历史加入随机游走漂移,同步扭曲相机图像,而未来目标保持干净。重力方向与躯干高度弥补相对躯干坐标隐藏的信息。

  3. 3

    训练全身跟踪器适应漂移与重规划跳变

    图2右侧50Hz策略读取未来0.2秒六个目标样本及当前本体感知。奖励对腕和躯干用世界坐标、对足用躯干坐标,容许脚为平衡调整;训练命令在重规划之间逐渐漂移,再重置。箱子负载以手腕间最大40N弹簧近似,行李箱任务则显式建模物体。

  4. 4

    按采集时间执行异步片段

    5Hz规划器在外部笔记本运行,跟踪器在G1本体;二者依赖时戳而非数据到达时间。延迟到达的片段跳过已过时动作,按控制时刻插值并转换躯干坐标,新旧重叠部分经inpainting衔接。部署不用外部动作捕捉,但数据采集仍用基站。

02

实验与证据

已阅读v1全文与限制部分,核对表II、作者项目页及PDF图2。公开版本未附独立附录;以下均为作者实验,本站未运行机器人或复现实验。

来源证据【数据及范围】一名示范者录制搬箱2.2小时、行李箱1.2小时、接箱13分钟;每任务独立规划器和跟踪器。G1真实展示14kg箱体推倒、0.39m攀爬与约0.56秒飞行接箱。 第III/V/VI节 ↗

我的解读我的解读:这些是能力展示条件,不是连续成功率或通用技能覆盖;不同任务不能理解为一个统一策略自动切换。

来源证据【闭环仿真】每配置无推/有推各100回合,120秒内放好三箱且不跌倒算成功。完整系统77%/64%,推扰40N持续1秒、每5–10秒一次;推扰下跌倒15%。 表II与第V-B节 ↗

我的解读我的解读:77%附近95%区间约±8点,真实世界未报告同口径频率。评测只改初始位姿和推扰,质量、摩擦、光照固定,不能宣称覆盖广泛域外变化。

来源证据【接口与增强消融】关节命令成功54%/42%,但推扰跌倒仅4%;去规划增强为20%/0%,去命令增强76%/52%。 表II ↗

我的解读我的解读:五点接口提高完成但不同时最安全。规划增强一次去掉全部组件,无法单独归因于漂移;命令增强主要在推扰下显示收益。

来源证据【跨机器人】相同示范重训H2两策略,仿真无推成功83%,G1为77%;两率之差95%区间约±11点。H2规划图像由重建房间渲染。 第IV-A/V-C/VI节 ↗

我的解读我的解读:证明数据能复用,不是模型零样本迁移;6点差小于差值不确定性,也没有真实H2验收。仿真适配与实体尺寸都可能影响结果。

03

开放情况与使用许可

作者项目页明确代码尚未发布。可访问论文与演示,不把演示视频或交互网页当作控制器、训练集或权重开放。

LICENSE尚未确认实现、权重及示范数据许可。论文为arXiv非独占托管许可;PDF图2截取仅用于必要方法评论,版权归作者。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

同训练数据下,对接口、重力信息、规划增强及命令增强做闭环消融;真实演示包含物体被拿走与外力推扰后的继续执行。

反方 · 哪些结论还不够

定量数据来自重建训练房间,且约15%规划训练数据专门来自该仿真场景;真实成功率未报告。更高任务完成率也伴随较多跌倒,不能只看单一成功数。

综合判断

展示了从少量人体示范到接触丰富全身操作的具体路线,误差增强和时间对齐值得关注;现有证据支持受限场景能力展示,不支持通用可靠人形操作结论。

我会先做的验证

未执行的验证方案:预注册真实任务次数和失败条件,在陌生布局、照明及摩擦条件下测试;分别统计完成率、跌倒、碰撞和人工介入。拆开规划增强各组件,并匹配同样的环境适配数据,再比较H2真实重训结果。

继续探索具身智能