aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

ManiUnit:把长程机器人任务拆成可诊断的技能测试

局部操作78.7%不等于完整任务78.7%;组合系统完整成功率仍为18%

IN A NUTSHELL

ManiUnit从BEHAVIOR-1K的50类活动整理137899个操作片段,用明确子任务指令消除阶段歧义,并恢复中间仿真状态独立测试21种技能。1260个测试实例对比原始、底座扰动和关节扰动起点,揭示相近总分下不同技能短板,以及起始姿态变化导致的明显退化。两活动的策略组合把完整任务成功从4%提升至18%,仍远低于局部操作分数。

01

图解主要方法

长任务失败时,如何辨别是当前技能不会做、起点偏了,还是高层切换错了?

上方从示范提取、修边界并核对指令;下方恢复起点、定义局部目标并分别施加机器人状态和场景扰动。
图2|技能片段整理与独立评测构造查看大图 ↗
南京理工大学、西北工业大学、Intellifusion,arXiv:2610.12089v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · CC BY 4.0;保留作者署名和原图
  1. 1

    从整任务轨迹提取完整操作

    为50活动手工定义312条提取规则和48条合并规则,例如把推到床边再抓起合成一次Pick Up。合并会保留中间导航,不能理解为所有片段完全没有移动过程。

  2. 2

    修边界并写明确子任务指令

    监测双臂各前三关节偏离低垂参考姿态,5帧平滑、15度阈值、至少5帧;夹爪事件前后保留5秒,剩余不足20%则恢复原段。模板明确动作、对象、来源和目标,再逐集人工核对指令。

  3. 3

    恢复中间状态并定义局部成功

    从源场景回放状态与对象增删历史,补回辅助抓握约束,25步settle加60步hold并清速度。人工BDDL目标绑定具体对象;放置要求容器内且不再接触机器人,扫地只检查示范实际清掉的粒子。

  4. 4

    构造配对扰动并逐技能评分

    Full为21技能各20起点,乘原始/底座/关节三条件,共1260实例。扰动必须保留抓持等前提,排除非预期碰撞。目标连续10帧成立才算成功,预算是该子任务平均示范时长的三倍。

  5. 5

    用显式规划器衔接技能与任务策略

    任务策略默认负责导航与过渡;状态历史分类为操作阶段后,子任务分类与视频检索须在技能种类及置信条件上达成一致才切换。32个1Hz状态、最近8帧SigLIP和适配VideoMAEv2参与判断,切换只发生在动作块边界。

02

实验与证据

完整正文及附录A–E已读,包含提取规则、状态恢复、全部技能表和规划器细节;图2视觉核验,未执行仿真实验。

来源证据Full137899片段、417子任务、21技能,平均17.9秒;拿起与放置占73.8%。 2.1;B.1表4 ↗

我的解读原始数据严重不均衡,技能宏平均与逐帧训练分布不同,不能只看总体样本量。

来源证据Lite10588片段来自挑战赛成功率最高的8活动;186实例、62起点、7技能。 B.1 ↗

我的解读Lite有任务选择偏差且每技能起点数不同,成绩不能直接与Full对照为模型规模收益。

来源证据Full每实例重复3次,Lite5次;每条件先平均技能内试验,再技能等权,最后三条件等权。 4.1;D.2 ↗

我的解读这说明总体得分不是按训练片段数量加权,也不是一个长程任务的成功率。

来源证据Full PI原始60.1%、关节26.5%;GR00T63.5%到28.2%,相对下降约56%。 图3;C.3 ↗

我的解读约56%是相对下降而非下降56个百分点;底座位移8.0–11.8厘米,关节最大变化中位0.916弧度。

来源证据Full总体PI45.9%、GR00T47.6%;Pick Up44.4%对54.4%,Place69.4%对65.6%。 图3;表6 ↗

我的解读总分接近却各有短板;逐技能结果更能决定应补什么训练数据。

来源证据Lite π0.5总体66.3%,PI54.7%、GR00T57.1%、Cosmos245.3%。 4.1–4.2;D.1 ↗

我的解读π0.5有多机器人策略预训练,其他action head随机初始化;不是仅比较动作架构的公平控制。

来源证据Pick Up位置变化:GR00T71.4%到20%,π0.5 91.4%到74.3%;每条件7实例×5次。 表1 ↗

我的解读位置扰动在这小组比颜色/干扰物影响更大,但不能外推所有技能或所有扰动强度。

来源证据同初始π0.5训练5epochs,在两活动五子任务75实例上:整任务49.3%、技能78.7%;关节条件32%对76%。 4.3;图4 ↗

我的解读29.4个百分点是局部操作改善;子任务指令与训练数据组织同时变化,因果来源尚未完全拆开。

来源证据两完整活动各10episode×5次:组合Radio24%、Trash12%,宏平均18%;任务策略两者均4%。 表2;D.3 ↗

我的解读总体增加14个百分点。Q-score11%到25%是部分目标完成度,不能替代完整成功。

来源证据StarVLA动作块30、23维、batch512;π0.5用绝对关节、batch256;训练种子42。 D.1 ↗

我的解读相同5epochs不等于相同计算与动作表示;论文未充分报告训练种子置信区间及规划端到端时延。

03

开放情况与使用许可

论文称构建并整理数据,但正文未给官方数据或代码链接;按题名检索未核实可下载官方语料、检查点、模型卡或实现。按待核实处理,不把论文中的released字样当作已可获取。

LICENSE论文及图2为CC BY 4.0;衍生数据、仿真资产和策略检查点许可未独立确认。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

同操作锚点下只变底座或关节,有助于隔离起始配置敏感性;按技能等权汇总避免高频拿放掩盖稀有技能。

相同π0.5初始权重下,技能训练在五个子任务及三类起点均优于整任务训练;完整任务实验进一步检查是否能衔接。

反方 · 哪些结论还不够

从训练示范恢复的起点可能偏乐观,手工扰动不等于真实前一策略产生的完整状态分布。

技能与整任务训练同时改变轨迹长度、指令粒度和采样分布,不能将全部提升归于任意单一因素。

完整任务只测两个活动;规划器增加检索、分类器和阈值,最终18%仍表明衔接困难。

综合判断

有价值的技能诊断基准与数据组织工作;支持起点鲁棒性和分层训练值得关注,尚未证明大规模长程任务或实机可靠执行。

我会先做的验证

建议实验(尚未执行):采用未见源轨迹及真实前序策略产生的起点,分开控制指令细化与片段采样;报告多训练种子、所有50活动的完整任务成功与切换错误,并在无辅助抓握条件下复核接触技能。

继续探索具身智能