aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

OmniDex:把孤立物体抓取种子扩展成杂乱场景抓取库

2.6百万场景与4亿标签,需分清仿真稳定、施力技巧和真实可执行性

IN A NUTSHELL

先为单物体生成自由空间抓取,再把它们变换到沉降稳定的桌面、箱体和货架场景并筛除碰撞,降低逐场景优化成本。模型融合RGB-D、目标mask与相机参数,用Soft-WTA保持多种抓取模式、接触几何损失改善精度,推理时从64候选按物理代价选一个。

01

图解主要方法

如何扩大杂乱场景抓取监督,同时区分姿态稳定性与真实机器人可执行抓取?

RGB、XYZ、mask和参数融合;训练约束多种抓取模式与接触,推理并行生成并按物理代价取最小候选。
图4|多模态条件、Soft-WTA与物理候选选择查看大图 ↗
ACE Robotics、CUHK MMLab、CPII及合作高校,arXiv:2610.11194v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · 版权归作者;arXiv非独占托管许可不等于图片再分发许可
  1. 1

    离线建立自由空间种子

    每物体优化4000初始抓取,保留通过仿真提起的种子;约6000资产分物理网格和视觉网格并统一尺度,桌/箱/架分别布置物体。

  2. 2

    沉降后变换并筛选

    Isaac Gym中物体稳定或500步截止,将种子变换到场景坐标,筛目标接触、支撑及邻物碰撞;Blender渲染五视角RGB、深度、目标实例mask和相机参数。

  3. 3

    融合语义与几何条件

    RGB用DINOv2,深度反投影XYZ经适配器,目标mask另编码;附相机与台面高度token。多视角RGB早融合、深度Z-buffer重投影,不能把不同视角深度直接平均。

  4. 4

    以Soft-WTA和接触约束训练

    同组M=64有效抓取加相同噪声,soft最小误差保留最佳匹配模式;拇指/对指接近、相向方向及SDF穿透损失加入训练,前10轮关闭物理损失、10–20轮线性增权至100。

  5. 5

    并行候选按物理代价选取

    推理64独立噪声产生候选,以距离、额外指接触和碰撞惩罚综合代价取argmin;不做默认测试时200步优化,但仍有模拟几何评分成本。

02

实验与证据

正文及附录A–G全文、表3原始与星号指标、拆分难度及延迟阅读;图4视觉核验。

来源证据场景约2.6M、抓取标签0.4B;生成几何约5000 A800 GPU小时、视觉约17000小时。 表2;附录D ↗

我的解读标签是种子变换筛选的场景特定姿态,数量不等于独立采集真实演示;资产与布局共享。

来源证据标准单视角已见物体SRscene 33.60%,施力技巧SRscene*55.80%,CFR84.12%;DexGraspVLA24.30/40.99/81.44%。 表3 ↗

我的解读正文引用的+14.81点属于星号指标;原始稳定性差为+9.30点,两者不可互换。

来源证据未见物体原始40.15%、星号59.74%,高于已见;附录B说明困难资产刻意留给已见拆分。 表3;附录B ↗

我的解读两轨难度不平衡,不能据此称对未知物体反而更强或无域差。

来源证据数据20→100%时mini-split SR40.50→44.41%,CFR81.54→83.66%,中间CFR有回落。 表4 ↗

我的解读论文“严格随规模增长”仅稳定性点估计单调,碰撞率并非单调,也无区间证明每步显著。

来源证据候选M1→64:SR36.08→44.41%,延迟219.14→1598.41ms;32候选44.37%、948.33ms。 表D1 ↗

我的解读最后翻倍多约650ms只增.04点,不能称延迟代价可忽略;200步优化6044.60ms且CFR2.56%只说明该实现失稳。

来源证据多视角标准已见星号55.80→60.65%,但箱体35.83→28.52%。 表3 ↗

我的解读更多视角不是所有布局都改善;货架未见原始仅14.96%单视角、18.21%多视角。

来源证据仿真成功抓取的Franka IK可达83.75–87.98%;真实Revo2+Marvin仅苹果、山竹、杯子示例,硬件匹配mini-split重训。 表D3;附录F.3 ↗

我的解读IK只针对已经成功姿态且不保证无碰撞进场;真实演示没有统计成功率,不是零样本跨手迁移。

03

开放情况与使用许可

论文未提供可核实的官方代码、完整2.6M场景/0.4B标签或训练权重下载入口;不能仅凭benchmark命名称已开源。

LICENSE论文arXiv非独占许可;第三方物体含ShapeNet非商业研究条款,其余资产许可各异,不能统一推定商业可用;原图仅必要方法评论引用。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

基线在相同OmniDex训练拆分重训,同时报告稳定性与碰撞自由率。

附录给出物体初始化、几何容差、损失权重、候选数与推理时间。

反方 · 哪些结论还不够

正文55.80实际是表3星号施力技巧指标,未经技巧为33.60;本文明确分别列出。

未见物体拆分刻意更简单,其更高分数不证明更强泛化;无多训练种子区间。

无碰撞和承受重力是分开的指标,不能把其中一个当端到端无碰撞成功率。

综合判断

数据生成与多候选物理筛选是值得复用的路线;证据主要支持受控仿真姿态质量,尚未证明大规模真实杂乱抓取可靠性。

我会先做的验证

建议实验(尚未执行):按几何/遮挡难度匹配已见未见资产,多种子重训;真实报告进场碰撞、接触后滑落、目标识别、端到端成功和总延迟,并单列是否启用施力技巧。

继续探索具身智能