aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

RIVET:先生成共用表示,再让机器人复用程序

视觉模型离线写四个模块,运行时换目标;已知网格和人工执行器仍不可少

IN A NUTSHELL

RIVET用对象身份、网格和SE(3)位姿连接感知、关系、渲染与规划,让视觉语言模型离线生成能互相调用的程序。新起点和目标由这些冻结程序处理,减少每次在线调用大模型;它证明了同任务家族中的程序复用,但仍依赖人工设计表示、已知资产和执行器。

01

图解主要方法

图1的离线编程与在线执行在哪里分界,共享表示解决了什么问题?

原论文图1:离线编写四类函数与在线复用
原论文图1:离线编写四类函数与在线复用查看大图 ↗
Ruixiao Yang 等,arXiv 2609.31337v1;原图内容未改动。 处理记录:原图内容未改动,白底 PNG 转码 · 原始来源与图注 ↗ · CC BY 4.0
  1. 1

    人工定义跨模块对象状态

    每个对象用id、meshId和六维位姿表示,关系图描述支撑与装配。已知网格、相机标定及工具接口一起给模型,避免感知输出与规划输入各说各话;这种接口设计不是模型从无结构环境自主发现的。

  2. 2

    依次生成互相兼容的函数

    离线模型从参考RGB-D起终点编写perceive、render、relate、plan,后续模块看到前序代码。感知可调用OpenCV或FoundationPose,渲染检查位姿是否吻合,关系模块保持对象身份一致;生成代码还需要真实工具和几何先验。

  3. 3

    冻结程序后求解新配置

    在线新起终点先转为位姿与关系,再搜索有前置条件及状态更新的对象移动序列,输出每步目标位姿。复用发生在同类任务的新配置,不等于未见物体、工具或任务语义都能直接处理。

  4. 4

    由固定执行器完成抓取和运动

    人工编写的执行层负责抓取、可达性和运动可行性。论文在线流程没有中间视觉反馈重规划,执行误差可能累积;没有运行时VLM也不等于没有外部感知、搜索或人工工程。

02

实验与证据

以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。

来源证据【仿真】三个任务家族各60次,10次独立编程、每次6组配置,10分钟限时;最终成功约100%、90%、86.7%。 实验设置与表1 ↗

我的解读我的解读:跨编程重复提高证据质量,但基线有的只输出图或不含执行,接口并不完全可比。

来源证据【实机】每家族冻结一个Goal1生成的系统,共60次:积木18/20、七巧板18/20、装配14/20,总83.3%。 表2与真实实验 ↗

我的解读我的解读:这是新配置泛化,实机没有跨独立编程种子重复,不能据此推断稳定的一键部署率。

来源证据【失败边界】相机变化、遮挡、搜索效率以及抓取失败仍影响完成;结构更复杂的装配实机最低。 失败分析与局限 ↗

我的解读我的解读:统一表示减少模块错配,但不能消除感知与接触执行的误差。

03

开放情况与使用许可

已读全文及公开实验说明;本次未核实作者专属程序库、实验代码或模型产物公开。

LICENSE专属实现许可未确认;论文及图1为CC BY 4.0。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

通过共享可检查的几何表示连接自动生成模块,为可复用机器人程序提供清晰接口。

反方 · 哪些结论还不够

已知网格、人工表示及执行器依赖强;缺少中途视觉重规划,实机程序种子与任务范围有限。

综合判断

适合结构化工作台上的程序合成研究,真实部署仍需闭环感知和执行异常恢复。

我会先做的验证

未执行的验证方案:固定网格与执行器,对比共享表示和自由模块接口;按新配置、新相机、新物体分层,加入遮挡与抓取扰动,测首次编程成功、运行时错误、重规划恢复及端到端耗时。

继续探索具身智能