RIVET:先生成共用表示,再让机器人复用程序
视觉模型离线写四个模块,运行时换目标;已知网格和人工执行器仍不可少
RIVET用对象身份、网格和SE(3)位姿连接感知、关系、渲染与规划,让视觉语言模型离线生成能互相调用的程序。新起点和目标由这些冻结程序处理,减少每次在线调用大模型;它证明了同任务家族中的程序复用,但仍依赖人工设计表示、已知资产和执行器。
图解主要方法
图1的离线编程与在线执行在哪里分界,共享表示解决了什么问题?

- 1
人工定义跨模块对象状态
每个对象用id、meshId和六维位姿表示,关系图描述支撑与装配。已知网格、相机标定及工具接口一起给模型,避免感知输出与规划输入各说各话;这种接口设计不是模型从无结构环境自主发现的。
- 2
依次生成互相兼容的函数
离线模型从参考RGB-D起终点编写perceive、render、relate、plan,后续模块看到前序代码。感知可调用OpenCV或FoundationPose,渲染检查位姿是否吻合,关系模块保持对象身份一致;生成代码还需要真实工具和几何先验。
- 3
冻结程序后求解新配置
在线新起终点先转为位姿与关系,再搜索有前置条件及状态更新的对象移动序列,输出每步目标位姿。复用发生在同类任务的新配置,不等于未见物体、工具或任务语义都能直接处理。
- 4
由固定执行器完成抓取和运动
人工编写的执行层负责抓取、可达性和运动可行性。论文在线流程没有中间视觉反馈重规划,执行误差可能累积;没有运行时VLM也不等于没有外部感知、搜索或人工工程。
实验与证据
以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。
来源证据【仿真】三个任务家族各60次,10次独立编程、每次6组配置,10分钟限时;最终成功约100%、90%、86.7%。 实验设置与表1 ↗
我的解读我的解读:跨编程重复提高证据质量,但基线有的只输出图或不含执行,接口并不完全可比。
来源证据【实机】每家族冻结一个Goal1生成的系统,共60次:积木18/20、七巧板18/20、装配14/20,总83.3%。 表2与真实实验 ↗
我的解读我的解读:这是新配置泛化,实机没有跨独立编程种子重复,不能据此推断稳定的一键部署率。
来源证据【失败边界】相机变化、遮挡、搜索效率以及抓取失败仍影响完成;结构更复杂的装配实机最低。 失败分析与局限 ↗
我的解读我的解读:统一表示减少模块错配,但不能消除感知与接触执行的误差。
开放情况与使用许可
已读全文及公开实验说明;本次未核实作者专属程序库、实验代码或模型产物公开。
LICENSE专属实现许可未确认;论文及图1为CC BY 4.0。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
通过共享可检查的几何表示连接自动生成模块,为可复用机器人程序提供清晰接口。
反方 · 哪些结论还不够
已知网格、人工表示及执行器依赖强;缺少中途视觉重规划,实机程序种子与任务范围有限。
综合判断
适合结构化工作台上的程序合成研究,真实部署仍需闭环感知和执行异常恢复。
我会先做的验证
未执行的验证方案:固定网格与执行器,对比共享表示和自由模块接口;按新配置、新相机、新物体分层,加入遮挡与抓取扰动,测首次编程成功、运行时错误、重规划恢复及端到端耗时。