aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

Agent as Policy:通用编程智能体直接参与机器人执行

无需任务策略训练,但标定、控制器与运行预算仍不可省略

IN A NUTSHELL

AGP 让通用智能体在执行期间反复看图、计算几何、写程序、请求动作并根据物理结果修正,而不只是预先写一段程序或选择已有技能。真实机械臂实验显示这种流程可完成多种桌面任务,同时暴露了时间成本与小样本可靠性的限制。

01

图解主要方法

图 1 中智能体和机器人控制器各自负责什么?

原论文图 1:任务准备、运行时编程与机器人反馈接口
原论文图 1:任务准备、运行时编程与机器人反馈接口查看大图 ↗
Mengzhao Jia 等,arXiv 2609.12541v2;原图内容未改动。 处理记录:原图内容未改动,白底 PNG 转码 · 原始来源与图注 ↗ · 版权归作者;arXiv 非独占分发许可不是开放图片许可。为方法评论仅引用必要原图,不授予进一步使用权。
  1. 1

    先建立可复用任务定义

    图 1b 上方准备智能体把视频、图像或语言目标转为任务定义,写明约束、完成标准和接口预算。运行智能体接收当前实例;普通试次从空经验开始,模型权重固定,所以零样本指没有该任务的策略训练,不是没有工程配置。

  2. 2

    在运行中编程解释视觉和几何

    图下执行智能体读取腕部 RGB-D、俯视图和标定,可写程序拟合平面、求射线交点、修正夹爪偏移。图中位置与姿态不是直接从文本变成电机指令,而是经过可检查的计算与机器人坐标系转换。

  3. 3

    把运动请求交给独立控制器

    桥接层接收关节或末端位姿,使用逆运动学和限速轨迹控制,并返回实际状态和误差。控制与推理异步运行,普通移动和抛投使用不同限幅/定时接口;30fps 摄像头并不等于智能体30Hz决策。

  4. 4

    通过观察恢复,并另测经验迁移

    图中闭环在插入失败或物体滑落后重新观察和规划。持久文件可保存成功程序与修正,供下一次新上下文读取;这改变了经验条件,应与空经验测试分开,且要计入保存和收集经验的成本。

02

实验与证据

以下为作者报告;已阅读 v2 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。

来源证据【真实平台】YAM 六关节平行夹爪;四对装配8/10、三种积木合计29/30、骰子10/10。成功装配平均37.2分钟,全部试次含失败与报告平均48.5分钟。 表 1、附录 A/B/D ↗

我的解读我的解读:支持通用智能体在有限任务上直接闭环操作;成功率与成功条件下时间必须同时看,不能当工业节拍。

来源证据【小样本边界】抛投只有2/2;顺序叠毛巾5/5、同步3/5,允许残余皱褶与偏斜。另一个机械臂和灵巧手试验中瓶子抬起后滑落。 表 1 与附录 F/G ↗

我的解读我的解读:跨本体案例是定性协调证据,不是已经稳定完成搬运;2/2也无法证明动态技能鲁棒。

来源证据【经验研究】Terra 从空经验1/5到读取Astra经验4/5;成功试次时间降34.3%。五次顺序经验积累未配每次清空的独立对照。 第 4.3 节与附录 D.2/D.3 ↗

我的解读我的解读:时间均值比较只有1和4个成功样本,而且不计强模型收集成本;因果和摊销收益都要进一步验证。

03

开放情况与使用许可

09-11 首发,按 v2 回顾补收;文中引用 i2rt、Mink 等基础库,但未核实 AGP 完整桥接、任务和轨迹包发布,不能将基础库当作本系统开源。

LICENSE论文图 1 为 arXiv 非独占分发授权;完整系统实现及数据许可未确认。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

运行时几何程序与物理反馈结合,使智能体能修改具体动作方案,而非受限于固定技能库。

反方 · 哪些结论还不够

平台标定、低层保护和任务定义仍是关键依赖;执行慢、样本少,经验提升还混有顺序和场景变化。

综合判断

适合研究原型与低频复杂桌面任务;需要独立运动保护和明确定义的物理成功标准,尚不支持无人高吞吐部署。

我会先做的验证

未执行的验证方案:以预注册随机场景和至少多次独立重复,比较运行时编程、固定程序、固定技能编排;统计全部试次时间/费用、恢复次数、碰撞与失稳,再随机交叉比较有无经验文件。

继续探索具身智能