Embodied Turing Machines:把机器人策略写成可复用的状态程序
COAP将模型推理移到离线开发;高仿真成绩依赖几何先验与任务级代码
COAP让代码从RGB和本体感知测量、保存环境及任务状态,调用共享抓取、运动和感知库执行任务。编码代理在离线开发中调试分支并按验证成绩合并;测试时冻结程序,无VLM/VLA在线调用。RoboDojo仿真42任务总体成功率70.24%,但这不是未知任务零样本机器人,也没有真实机器人实验。
图解主要方法
在已知任务和可测量状态下,能否把在线模型决策转成离线改进的共享程序?

- 1
把环境与任务进度存入状态
每步读头部/双腕RGB、本体关节和末端位姿、夹爪命令回显。对象记录包含类别、尺寸、位姿、测量来源/误差/时间;遮挡时保留最后测量,任务状态另外保存阶段、颜色记忆、分配和重试次数。持久变量不等于被遮挡物体真实状态永远不变。
- 2
用已知几何测量RGB
NumPy/OpenCV投影机器人网格并遮掉机器人像素,用桌面颜色差与连通域提候选,将边界射线与桌平面相交,再搜索已知物体形状的位置/yaw与像素区域重合度。精细操作前腕相机重新测量;这些静态几何来自基准公开配置。
- 3
共享动作库执行并校验
任务程序组合对象族、操作、感知、运动层。一次transfer展开为抓取候选、IK与碰撞过滤、再次测量、接近、闭合、抬起持握检查、搬运和放置确认。失败时改变抓取方式或重测重试,而非在线要求大模型再写决策。
- 4
离线分支调试,测试时冻结
Opus 5.5编码代理在开发布局查日志/视频,且可对照模拟器真值定位测量错。分支先过数值场景与IK碰撞CPU检查,再在验证布局比成功次数,接受门槛为超过重跑噪声的4个episode。只在开发阶段改代码,测试时状态变化、策略代码固定。
实验与证据
完整正文和附录A–F、逐任务表及图3已核查;未独立复现或验证其榜单排名。
来源证据42任务共6,300布局运行协议;70.24%总体,长程56.4%。泛化类标准77.3%、随机54.1%;两个任务没有程序,记0分。 表2/9;§4.1、5.4 ↗
我的解读能泛化到同任务的新布局,尚非新任务零样本。表9的organize_table也为0,不能只看整体均值。
来源证据每episode中位352次决策,调用中位0.3ms;约25次感知/规划调用占99.4%决策时间。 附录A.1 ↗
我的解读0.3ms主要是交付已有动作,不能替代完整规划延时。0.8%–2.4% VLA算力等数字由CPU峰值和模型尺寸估算,不是端到端同机测量。
来源证据出问题的验证episode中,12%重试成功、22%重试失败、42%发现并报告、22%未报告。 表3 ↗
我的解读76%发现问题与34%重试并不意味着76%恢复;实际成功恢复是这类episode的12%。
来源证据旧任务同布局78.4%→79.9%,CMH p=0.16;实验约能检测4个百分点合并变化。 附录A.2;表6 ↗
我的解读只能排除较大回归,不能证明每个任务、每条路径绝不退化。表6的sweep_blocks合并轨迹60→50,也说明不能把所有指标的单调增长当通用保证。
来源证据扩展图称约15小时平均47%,但正文/附录提“四个新任务”同时又说未成功的toolbox计零,表6列四个其他任务。 图7;附录A.2 ↗
我的解读新任务集合分母表述需澄清;对照发展曲线为示意,不能据其斜率声称实测开发效率倍数或指数增长。
开放情况与使用许可
已核查论文及作者提交的论文页面;未确认可下载的完整COAP库、运行配置或对应许可。论文中的代码片段与下游基准仓库不等于本工作完整开源。
LICENSE论文为arXiv非独占托管许可;图3版权归作者,有限引用用于方法分析,不将其视为通用再分发授权。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
同一任务程序跨布局复用,官方协议42任务各3个seed×50布局,总体70.24%,记忆89.9%、精度75.1%。
保留显式测量来源、误差与时间戳,使感知修正、重抓取和任务记忆能在代码中追踪。
反方 · 哪些结论还不够
70.24−31.38=38.86个百分点,不是相对提升38.9%;对照是榜单记录而非统一预算重跑。
默认关闭的新参数只在现有测试fixtures上检验行为不变,不能数学保证所有未知观测不回归;仿真本身也有重跑波动。
所谓指数能力增长和Agent Harness线性增长的图是示意图,不能当实测规律;分支收益选择与评估共用验证布局,存在选择乐观偏差。
综合判断
是值得关注的显式状态与离线代码优化方案,但高分依赖已知资产和任务开发;不能据此宣布运行期模型在开放世界机器人中已无必要。
我会先做的验证
建议实验(尚未执行):保持开发预算一致,隐藏物体CAD与精确相机参数,按资产和任务族而非仅布局留出;报告真实机器人标定误差、接触失败、完整感知规划延时和离线开发成本,同时加入有显式记忆与恢复机制的VLA/混合对照。