世界模型RESEARCH BRIEF
Cosmos 3 Edge 后训练
世界模型如何变成设备端机器人策略
IN A NUTSHELL
把 4B Cosmos 3 Edge 世界基础模型后训练成机器人策略,并部署到 Jetson Thor。技术指南给出数据、动作服务和闭环评估路径,也披露 120 项任务上 22.9% 的成功率。
01
方法与关键变化
使用 Cosmos3-DROID 数据后训练,将物理世界预训练表示用于动作分块预测;指南覆盖策略服务、设备端运行和闭环验证,而不仅是生成视觉样本。
动作块耗时与控制频率属于不同层级:模型可以分段预测,由执行系统连续消费动作,不能把一次生成耗时直接换算为单步控制精度。
02
实验与证据
官方给出 Jetson AGX Thor T5000 上约 1.53 秒生成动作块,以及 RoboLab 120 项语言条件操作任务上 22.9% 成功率。本次未运行设备测试;数字只适用于报告配置。
03
开放情况与使用许可
官方提供模型、数据和代码入口;模型及主框架使用 OpenMDW-1.1,其他组件需各自核对。
LICENSEOpenMDW-1.1 / 组件许可不同
04
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
具体到动作后训练和设备配置的指南,比笼统的物理智能演示更便于定位工程瓶颈。它提供了把视觉先验接到实际动作输出上的基线。
反方 · 哪些结论还不够
一次动作块推理较快不等于闭环控制够快。观测采集、排队、通信和动作执行都占时间,环境变化时先前生成的后续动作可能已经过时。
综合判断
适合做端侧实验基线,不应根据单项延迟就判断可承担动态操作。优先考察动作过时与任务成功的关系。
我会先做的验证
记录从相机曝光到动作生效的完整延迟,逐渐增加物体速度和遮挡;比较固定动作块与允许重规划的策略,报告超时和失败率。