aiwillknow.AI 前沿观察每日 08:00 开始整理
世界模型RESEARCH BRIEF

Cosmos 3 Edge 后训练

世界模型如何变成设备端机器人策略

IN A NUTSHELL

把 4B Cosmos 3 Edge 世界基础模型后训练成机器人策略,并部署到 Jetson Thor。技术指南给出数据、动作服务和闭环评估路径,也披露 120 项任务上 22.9% 的成功率。

01

方法与关键变化

使用 Cosmos3-DROID 数据后训练,将物理世界预训练表示用于动作分块预测;指南覆盖策略服务、设备端运行和闭环验证,而不仅是生成视觉样本。

动作块耗时与控制频率属于不同层级:模型可以分段预测,由执行系统连续消费动作,不能把一次生成耗时直接换算为单步控制精度。

02

实验与证据

官方给出 Jetson AGX Thor T5000 上约 1.53 秒生成动作块,以及 RoboLab 120 项语言条件操作任务上 22.9% 成功率。本次未运行设备测试;数字只适用于报告配置。

03

开放情况与使用许可

官方提供模型、数据和代码入口;模型及主框架使用 OpenMDW-1.1,其他组件需各自核对。

LICENSEOpenMDW-1.1 / 组件许可不同

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

具体到动作后训练和设备配置的指南,比笼统的物理智能演示更便于定位工程瓶颈。它提供了把视觉先验接到实际动作输出上的基线。

反方 · 哪些结论还不够

一次动作块推理较快不等于闭环控制够快。观测采集、排队、通信和动作执行都占时间,环境变化时先前生成的后续动作可能已经过时。

综合判断

适合做端侧实验基线,不应根据单项延迟就判断可承担动态操作。优先考察动作过时与任务成功的关系。

我会先做的验证

记录从相机曝光到动作生效的完整延迟,逐渐增加物体速度和遮挡;比较固定动作块与允许重规划的策略,报告超时和失败率。

继续探索世界模型