WROP:训练世界模型记住被遮住的物体
150种程序场景与300题评测,物体持久性收益仍需跨生成器验证
WROP针对遮挡后的物体身份、容器内物体、阻挡与碰撞等现象,构建程序化视频数据并微调续写模型。它把“物体不能凭空消失或穿过障碍”转为可检查任务,但数据来自人工编排的动画,基准高分并不等于掌握通用动力学。
图解主要方法
图1中的遮挡与碰撞场景如何组成训练集,评测又能验证哪些能力?

- 1
把认知现象拆成六类生成器
图1覆盖动态/静态遮挡、容器三类持久性,以及阻挡、支撑移除、碰撞三类固体性,总共150个Blender生成器。运动由解析轨迹和关键帧编排,不是通用物理引擎自动求解;自动文件审计也不能保证全部运动符合物理。
- 2
在输入之后安排关键事件
每生成器一万样本,共150万;一般120帧、24fps、720p,按60/60分输入和目标,关键可判别事件落在后段。300题考试每生成器两题,训练和测试共享生成器,因此主要检验同任务家族变化,尚非未见机制泛化。
- 3
微调续写模型并区分原生尺寸
PWM-WROP以Cosmos3-Nano-16B为基础训练一轮,原生训练视频为320×192、117帧打包;较长样本处理另有例外。Trainium2吞吐测量采用不同的288×512形状,不能和原生配置直接拼成统一训练成本。
- 4
按模型接口和人工证据读排名
14模型含续写、参考图生成和视频编辑,能利用的信息不同。20位评价者作361次跨模型盲比,形成Elo及置信区间;编辑模型重画输入区间并不等于预测未来,应优先在相同接口内比较。
实验与证据
以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。
来源证据【人工结果】PWM-WROP续写类第一、总体第三,Elo1679.5,区间1603.5–1781.5;物体持久性较强,碰撞排名更低。 人工评测与分家族结果 ↗
我的解读我的解读:支持专门数据改善目标现象,但置信区间重叠、不同接口及每家族有限判断限制统一冠军结论。
来源证据【像素指标】在320×192对齐评测中LPIPS0.081、MS-SSIM0.921表现较好,并非所有PSNR/SSIM/FID指标领先。 自动指标表 ↗
我的解读我的解读:参考视频相似度不是物理正确性的充分条件,尤其无法单独证明未见碰撞规律。
来源证据【归因缺口】论文没有给出相同配置、未用WROP微调的Cosmos3-Nano匹配对照;考试与训练共享150生成器。 基线清单、训练与数据附录 ↗
我的解读我的解读:无法把相对其他架构的全部优势归因于WROP数据,也还不能证明跨程序结构泛化。
开放情况与使用许可
已核实官方仓库含生成器和PWM训练代码,HF训练集有打包文件、PWM-WROP有七个safetensors分片;文件存在不代表本站已复现1.5M样本或训练。
LICENSE仓库及数据/模型卡标CC BY-NC 4.0;Cosmos基础模型与部分代码另受OpenMDW-1.1约束。属于有非商业限制的公开研究资源,不称无条件开源。论文原图许可另见图注。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
将遮挡后身份与固体性变成可复现的数据生成任务,并提供实际代码、数据文件与检查点,便于进一步审计。
反方 · 哪些结论还不够
关键帧合成、共享生成器测试、接口不等价与缺少匹配基础模型对照限制物理理解的主张。
综合判断
适合作为对象状态持续性的专门训练和诊断资源;通用世界模型验收还需未见生成器和真实交互。
我会先做的验证
未执行的验证方案:按整个生成器留出训练/测试,对同一Cosmos基础模型做有无WROP和等量普通视频微调;加入真实遮挡与碰撞,分别测身份保留、事件顺序、物理约束、人工一致性和接口覆盖。