aiwillknow.AI 前沿观察每日 08:00 开始整理
世界模型全文深读与原图讲解

GeoWM:直接询问未来几何,绕开逐帧滚动的误差积累

深度历史、相机运动与投影锚点共同预测指定时刻;并非动作条件模拟器

IN A NUTSHELL

GeoWM先把最近五帧转为深度和相机轨迹,再将最后一帧几何投到预测视角,作为流匹配Transformer的条件。各未来时域直接查询,共享历史而不递归生成中间帧。四类数据上的深度预测较强,但独立预测未保证跨时刻一致性,且没有控制动作输入。

01

图解主要方法

不生成中间画面,能否直接预测指定时刻的三维几何?

五帧几何历史进入流匹配Transformer,各未来时域独立预测深度并恢复点云
图2|几何历史、投影锚点和独立时域查询查看大图 ↗
华为诺亚方舟实验室(加拿大),arXiv:2610.07381v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · CC BY 4.0
  1. 1

    从五帧RGB建立几何历史

    冻结的VGGT恢复各帧深度、相机内参与位姿。最近相对运动送入轻量旋转回归与平移回归器,一次预测预设未来相机位姿;几何骨干的任意尺度需要训练和评测中的相应对齐。

  2. 2

    投影到未来视角,提供静态结构锚点

    将最后一帧深度反投影,再用预测相机位姿投影到未来视角,用最近深度的z-buffer处理遮挡。锚点不是最终答案:动态物体、显露区域和错误位姿仍需预测器修正。固定相机的DOMINO实验省略该锚点。

  3. 3

    以深度而非视觉latent学习流匹配

    深度历史、锚点和加噪目标按通道拼接,256×256输入形成256个patch token;14层、宽896的206M Transformer接收流时间及未来时域对数嵌入,预测干净深度。有效像素的逆深度加权L1流速度损失强调近处结构,TartanAir例外使用无该权重的损失。

  4. 4

    独立查询每个时域,平均四次噪声预测

    训练中40%样本使用流时间零点,推理也在该点直接读出干净深度,不积分ODE。每个时域做四个噪声样本预测后取平均,再与预测位姿恢复未来点云。因此一次时域查询包含四次预测,并非一次前向;不同查询没有共同轨迹一致性约束。

02

实验与证据

完整阅读公开正文、实验、消融和参考文献,核对图2、arXiv首发与许可;公开HTML未附额外附录。未独立运行作者实验。

来源证据每数据集训练100k步,batch16,AdamW学习率10⁻⁴,EMA0.999;VGGT冻结。文中称单GPU数小时,未明确GPU型号。 第4节实现细节 ↗

我的解读训练规模和预测器参数可复核,但不能把未披露硬件下的时间当作普适成本或个人设备性能保证。

来源证据KITTI验证3257个窗口、20时域;Cityscapes500窗口、5时域;TartanAir7314窗口、20时域;DOMINO四个拆分合计37360窗口、157325预测对。所有评测时域训练中已见。 第4节数据协议 ↗

我的解读覆盖驾驶、飞行与操控是任务多样性证据;各数据集分别训练,不是单个统一模型的零样本跨领域迁移。

来源证据前三数据集深度逐图中值对齐,DOMINO采用真实尺度;点云CD相似对齐,位姿ATE/RTE/RRE用Umeyama对齐。 表1注释及评测协议 ↗

我的解读对齐后几何形状更准与绝对距离可用于避障是不同命题。文中点云单位为米,也不能忽略评测时的相似变换。

来源证据KITTI全时域CD为1.027米,对照Cosmos-3为1.060;DOMINO为0.036对0.059。KITTI中时域δ1为83.1%,Cosmos-3为83.5%。 表1 ↗

我的解读收益依数据、指标而变;深度相对误差改善不必然意味着各几何指标同步大幅改善,不宜仅选最大的相对收益。

来源证据移除深度历史后KITTI AbsRel为28.6;用未做运动补偿的锚点为15.1,完整为14.2。历史长度2/3/4/5分别15.4/14.5/14.4/14.2。 消融实验 ↗

我的解读消融支持历史几何及运动补偿有贡献,但增加历史的边际改善快速下降,不支持无限增加上下文必然更好。

来源证据报告单时域查询GeoWM约0.11秒,在h=1/5/10/20保持不变;DINO-Foresight分别0.03/0.11/0.22/0.42秒。 效率比较表 ↗

我的解读直接查询的长时域成本优势合理,但最近时域DINO更快。查询20个不同未来时刻仍需各自计算;骨干成本是否纳入与计时硬件披露不足,不能写成完整20帧只需0.11秒。

03

开放情况与使用许可

2026-10-11核对论文链接和精确名称检索,未确认本研究官方代码、权重或模型卡。VGGT等基础模型的公开状态不能转化为GeoWM已开源。

LICENSE论文及图2为CC BY 4.0;GeoWM专属代码和权重许可尚未确认。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

KITTI全时域AbsRel为14.2(表中×100),Cosmos-3为16.6、VGGT-World为22.5;长时域为17.4对21.2。

控制表征的消融中,特征预测为17.6,增加深度损失为16.0,直接深度为14.2,支持这套训练与模型规模下的几何目标选择。

反方 · 哪些结论还不够

Cosmos-3使用零样本发布模型,而GeoWM有目标数据集的深度监督;不能把数值差距全部归因于架构。

DOMINO双重域外长时域δ1为72.0%,低于Cosmos-3的74.8%;并非所有指标、所有单元都更好。

递归消融复用按真实历史训练的直接预测检查点,递归输入存在分布变化;它没有证明最优训练的滚动模型必然失败。

综合判断

这是有说服力的定时域几何预测方案,价值在直接监督和运动投影锚点。证据还不足以把它称作可执行任意控制、具有绝对尺度保证或跨时间一致的通用世界模型。

我会先做的验证

建议实验,未执行:留出训练中未出现的时域与数据域,在不使用未来真实深度尺度对齐的条件下评测;匹配训练预算和硬件、纳入几何骨干成本,并比较相同总计算量的直接与专门训练递归模型。另加入动作干预与跨时刻点云一致性测试。

继续探索世界模型