aiwillknow.AI 前沿观察每日 08:00 开始整理
世界模型全文深读与原图讲解

HLA-WM:回到旧场景时,按相机几何重组线性注意力记忆

无需重训的历史摘要检索;12倍节省针对历史状态,不是整机显存

IN A NUTSHELL

HLA-WM把Gated DeltaNet每段历史的状态变换单独缓存,按相机视锥重叠挑选相关片段,再按时间顺序重组当前记忆。它无需微调即可改善长视频回访一致性,但仍保存随片段数增长的摘要库,也没有建立遮挡后物体演化的物理状态模型。

01

图解主要方法

线性递归记忆遗忘了远处场景,能否在不重训、不保存全部视觉KV的情况下恢复?

首块sink、相机几何TopK和近期块被按时间排序,合成A与B构造当前查询的历史记忆
图3|按几何选块并重组GDN历史查看大图 ↗
Monash University、阿德莱德大学、浙江大学,arXiv:2610.05739v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · CC BY 4.0
  1. 1

    把每个历史块写成独立仿射摘要

    图3每块保存A和B,递推为S新=S旧A+B。A表示怎样变换此前记忆,B表示新写入信息;按原扫描顺序相乘和累加即可合成,无需重跑整段视觉token。

  2. 2

    利用相机视锥选择相关历史

    根据相机内外参,在画面7×7射线和场景中位深度的0.5、1、1.5倍处放代理点,计算双向落入视野比例。默认取Top1远期块,再保留首块sink与最近块;这不是精确深度重建或遮挡判定。

  3. 3

    转弯时扩展近期上下文

    当前块早段与晚段平移方向差达到25度时,将近期块数从1增到3。判据使用预定相机轨迹,保持转向处局部连续性,而不是由生成图像学习一个路由器。

  4. 4

    按时间顺序重组,并对齐另一条注意力通道

    图3底部合成被选块的A、B,跳过无关历史的衰减变换;softmax分支选择同一组KV。只替换主GDN矩阵和归一化状态,相机GDN、短卷积与FFN时序卷积保持原始递推。

  5. 5

    生成当前块后写入新摘要

    SANA-WM Stage1保持原权重与4步蒸馏采样,每块3个潜在帧。完成后额外进行t=0写缓存前向,保存该块摘要;下游AR或双向精修不重训,也不回放历史视觉token。

02

实验与证据

完整阅读68818字符正文、参考文献与附录A.1–A.9,视检图3,核对官方代码树、推理入口、许可和SOURCE公开范围。未运行H200视频实验。

来源证据单H200 140GB;SANA-WM-Bench简单/困难各80条、每条961帧约60秒、1280×704;MBench-A共547样本。 第5.1节 ↗

我的解读这是固定模型、输入、提示和相机轨迹的成对推断比较,优势是避免训练计算差异;没有独立运行复现。

来源证据困难轨迹Stage1 PSNR9.37→10.11、SSIM0.1774→0.1997、旋转误差20.3759→15.0887度。 表1 ↗

我的解读回访在同一模型首次和再次观察间比较,证明更一致,不是对真实世界几何的绝对准确度。

来源证据简单轨迹AR精修后PSNR14.44→14.82,但平移误差2.1587→2.1910、CamMC2.3121→2.3240。 表1、附录A.8 ↗

我的解读整体回访更相似时,部分控制指标仍略差;不能将Stage1六项改善套用所有精修子集。

来源证据60秒历史状态2.15GiB,约为完整KV的1/12;Stage1吞吐22.403→22.053FPS,降低约1.56%。 图4、效率分析 ↗

我的解读它在原生GDN之上增加独立历史库。该数字不含整套模型、VAE与精修器全部显存,也不是固定内存无限生成。

来源证据Hard双向精修仅GDN重组SSIM0.3304高于完整方法0.3142,但旋转误差33.0406度远高于完整方法10.5268度。 附录表4 ↗

我的解读两条记忆通道错配可能破坏控制,验证时需要同时检查外观与轨迹而非单看SSIM。

来源证据K=4时Uniform PSNR9.91、几何10.00;Uniform平移误差1.6881略好于几何1.6985。几何策略转弯时可多保留2块。 附录表6–7 ↗

我的解读几何检索有增益,但不是严格等预算;K=1回访最佳,K=5旋转误差更低,预算取舍没有单一最优。

来源证据公开SOURCE明确不包含训练、蒸馏、完整基准和若干消融。推理入口的中位深度默认3.0,须与相机平移单位一致。 官方源码与公开范围 ↗

我的解读公开代码足以核查主要推断机制,完整复现全部表格仍需补充实验脚本与正确场景元数据。

03

开放情况与使用许可

2026-10-11核对Caesarhhh/HLA_提交5879c5a6b2bae7b09fdce02e86eb5c32bc438b52,含实际推理、GDN内核、相机检索与重组实现。SOURCE说明公开Top1及基线,排除训练/蒸馏、完整benchmark和若干消融变体;使用SANA-WM现有权重,无新的训练权重。

LICENSE论文与图3CC BY 4.0;hla-wm子目录Apache 2.0并保留上游来源。SANA-WM、文本编码器、refiner权重许可分别适用,不能由代码许可推断统一商用范围。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

通过仿射变换合成保存每段对记忆的影响,比把旧状态直接平均更忠实于原GDN递推;选择全部历史时可退化为原递推作为检查。

两个基准、三个推断模式的回访指标均有整体改善;附录把GDN重组与softmax KV对齐分开消融,揭示两条记忆通道的相互作用。

反方 · 哪些结论还不够

几何检索与Uniform在较大检索预算下PSNR只差0.09dB,且转弯时额外保留近期状态,比较并非严格等计算预算。

Hard双向精修中只改GDN可使SSIM上升但旋转误差13.17度恶化到33.04度;单一相似度提升不能代表摄像机控制也好。

摘要库仍随历史长度线性增长;12倍对照是完整KV,不是原生GDN的常数状态或整模型显存。

综合判断

一种机制清楚、实现已公开的免训练记忆改造,适合研究相机回访一致性。证据尚不足以说明它能维护会随时间变化的完整世界状态。

我会先做的验证

建议实验,未执行:固定相同历史状态数与计算预算,对比几何、Uniform和随机检索,加入深度误差、相机标定噪声、遮挡及物体已移动的回访场景;同时记录旧外观复现、正确新状态、相机误差、总显存和超过60秒后的增长。

继续探索世界模型