SpectralCache:用奇异值外推减少世界模型去噪计算
Voyager报告5.22倍加速;这是有质量折损的缓存近似,不是实时物理仿真
SpectralCache对扩散世界模型最后一层特征做低秩SVD,复用子空间和残差,仅外推或缩放奇异值,以跳过昂贵的Transformer。两种模型的视频生成报告5.22倍和2.20倍加速;Aether的三维重建另为3.45倍。效果支持训练免费缓存,但不保证物理正确性,也不能混用三种速度数字。
图解主要方法
扩散世界模型的特征方向变化很小时,能否只更新幅值来减少昂贵主干计算?

- 1
完整算两步,建立谱缓存
最后一层时空特征重排成token×channel矩阵;做秩128分解,保存左右子空间、奇异值及未保留的残差。缓存仅保存最近两次真正完整计算的状态。作者观察前128方向平均覆盖96%能量,属于经验统计。
- 2
复用方向,只外推奇异值
普通缓存步按两次完整状态的时间间隔线性外推奇异值,重建为UΣ估计V转置加旧残差,跳过DiT主干,仍运行输出头和调度器。旧残差不是零,因此并非只存128个标量。
- 3
用误差与最长间隔触发刷新
继承WorldCache的混沌token分组及曲率加权变化代理,累计到阈值1.0或缓存达到4步就触发刷新。静态分位0.3、混沌分位0.7;该代理不是与不可得真实当前特征直接比较的误差保证。
- 4
刷新也交替近似
若上次刷新是真计算,这次以1.1缩放最近奇异值并复用子空间和残差;下次刷新再真计算。缩放步骤重置计数,但不加入两次真计算缓存,避免把近似状态当作新的真值。
- 5
分别检验生成一致性和几何输出
视频评WorldScore以及对未缓存基线的PSNR、SSIM、LPIPS;Sintel三维重建另评深度和相机姿态。视频50步与重建30步须分开报告,不能把后者速度挪到前者。
实验与证据
已读全文与附录A.1–A.3、算法1及八张表;图4视觉核验。未独立跑GPU性能测试。
来源证据Voyager50步生成49帧512×768,Aether50步41帧480×720;实验用两张Pro 6000 96GB。 5.1;A.3 ↗
我的解读这些硬件、帧数与分辨率限定速度结论;免训练不表示免显存成本。
来源证据表1 Voyager:5.22倍,WorldScore静态65.90、动态46.13;未缓存66.28、46.40。 表1 ↗
我的解读速度提高伴随轻微评测下降,不能称无损。WorldCache3.65倍、64.89/45.43提供同表参照。
来源证据Voyager PSNR25.06、SSIM0.818、LPIPS0.154;正文写65.94/46.16和SSIM0.831。 表1;5.2 ↗
我的解读表文冲突未解决,本文采用表1,不混取较有利数字。PSNR参考未缓存模型而非真实视频。
来源证据Aether生成2.20倍、WorldScore65.44/45.82,未缓存64.60/45.22。 表1 ↗
我的解读某些质量指标提高不证明物理预测更准;不宜外推为所有提示均改善。
来源证据Aether重建55.42秒降至16.06秒即3.45倍;AbsRel0.340到0.331,ATE0.177到0.179。 表2;A.3 ↗
我的解读深度改善而绝对轨迹误差略差,不能写所有几何指标都更好。该任务用30步。
来源证据禁用刷新缩放:3.84倍、PSNR26.09;启用后5.22倍、PSNR25.06。 表5 ↗
我的解读额外加速直接牺牲一致性,部署者应按质量门槛选择,不宜只取最快配置。
来源证据缓存间隔3到6:速度4.87到5.78倍,PSNR25.33降24.63;秩128到256仅25.06到25.12。 表3–4 ↗
我的解读缓存间隔比增秩更明显影响该设置的速度质量取舍;不等于其他模型最优参数相同。
来源证据单次主干17942.06毫秒、SVD82.16、外推16.40、缩放45.57、误差0.33。 表6 ↗
我的解读分项说明SVD开销相对小,但无法用这些平均值推断交互帧率或所有端到端尾延迟。
来源证据表1峰值显存50.54GB对50.44GB;表5则把方法写为50.44GB。 表1、5;5.4 ↗
我的解读缓存增加约0.1GB是作者成本分析,表间精度不一致应保留,不能据此声称零开销。
来源证据阈值0.5到1.5:速度4.42到5.36倍、PSNR25.39到24.71;分组多种设置SSIM约0.808–0.818。 附录表7–8 ↗
我的解读附录支持有限参数范围的稳健性,不能替代新场景和多次运行置信区间。
开放情况与使用许可
论文未给官方项目、代码仓库或权重链接;按题名和作者检索也未核实可用官方实现。论文公开不等于实现开源。
LICENSE论文及图4为CC BY 4.0;基座模型、代码与数据许可须分别核查,本项未确认独立实现许可。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
表1在两个基座上同时改善缓存基线的速度与感知一致性,支持低秩谱缓存的价值。
关闭缩放后质量上升、速度下降的消融,清楚展示额外跳算所付出的代价。
反方 · 哪些结论还不够
PSNR/SSIM参照未缓存输出,只衡量相似程度,不代表输出更接近真实物理。
公式2实际使用对应奇异向量点积,不是完整主角度谱;遇到符号翻转或重根,稳定性论证需更谨慎。
正文5.2与表1的WorldScore、SSIM数值不一致;未报告充分的重复运行区间与跨硬件稳定性。
综合判断
两模型结果支持谱缓存作为推理工程优化;5.22倍只适用于指定Voyager设置,不等于所有世界模型、所有任务或实时交互均有相同收益。
我会先做的验证
建议实验(尚未执行):在同硬件、同提示与随机种子下复现完整延迟分布,分别记录编码、SVD、缓存、解码成本;加入快速运动与长轨迹,报告物理一致性、显存和最坏帧误差,并核对表文差异。