Texture Space Material Diffusion:直接在UV空间生成可重光照材质
把视频DiT的时间维改作多视角条件,分别检查底色、粗糙度与金属度
给定带UV的已知网格,模型把有位姿照片、文本或低分辨率材质转为底色和打包PBR贴图。统一纹理空间避免为同一表面点分别生成多个视角的颜色;三维位置编码协助跨UV岛联系。重光照测试支持其资产价值,但需要准确几何与相机,且8K多视角推理代价明显。
图解主要方法
图3怎样在已知网格上分离观测条件与材质输出,为什么用视频模型却不生成运动?

- 1
先把照片投回同一个UV空间
图3左侧几何是输入而非输出。已知网格、相机位姿和不重叠UV后,每张照片投回纹理图集,形成覆盖不完整的观测。几何的世界位置和法线也生成贴图,作为紫色 Shared conditioning;这样不同照片中同一表面点对应同一纹理位置。未知光照仍在照片里,模型必须学习分离反射率与照明,不能把投影本身称作去光照。
- 2
用视频模型处理多种材质条件
中间 DiT video model 来自 Wan 2.1-1.3B,但时间维被用于拼接观测、位置法线条件和带噪材质潜变量,不是在生成物体运动。作者整体微调DiT,采用流匹配预测干净材质与噪声之间的速度。图右输出两张RGB图:底色以及打包的高度、粗糙度、金属度。高度转换为凹凸法线,不等于生成真实位移几何。
- 3
让单图与文字条件感知三维邻接
单图模式需要补全不可见表面,文字模式把观测换成UV覆盖掩码。此时以世界XYZ位置和帧编号构造3D-aware RoPE,替代普通UV像素位置与帧编号,使UV上相隔很远、三维上相邻的区域可相互关注。16×16图像块含多个UV岛时仍可能混淆,平均位置无法完整表示块内所有表面。
- 4
把高分辨率和多视角作为推理扩展
8K先从2K结果放大,加少量噪声后在2K裁块上继续去噪,每步随机平移裁块网格以减少裁块边界。超过100张照片则分重叠批次,各批预测同一材质潜变量的速度,每纹素选覆盖最多的两个专家加权。裁块边界缓解不等于UV岛接缝已有定量保证;覆盖权重也不是经过校准的不确定性。
实验与证据
已阅读v1正文和附录、检查原图3及作者项目页;下列数字均为作者实验,本站未训练、运行或独立复现。
来源证据【训练与测试条件】训练用TexVerse的12万个物体、每物体17张路径追踪图,32张A100训练15000步,分辨率512²逐步升至2048²。主要合成测试32个未见场景,每场景8视角×8新光照;真实测试8个DTC物体、136张图。 第2/3节及附录 ↗
我的解读我的解读:这是有已知几何和相机的材质模型。几何条件与LSRM联合重建不同,应看作者另列的共同LSRM几何对照,不能把几何误差全部归因于材质网络。
来源证据【表1指标口径】合成重光照PSNR为30.46dB,DiffPT为24.90;真实原光照重建则29.03低于DiffPT的30.67。表1先拟合包含曝光和色彩曲线的10参数相机响应,再固定用于新光照。 表1、表S1及相机响应拟合说明 ↗
我的解读我的解读:重光照优势比原照拟合更接近资产用途,但这些不是未经校正的直接输出指标。附录无校正表中真实重建本方法22.66dB、DiffPT27.01dB,必须保留这一差异。
来源证据【分辨率与耗时】4个真实样例从17视角2K到117视角8K,PSNR/SSIM由28.42/0.919变为28.34/0.917,LPIPS由0.0668降至0.0639。GB300上17视角2K约130秒;117视角8K约2610+279+10秒,约48分钟。 图8、表S2 ↗
我的解读我的解读:更高分辨率并非所有指标上涨,更不意味着8K只需130秒。交付资产应比较细节、材质通道正确性、耗时和显存,而非只看贴图尺寸。
来源证据【材质通道与消融】32场景×17视角的g-buffer比较中,本方法底色PSNR27.00、粗糙度24.32、金属度18.24;单独512²文字条件RoPE消融,加入几何条件后再换3D位置编码,CLIP-FID由3.677降到3.561。 表S3及RoPE消融 ↗
我的解读我的解读:材质通道测量补充了最终渲染分数,但底色和照明仍存在强度歧义;RoPE增益有限且实验分辨率不同,不能与主结果直接拼表。论文没有独立的UV接缝误差指标。
开放情况与使用许可
实际打开作者项目页,其提供论文和结果查看器。本次未在该页核实可下载训练/推理实现或模型权重,不把论文、Wan上游代码或结果展示称作本工作开源。
LICENSE论文标注arXiv永久非独占托管许可;这不是通用再分发许可。图3仅作为必要方法评论引用,权利归作者;未确认本方法代码、权重的开放许可。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
纹理空间共享表面坐标,有利于多视角一致;合成新光照与材质分量实验为去光照能力提供了具体证据。
反方 · 哪些结论还不够
相机响应校正、已知几何和测试规模限定结论;高分辨率速度与接缝质量尚不满足无需检验即可投产的判断。
综合判断
有明确资产流程价值的PBR生成研究,但公开演示不能替代可复现实现,8K也不能代替材质正确性验收。
我会先做的验证
未执行的验证方案:固定几何、UV和照片,对照直接投影、逆渲染和本方法;使用已知材质及保留光照,分别报告校正前后渲染误差、各PBR通道、UV接缝和端到端耗时,再用不同UV展开检验稳定性。