aiwillknow.AI 前沿观察每日 08:00 开始整理
3D 生成全文深读与原图讲解

Tex-Zero:把二维图像折成训练样本,学习原生三维纹理

合成几何负责邻域与遮挡,图像负责颜色;既定几何仍是必要输入

IN A NUTSHELL

Tex-Zero把图像分块、随机旋转并聚拢成带颜色的稀疏三维表面,用这些样本从零训练VAE和条件DiT。共享VAE编码参考视图与目标纹理,使二维细节能迁移到真实几何表面;输出RGB颜色,不生成几何,也未证明能分离光照或恢复PBR材质。

01

图解主要方法

图3怎样共享二维/三维颜色编码,同时保持几何固定?

Tex-Zero图3,实线为图像构造样本训练,虚线为真实三维几何推理
原论文图3:共享VAE与条件DiT的训练、推理路径查看大图 ↗
香港中文大学 MMLab · 腾讯混元等,arXiv:2609.34621v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · 论文CC BY 4.0;作者图3未修改,第三方示例资产权利保留
  1. 1

    用图像构造颜色已知的三维邻域

    图3的训练对象来自图2预处理:1536像素图像先置于z=0,再分成4×4块,独立旋转和平移。聚拢要求包围盒重叠,并不保证表面连接或无自交;每个体素只保留首个点,保留其颜色而不平均,形成几何与RGB配对。

  2. 2

    先训练共享稀疏VAE

    图3左侧先以整体旋转平面预热,再使用多块样本;缺少此预热作者报告不收敛。稀疏三维卷积编码颜色,解码时几何支撑固定。损失含逐点MSE、KL和还原图像布局后的LPIPS;它学习颜色压缩,不预测几何,法线也不直接拼入VAE的RGB重建输入。

  3. 3

    把参考视图和目标放进同一潜空间

    图3右侧把六个正交视图当成有朝向的平面,用同一冻结VAE编码;法线另编码为16通道,与带噪纹理16通道拼接。4轴RoPE用视图组g和三维坐标区分条件,平面坐标不是目标表面的逐像素深度。训练随机抽取视图及遮蔽图像条件,让模型处理缺失外观。

  4. 4

    流匹配生成表面颜色

    12个双流加24个单流Transformer块学习噪声到纹理的速度;推理保留几何条件,用50个时刻对应49次Euler更新,再经冻结VAE解码成既定体素上的RGB。图中虚线表示真实资产推理,实线表示构造数据训练;不存在自动输出几何或PBR通道的分支。

02

实验与证据

已阅读v1正文与附录A–C,核对架构、训练损失、采样器、内部测试集与官方仓库提交24e1ef7。原图3已检查,未独立训练或运行。

来源证据【训练与评价】约1110万SA-1B、BLIP3o-60k和ShareGPT-4o图像;对照约100万内部3D资产。VAE在200件内部真实资产评价,DiT在160件内部形状/多视图样本评价。 第4.1节、附录B/C ↗

我的解读我的解读:无真实3D资产训练是本方法训练范围内的结论,不是无需输入几何;规模和数据质量差别限制纯粹的数据模态因果归因。

来源证据【VAE指标分歧】f8c16图像训练LPIPS为0.0154,优于相同结构3D训练0.0208;但PSNR-PC为34.03,低于36.55,渲染PSNR42.41也低于44.71。 表1 ↗

我的解读我的解读:感知细节和逐点数值保真存在取舍,不能写重建所有指标更好;压缩倍率不同的VAE也不应直接等价比较。

来源证据【纹理生成】六视图输入LPIPS/PSNR为0.0340/35.68,NaTex为0.0754/27.74;单前视图为0.0294/35.31,TRELLIS.2为0.1187/21.38。TRELLIS.2无六视图公开配置,表中留空。 表2、附录C ↗

我的解读我的解读:测试评价参考外观转移,不是物理材质质量;单视图PSNR更高也不能证明隐藏面更正确,应区分可见区域与补全部分。

来源证据【消融】20K步VAE从固定平面LPIPS0.2160,整体旋转0.1107,到16块聚拢0.0355;20K步DiT共享图像VAE0.0481,对照独立VAE0.0838。混合2D+3D训练又优于仅3D。 表3–5、附录B.2 ↗

我的解读我的解读:几何增强和共享表示得到支持;混合结果也表明真实3D数据仍可有益。附录两种训练的LPIPS计算分别回拼图像与六视图,需匹配此因素再作严格归因。

03

开放情况与使用许可

官方仓库固定提交24e1ef778382757ce28c6377c1dc58318b54fc26只有README和5张图片,无训练/推理实现、模型权重或测试资产。项目页可访问不代表代码开源。

LICENSE论文为CC BY 4.0,图3保留作者与来源,未修改;第三方示例资产权利不由本文扩张。尚无代码/权重许可,来源图像集也各有自身条款。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

相同结构的VAE与分阶段几何增强消融支持局部三维邻域可由二维图像构造;共享编码器减少条件和目标表示差异,生成指标改善明显。

反方 · 哪些结论还不够

1110万图像和100万内部资产在规模、质量及感知损失计算方式上不同,不能把优势完全归因于二维数据本身。重建PSNR并非全优,生成仅在内部160样本验证。

综合判断

为给定几何的原生RGB纹理训练提供了有价值的证据,尤其适合研究图像细节迁移;还不足以证明真实资产数据在所有纹理任务中可替代,更不涵盖几何或PBR生成。

我会先做的验证

未执行的验证方案:匹配数据量、训练算力和感知损失,公开跨域资产测试;分别评价可见与不可见区域、细字和薄表面串色。另做UV烘焙接缝、反照率去光照及不同HDRI下重光照,记录失败与人工修复时间。

继续探索3D 生成