DistScene:让环境与独立物体在同一三维坐标系中生成
联合布局再局部细化;公开的是展示资产,代码、权重和训练集仍待发布
DistScene把房间或户外环境也当作可生成组件,与独立物体共同预测稀疏结构和几何,再将每个物体移到局部空间细化。训练场景由TRELLIS.2生成的环境与物体组合而成。室内外几何指标改善,但训练视图要求所有物体可见,室内数据常缺天花板,输出仍可能有孔洞;展示场景可下载并不代表模型已开源。
图解主要方法
单图三维场景生成能否同时保留环境约束、独立物体身份与局部细节?

- 1
用物体生成器构造分组件训练场景
语言描述经图像生成再交TRELLIS.2,分别得到空环境与完整物体。采样尺度平移,检查支撑、AABB后网格相交及物体与非地面环境碰撞,不能调整则拒收;只保留所有物体可见的渲染视角。这里是数据蒸馏,不是对教师logits做知识蒸馏。
- 2
共享坐标系内联合生成结构和几何
每个物体与环境分配独立噪声槽,类型/组件嵌入保留身份,拼接token联合注意力。先生成稀疏体素支撑,再生成各支撑上的形状SLAT,解码后已位于同一场景坐标系;空槽解码为空支撑后丢弃。
- 3
把小物体移到局部空间恢复细节
对场景物体平移和均匀缩放,保持方向,再体素化为局部支撑。细化器读取输入图、固定的全场景几何潜变量与目标组件标记,仅生成该对象局部几何,最后逆变换回原位,环境与其余上下文不重生成。
- 4
几何条件下分别生成纹理
环境纹理分支读取环境支撑与全局形状上下文;物体分支额外读取细化后的局部形状SLAT。解码得到带纹理组件,但该步骤未提供UV展开、接缝修补或可重光照材质的独立质量证明。
- 5
通过LoRA适配并保留分辨率成本
冻结TRELLIS.2骨干,各模块LoRA秩32、AdamW学习率1e-4、batch64、20k迭代,512训练而主结果1024推理。高分辨率局部细化逐对象收费,不能把场景阶段耗时当整场景总时间。
实验与证据
全文和附录A.1–A.6、两段训练推理算法已完整阅读;核对官方项目及Hugging Face示例文件目录,图3视觉核验。未下载18.6GB资产全集或运行模型。
来源证据约125k合成场景,70k物体、46k空环境;其中约106k室内、18k户外。 5.1;A.2 ↗
我的解读分项为近似量,不强行补成精确总和;“无需已有场景集”不代表上游生成器没有外部训练数据。
来源证据MIDI场景CD0.0877、F-score71.59%,3D-Fixer0.1295/65.08%;物体CD0.1529、F-score51.64%、IoU0.3688。 表2 ↗
我的解读32.2%是场景CD相对下降,6.51是F-score百分点;场景与物体指标不能混为同一几何质量。
来源证据Gen3DSR场景CD0.0958、F-score79.68%,3D-Fixer0.1027/77.97%。 表2 ↗
我的解读改善幅度比MIDI小;两者室内F-score阈值0.1,不能与户外阈值0.05直接比高低。
来源证据UrbanScene3D CD-L1 0.0772、F-score0.722;Extend3D0.0832/0.680、TRELLIS.2 0.0831/0.701。 表1 ↗
我的解读同表支持户外几何改善,但没有证明无限场景扩展或真实导航安全。
来源证据加入环境后MIDI对象F-score29.98到40.98、IoU0.1798到0.2544;场景CD0.0922到0.0928略差。 表4 ↗
我的解读环境收益集中于对象及关系,不应称每个指标无条件提升。
来源证据不带场景上下文细化的MIDI场景CD0.1055,带上下文完整模型0.0877。 表4 ↗
我的解读细化不只是放大局部网格;组件匹配与场景条件对恢复正确形状重要。
来源证据512场景5.7秒、每物体细化3.3秒、18GB;1024场景36.4秒、每物体38.5秒、21.8GB。 表5 ↗
我的解读须按物体数累计细化成本,纹理及全部管线计时边界、测试硬件未充分交代;不能承诺36.4秒整场景完成。
来源证据43人对20个随机文生图输入,从匿名随机排序的5种结果选最佳,平均偏好65.41%。 表3 ↗
我的解读这是五选一偏好率,不是正确率、并非65.41%的人参与实物资产验收,也不提供材质物理准确度。
来源证据MIDI重渲染包含地面、墙和物体,并给需辅助输入的基线同场景mask与depth。 A.3 ↗
我的解读公平性应在这个改造后协议内理解,不能与未重渲染MIDI文献分数直接排名。
来源证据训练室内空环境常不含天花板;户外大尺度分辨率不足可能形成孔洞。 A.5 ↗
我的解读这些是明确资产缺陷,需在仿真导入前检查完整性、碰撞体和材质,而非仅看项目导航视频。
开放情况与使用许可
官方Code、Checkpoint、Dataset按钮均写come soon并返回项目页。Hugging Face的DistScene-preview-assets确有inputs、original_output、previews及视频,属于生成结果;卡片只有项目链接,未确认训练权重或数据集开放。
LICENSE论文为arXiv非独占托管许可,图3署名用于方法评论;示例资产卡缺许可元数据,不能据可下载推断可商用或任意再分发。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
显式环境消融提高对象F-score与布局IoU,移除细化阶段的场景上下文会明显退化,支持两个设计组件的价值。
同时报告室内、户外几何指标及分组件结果,比只展示正面渲染更能检验三维结构。
反方 · 哪些结论还不够
MIDI测试输入经重渲染补全背景,给需要的基线提供对齐mask/depth;不是原始MIDI输入协议的直接榜单。
对象级细化可能改变表面接触,固定回放变换不等于保证无穿插;缺少输出碰撞统计。
外观主要依赖小规模偏好研究,未证明UV、PBR或重光照质量;大规模生成数据的上游成本、模型细节与授权还不完整。
综合判断
证据支持用显式环境和局部细化改善组合场景几何;目前应视为有展示资产的研究方案,尚非经过资产生产与物理验收的开源工具。
我会先做的验证
建议实验(尚未执行):在严重遮挡和封闭房间上评估组件召回、天花板完整性及输出碰撞;以相同输入协议复测基线,报告每物体细化和纹理总耗时,并检查导出后的UV接缝、材质通道和新光照表现。