BuildRome:自适应分块,把单张照片扩成室内外场景网格
近处细、远处粗,并将已见表面与遮挡区分开;输出仍无纹理且依赖估计深度
BuildRome在TRELLIS.2上添加深度对齐条件和LoRA,按距离、局部高度分配不同物理尺寸的场景块,再复用重叠潜变量逐块补全。单图能生成包含遮挡部分的场景几何,但隐藏区域只是合理假设,米制尺度继承单目深度误差,尚不生成纹理或PBR材质。
图解主要方法
图2如何让对象生成器按透视尺度完成场景,并区别观测与猜测?

- 1
从单目点图分配不同大小的块
图2a用MoGe-3估计相机和点图,建立地面对齐坐标。近处使用较小块,远处及较高结构提高尺度;各块缩放到3米规范立方体,同时缩放深度和相机平移,保持投影不变。原始估计错误仍会改变真实覆盖和尺度。
- 2
只在观测表面附近提升图像特征
图2b将DINOv3特征投到距估计表面1.5个体素以内的位置,其他位置置零。稀疏结构阶段另输入截断到±1米的有符号深度残差:负值为空间前方,零附近是表面,正值为未知背后;这不是完整三维SDF,不能直接当物体内外标签。
- 3
保留对象先验并训练局部场景生成
TRELLIS.2稀疏结构先预测占据,再生成结构潜变量;rank32 LoRA和新条件模块共同训练,使用室内合成场景及约4000个构造户外场景。户外流程先组装不完美资产再重渲染,令输入图像、深度和目标几何相互一致,模型并非直接把错误参考照片当几何真值。
- 4
按顺序固定重叠潜变量再解码
图2c从近到远生成,重叠内区已有潜变量在每步去噪中重新固定;不同尺度之间三线性重采样后约束。它促进块间一致,却可能传播早期错误。拼装后解码为无纹理网格;论文彩色结果多为法线或块可视化,不是已生成材质。
实验与证据
已阅读v1正文及附录A.1–A.4;核对官方项目、仓库bf23d02、模型卡7e188bb及两个实际权重文件元数据,并检查深度处理实现片段。未执行CUDA推理或独立复现。
来源证据【主评测】7个Tanks and Temples场景、32个ScanNet++场景;ICP后算几何指标,CD按真值中位深度归一,F1阈值10cm。Tanks CD1.99对照最佳2.63,F1 0.506对照0.388。 表1、第5节 ↗
我的解读我的解读:约24%和30%分别是相对改进,不是百分点;场景数量有限,且ICP不能验证未经对齐的实际尺寸和位置。
来源证据【感知范围】121张野外图含53室内、68室外,DreamSim0.221、CLIP-N0.870;两两偏好对所有基线至少73%。CLIP-N将渲染法线与单图估计法线比较。 表1及指标说明 ↗
我的解读我的解读:估计法线本身不是真实隐藏面证据;论文未充分报告用户研究人数和统计不确定性,偏好不能替代测量。
来源证据【分块与资源】消融自适应约5分钟,对照固定块15分钟、单块1分钟;280米深例子用15块、峰值26GB,对照固定约200块超80GB。当前README另报告98米例子约6分钟、15.8GiB。 表2、附录A.1、官方README ↗
我的解读我的解读:是不同场景和代码条件,不能合并成统一显存/时延承诺;单块快但损失远处几何。
来源证据【条件与数据消融】户外完整条件F1 0.501,去可见性0.464;但CD6.90反而差于6.60。加入户外数据后F1从0.317至0.501。 表3/4 ↗
我的解读我的解读:数据确有贡献,但可见性条件并非所有指标都改善;训练真实深度与推理估计深度的差异仍需单独压力测试。
开放情况与使用许可
官方项目现已链接Applied-Intuition-Open-Source/BuildRome推理实现与Hugging Face权重。模型库有ss_delta约438MiB、slat_delta约251MiB及SHA256SUMS,属于增量参数,需另取TRELLIS.2等;未包含训练数据,未确认完整训练管线发布。
LICENSE项目原创代码及增量权重为CC BY-NC 4.0,限非商业使用;第三方代码、DINOv3及基础权重各自条款继续适用。论文为CC BY 4.0,引用原图2未修改,保留来源与作者。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
室内外几何测试与分块、条件、户外数据消融均给出可检查证据;推理代码和真实增量权重已可访问,超过只有演示的开放程度。
反方 · 哪些结论还不够
Tanks and Temples仅7场景,ScanNet++32场景;缺少遮挡区独立真值评分、用户研究样本/置信区间。隐藏区生成合理性、ICP对齐后误差和真实可导航性是不同指标。
综合判断
是从对象生成器扩展到大尺度静态场景几何的有意义工作,数据与条件设计均有贡献;现有输出适合研究原型,不应视为完整真实世界重建或物理可交互世界模型。
我会先做的验证
未执行的验证方案:同时报告ICP前后尺度/姿态误差,分可见与遮挡区评价;逐步扰动深度与相机参数并改变分块顺序。检查边界洞、部件碰撞与可导航性,再单独测试纹理/UV/PBR后处理和非商业复现所需峰值显存。