FreeInpaint:无相机标定的三维场景移除与补全
可学习掩码保护跨视图对应,扩散支持图修补盲区;输出高斯场而非可重光照网格资产
FreeInpaint把DA3改成输入一个干净参考图和多个无位姿掩码视图、直接输出相机与3D高斯的补全网络。逐层可学习的注意力偏置防止被遮挡区域污染对应,低透明度区域再用扩散生成的支持token补强。公开代码可导出高斯PLY,但补出的内容只是合理猜测,尚不提供UV、PBR材质或真实隐藏几何恢复。
图解主要方法
没有相机标定时,怎样在移除物体后避免破坏跨视图对应?

- 1
以无位姿视图共同预测相机与高斯
DA3 Giant骨干用DINOv2特征、视图内和跨视图注意力编码参考图与掩码图,DPT等头预测深度、相机及高斯参数;不要求输入预先标定的相机。
- 2
在跨视图键侧逐层学习遮挡抑制
把掩码概率转为logit,独立小卷积网络逐层更新,再以负sigmoid偏置加到注意力键侧。可靠区域提供空间锚点,掩码token仍能吸收其他视图上下文;并非简单删除所有被掩码token。
- 3
用干净教师和新视角监督微调
训练混合随机笔刷/方框和几何投影掩码。未遮挡DA3教师给深度伪真值,RGB与LPIPS只在保留的新视角上监督,减少直接复制输入;教师误差仍可能被继承。
- 4
找透明度不足的盲区并生成支持图
选掩码内平均不透明度最低的视角,SDEdit利用渲染图结构、IP-Adapter利用原参考外观,补出支持图。权重按掩码与低不透明度分配,不替换最初参考锚点。
- 5
注入支持token后有限次重建
默认最多三次总前向,进一步更新高斯场。支持图是生成假设,错误内容可能传播;它改善外观连贯性不等于获得了真实隐藏观测。
实验与证据
全文62955字符及附录A1–A8读完,图2视觉核验;实际打开项目、代码树、模型卡与权重文件列表。
来源证据DL3DV-10K训练,15帧、280×504,8张A6000,每GPU batch2、累积2。 3.4;A1 ↗
我的解读在线前向成本省去了逐场景长优化,但离线训练、基础模型和参考生成成本仍存在。
来源证据SPIn四输入视图PSNR17.79、LPIPS0.2819;USID八视图18.58、0.2526。 表1;A2 ↗
我的解读评测裁剪为物体掩码包围框,框内含非掩码背景;不能写成精确只评删除像素。
来源证据USID表2 FID本方法199.61,LAMA+DA3为186.83。 表2 ↗
我的解读较低更好,因此不能宣传所有指标均最佳;PSNR/LPIPS、分布指标衡量不同属性。
来源证据逐项微调16.96/0.2854,加掩码18.26/0.2628,加支持18.58/0.2526。 表4 ↗
我的解读数值为USID PSNR/LPIPS,支持细化收益小于从冻结基础到任务微调的整体收益。
来源证据同条件MAT为18.13/0.2620,MLLAM18.06/0.2651,本方法18.58/0.2526。 A5.1 ↗
我的解读比冻结串接基线更能隔离注意力设计的贡献,仍未给多训练种子置信区间。
来源证据六个困难场景:一次前向18.02/0.2738、0.41秒;三次18.46/0.2623、1.83秒;四次18.48/0.2620、2.54秒。 A4 ↗
我的解读迭代呈收益递减;不同基准、场景和预处理范围不能直接拼成单一延迟承诺。
来源证据三场景LCM四步扩散0.3秒加两次前向0.8秒;普通50步1.6+0.8秒。 A4 ↗
我的解读这里约1.1与2.4秒,不能只取0.3秒作系统总时延。
来源证据十个参考扩散种子PSNR17.68±0.16;四参考视角17.61±0.24。 A3 ↗
我的解读这是测试集指标随参考选择的波动,不是训练随机种子标准差,说明对参考仍有依赖。
来源证据LLFF没有干净隐藏背景真值;GS25与CO3D官方评测说明保存的GT仍包含被删除物体。 A2、A7;仓库Evaluation ↗
我的解读分布相似度和主观一致性不能验证恢复真实遮挡几何,更不能证明材质可重光照。
来源证据替换CLIP方向分数0.1942,对照DiGA0.1928。 表3 ↗
我的解读差值小且无置信区间;语义编辑分数没有检验接缝、PBR通道或部件可编辑性。
开放情况与使用许可
GitHub含network、guidance、test.py与评测实现;Hugging Face有约5.43GB freeinpaint.pth和示例数据,模型卡说明是合理补全而非真实隐藏场景。仓库未发现LICENSE,模型卡没有license字段,故不标完整开源。
LICENSE论文为arXiv非独占托管许可,图2版权归作者,仅用于方法评论;代码与本模型权重未明确许可,PowerPaint等第三方组件仍适用各自条款。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
同训练条件的MAT、MLLAM对照支持掩码设计的额外价值;逐步消融分开展示微调、掩码和支持细化贡献。
参考图换种子和换视角均测试,能看到外观先验的敏感度而非只选一张最好参考图。
官方公开实际推理与评测文件及权重,超过仅有论文或展示页的开放程度。
反方 · 哪些结论还不够
若干串接基线使用冻结DA3而本方法经过DL3DV微调,差异不全是架构贡献。
LLFF及野外没有干净隐藏背景真值,FID/KID不能证明几何正确;USID FID也并非优于所有基线。
附录阈值0.99平均4.33次与默认最多三次前向的说法需区分设置;代码默认SPIn一次、其他三次,并非所有场景统一自适应预算。
综合判断
是一项有针对性的无位姿高斯场修补工作,速度与视图一致性值得关注;真实隐藏内容、编辑材质和可重光照资产质量仍未得到证明,许可也需要进一步明确。
我会先做的验证
建议实验(尚未执行):固定训练数据与骨干比较各注意力模块;同时记录掩码、参考扩散、全部前向的总耗时,加入真实移除前后扫描几何、UV/PBR导出和新光照检验,并统计不同遮挡与参考错误条件的失败率。