SILSA:用384个重叠切片潜变量保护孔洞与细支撑
切片拓扑监督与三轴共享网格有效,但不等于完整三维拓扑保证
SILSA把表面点云沿三个坐标轴压成固定长度的重叠切片序列,用共享三维网格交换轴间信息,再生成高分辨率几何。持久同调与相邻切片连通数监督帮助保留孔洞、细杆和分支;输出是几何网格,论文没有验证UV、纹理或PBR资产管线。
图解主要方法
在固定几何token预算下,如何保护切片中的孔洞和细支撑?

- 1
三轴重叠窗口编码表面
图2左侧将归一化形状采样为20万表面点及法向,三个轴各分128个位置,窗口覆盖8个相邻区间。共享MLP和最大池化产生每轴128个潜变量,共384个;空窗口使用学习到的表示。VAE训练采样高斯潜变量,后续流模型使用冻结编码器的均值。
- 2
用切片拓扑约束解码几何
训练时在预测SDF上取三轴切面,转为软占据概率,匹配持久同调中的连通分量和孔洞,并约束相邻切片的Betti计数转变。它与深度、法向、掩码和KL损失共同训练VAE;这是训练监督,不是推理后保证拓扑正确的修复算法。
- 3
VAL作为每次速度预测的轴间工作区
图2中间的16立方网格让各轴切片读取对应平面,再通过门控写回。共享网格在一次速度评估的24个Transformer块间传递信息,但每次新的速度评估重新置零;不能把它解释成跨去噪步的永久场景记忆。
- 4
图像条件流从噪声生成切片潜变量
冻结DINOv2提供图像特征,流Transformer先做轴内注意力,再经VAL交换轴间几何信息并读取图像条件。训练预测噪声到数据路径的速度,推理用50步Euler积分;训练损失与推理采样分开。
- 5
从潜变量散射到稀疏网格与网格表面
图2右侧把三轴潜变量散射、融合到16立方网格,Transformer与两次自剪枝上采样达到256立方;Dual Marching Cubes用SDF、形变和插值权重生成几何网格。纹理、UV、反照率和粗糙度不属于此解码流程。
实验与证据
完整阅读86731字符正文、参考文献及全部公开附录,视检图2并核对作者主页。未运行训练、生成或拓扑计算。
来源证据使用Trellis整理的约50万形状;评估含200个Toys4K对象和50张真实图像。VAE在8张A100训练5轮,流模型训练30万步、batch256。 第4节、实现附录 ↗
我的解读有真实图像不等于都有真值几何;论文未充分逐项区分量化表的样本集合,跨域结果应连同此限制阅读。
来源证据图像生成PSNR32.74,相比SparseFlex30.12增加2.62dB;COV79.08相比73.12增加5.96个百分点,但CLIP87.94低于88.22。 主要生成结果表 ↗
我的解读PSNR是对数指标,不把dB数值的相对百分比当作像素误差下降。重建覆盖与语义相似度并非全面同步改善。
来源证据VAE重建CD0.59、IoU93.01、Betti误差1.582;SparseFlex相应0.61、92.54、1.743。 重建结果表 ↗
我的解读这是有输入几何的重建能力,不能直接当作单图生成的准确率;CD单位缩放不明,不擅自改写为毫米。
来源证据去掉拓扑监督Betti误差4.43;只用持久同调2.91、只用转变项2.87,两者联合1.58。 拓扑消融 ↗
我的解读支持两项监督互补,但不证明所得网格在任意视角或完整三维拓扑上均正确。
来源证据不做轴间通信IoU49.26、Betti17.91;直接跨轴注意力93.18、1.64;VAL93.01、1.58。 轴间通信消融 ↗
我的解读轴间信息交换非常重要,VAL相对直接注意力是细小而混合的取舍,不是所有指标统治。
来源证据N128每轴共384token的Betti1.58;N256共768token为1.53,N512共1536token为1.63。 切片数与窗口消融 ↗
我的解读更多token不是单调改善拓扑;384是效率折中,不能据此断言足以覆盖任意复杂资产。
来源证据A100、batch4的训练比较报告SILSA显存8.7GB、迭代0.21秒;单形状推理0.34秒,对照Dora0.82秒。 效率表及附录 ↗
我的解读所报告推理减时约58.5%对应这一基线。训练显存、训练迭代和单样本推理分别计量;完整预处理及模型参数计数范围仍需实现核实。
开放情况与使用许可
2026-10-11作者主页列出SILSA论文和项目页;项目页访问返回404,未核实实际训练代码、推理实现或权重。作者会议标签与预印本首发日期分别看待,不把论文可读当作实现开源。
LICENSEarXiv非独占托管许可不构成图片通用再分发或模型商用授权。图2仅作必要方法评论,版权归作者;代码与权重许可尚未核实。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
相同设置下去掉拓扑项,报告Betti误差由1.58升至4.43;持久同调和切片间转变项各自有效,支持监督设计而非仅靠视觉示例。
固定384个token在所测复杂几何上兼顾重建和效率,窗口宽度与轴数消融展示重叠和三轴的具体作用。
反方 · 哪些结论还不够
切片统计并非完整三维拓扑证明;计数相同也可能连接关系不同,空腔等三维结构还需直接检查。
共享网格VAL并非所有指标最佳:直接跨轴注意力IoU93.18高于VAL93.01,后者CD与Betti略优,应保留指标分歧。
论文报告的0.34秒推理、96M参数与详细网络配置之间的计数范围需实现澄清;不同基线参数和训练条件也使速度差异不能全归因于token数。
综合判断
有针对性的几何压缩与拓扑监督方案,实验证据支持改善细结构重建。当前适合继续核查实现与复现,不宜据此承诺任意拓扑正确或直接输出带材质的生产资产。
我会先做的验证
建议实验,未执行:固定相同训练数据与解码器,在384/768 token和有无两类拓扑项之间消融;用带真值的孔洞、封闭空腔、细杆和开口曲面集同时测三维Betti数、连通关系、薄壁误差及完整推理延迟,再接同一UV/PBR管线评估下游损失。