aiwillknow.AI 前沿观察每日 08:00 开始整理
3D 生成全文深读与原图讲解

Tetris3D:让生成物体按支撑关系彼此贴合

邻近表面与物理关系进入每个体素;学到的接触先验仍不是硬约束

IN A NUTSHELL

从一张图重建多物体场景,难点常藏在被遮住的接触面。Tetris3D按支撑依赖顺序生成对象,把已生成邻居的表面距离、方向、法向及堆叠/倚靠/容纳关系注入TRELLIS.2体素;不可见区域另从可见token交叉注意力补全。ComOb用约40万目标物体与12种基元构造120万稳定场景。实验支持更少穿透和更稳的布局,但真实深度、估计深度与自由场景推理必须分开看。

01

图解主要方法

物理交互能否直接指导遮挡形状补全,而不仅在生成后检查穿透?

左侧按物理依赖顺序生成对象,右侧稀疏结构和SLAT生成器逐token注入邻居信息,并以可见token补全不可见区域。
图2|物理顺序、体素条件注入与V2I遮挡补全查看大图 ↗
KAIST AI,arXiv:2610.10539v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · CC BY 4.0;署名引用原图,未改动
  1. 1

    先建立带置信度的物理生成顺序

    MoGe3估深度与相机、SAM3分割、Qwen3-VL-30B识别对象和支撑关系。stack/lean/contain有方向,touch无方向;从地面开始用子集动态规划找违反边置信度总和较小的顺序,删除冲突边后逐个生成,并非任意带环图直接拓扑排序。

  2. 2

    把图像与邻近表面放到同一体素格

    目标可见点云界定带余量的立方体;图像特征沿相机射线反投影,观测深度体素提供占据嵌入。每个体素查询邻居无符号距离、最近点方向及法向,近邻截断范围内加上关系嵌入;非水密表面也可计算UDF,但没有因此获得物理保证。

  3. 3

    在两阶段生成器逐token注入条件

    稀疏结构阶段处理密格,SLAT阶段只处理活跃体素;逐层MLP将空间对齐的图像、几何和关系条件加到对应token。新增门初始化为零以保留预训练行为;结构与SLAT阶段使用的条件组并不完全相同。

  4. 4

    用可见区域补全被遮挡区域

    其他物体掩码的并集界定潜在遮挡射线,不先估计目标完整轮廓;不可见token作query,可见token作key/value,仅更新不可见集合。部分遮挡特征与可学习空嵌入混合,画面外token排除,无遮挡时跳过分支。

  5. 5

    把生成对象变成后续邻居并核查整场景

    生成支撑物后,将其实际重建表面用于下一对象。该机制使形状与位姿协同,也把前一步的几何错误传给后续;生成结束仍须单独做仿真稳定性检验。

02

实验与证据

完整正文、附录A–F、评价公式与提示词已读;图2原图已视觉检查,官方项目及开放入口已核对;未训练或复现。

来源证据ComOb约40万唯一目标、120万场景、340万标注样本;每场景一个目标与若干固定基元。 3.4;附录B.3 ↗

我的解读pile是场景构造类型,不是额外关系类别;接触者标stack,其他标none。移除支撑后会倒下才接纳lean样本。

来源证据双H200、batch16,SS200k步约7天、SLAT100k步约9天;AdamW1e−4、衰减0.01。 附录B.1–B.2 ↗

我的解读SS/SLAT约1.83B/1.68B;消融SS仅100k步,因此消融full行不能与主表full数值直接相减。

来源证据课程先完整图,再按完整/基元遮挡/合成遮挡1:2:1训练;深度以0.3概率沿射线加噪并丢弃10%观测体素。 附录B.2 ↗

我的解读这是提高噪声鲁棒性的训练设计,实际深度域差仍明显,不是已解决单目尺度。

来源证据Toys4K真实深度CD-S3.68、F1-S0.8407、PD0.0036;估计深度为7.56、0.6457、0.0047。 表1、4;附录C–D ↗

我的解读所有需深度的方法用同一深度;估计深度有中位数对齐,CD按×100报告。估深后语义Uni3D/ULIP并非最优。

来源证据MessyKitchens CD-S0.11、PD0.0011;Picasso0.27、0.0016,均用估计深度及VLM关系。 表2 ↗

我的解读真实场景结果补充合成验证,但不能把不同归一化、形状分布的CD直接跨数据集比较。

来源证据受控消融:完整PD0.0192,去交互0.4980,去V2I0.0270;CD-S分别3.90、8.56、4.46。 表3 ↗

我的解读交互条件包含几何和关系,未分别完全隔离二者;V2I效果小于移除整个交互条件的退化。

来源证据真实关系换VLM关系,CD-S3.68→3.76、PD0.0036→0.0038。 表5 ↗

我的解读这隔离的是关系来源,不是同时把真实深度也换成估计深度;不能误拼成一个全自动指标。

来源证据整场景先单一刚性ICP;对象指标另做逐对象归一化和ICP。仿真300秒、20,480固定表面点测位移,1ms采样峰值单位质量动能。 附录C.1–C.2 ↗

我的解读对象指标消除了摆放误差,场景指标保留相对布局;PD是仿真前穿透,能量不是成功率,表中位移缩放信息不足时保留原值而不擅自换单位。

来源证据排序算法文字和提示词采用已生成前驱,算法1第3行却写从v直接可达邻居。 算法1;附录F ↗

我的解读对有向边的可达方向描述存在歧义;代码发布后需要核对,否则支撑物先生成的保证不能只凭伪码照搬。

03

开放情况与使用许可

官方项目页面Code标SOON,无可点击代码、模型权重或ComOb下载入口;页面还有视频与方法图coming soon占位。论文和演示入口公开不能算方法、权重或数据已开源。

LICENSE论文采用CC BY 4.0,图2按该许可署名引用且未改动;代码、权重及ComOb尚未见单独许可,不能把论文许可外推到未发布资产。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

Toys4K真实深度下CD-S3.68优于ShapeR5.72,穿透指标0.0036显著小于WorldSculpt0.1177;真实场景也有更好重建和稳定性。

控制训练步数的消融中去交互条件PD0.0192→0.4980;去V2I影响较小但仍退化,支持邻居信息和遮挡补全的不同作用。

反方 · 哪些结论还不够

换估计深度后CD-S3.68→7.56、F1-S0.8407→0.6457;不能将真实深度主表宣传为纯RGB无辅助性能。

训练场景是一个目标加固定基元,不能代表任意多物体联合分布;纹理及物理材质真实性没有对应评价。

与LLM建模的比较只是少量图示,提示词限制CPU程序建模且禁用外部生成/检索,不是公平计算预算下的通用能力排序。

综合判断

证据支持把接触关系从摆放后检查前移到形状生成条件;能提高几何一致性,但离可信仿真资产仍需碰撞、材料和输入不确定性验收。

我会先做的验证

建议实验(尚未执行):固定深度、分割与关系预测,分别扰动每种条件并统计误差传播;在真实多物体场景测接触面距离、跌落率、材质重光照和UV接缝,补充种子、样本量与每对象耗时。

继续探索3D 生成