aiwillknow.AI 前沿观察每日 08:00 开始整理
3D 生成全文深读与原图讲解

OctLLM:用稀疏八叉树让语言模型读写几何

冻结语言通路、增加三维分支;纹理仍依赖TRELLIS,几何理解不包含材质理解

IN A NUTSHELL

OctLLM把八叉树占据压成字节token,用坐标和深度标记位置,在冻结Qwen2.5-VL旁添加专用三维分支。它能生成稀疏几何并描述输入形状,再由补全网络和TRELLIS输出带纹理网格。Toys4K图生三维FID较ShapeLLM-Omni降低17.4%,但专用TRELLIS仍明显领先,IFEval也未完全保持基础模型水平。

01

图解主要方法

显式空间token与参数隔离能否让同一语言模型兼顾几何生成、理解和原有对话?

上路生成S-Octree、补全占据并经流模型输出网格,下路读取八叉树或图像回答文本问题。
图2|稀疏几何语言与外部网格解码器的分工查看大图 ↗
北京大学、独立研究者,arXiv:2610.02388v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · 版权归作者;arXiv非独占托管许可不等于图片再分发许可
  1. 1

    把几何变成带空间位置的字节序列

    网格归一化后构建深度6八叉树,按Z序遍历,把连续8个占据位打包成0–255的token。以0.5概率删除倒数第二层节点及后代;每个资产在数据准备时只抽样一次,训练并非每轮随机换目标。

  2. 2

    让查询说明下一块占据在哪里

    每个预测位置先插入MASK,携带节点三维中心的RoPE与深度编码,只让模型预测该位置的占据字节。历史MASK不作为注意力键;推理采样后从KV缓存删除查询,由部分八叉树计算下个位置,到目标层完成时结构性终止。

  3. 3

    用隔离的三维分支连接冻结语言通路

    28个骨干层中12层为网格和MASK选择新的全秩投影及前馈分支,文本和图像保持冻结通路,两者共享因果注意力。独立网格嵌入与输出头不把占据预测混入普通词汇损失,新增约2.80B可训练参数。

  4. 4

    分别训练几何生成和描述

    生成样本插入位置查询,监督占据字节;理解样本直接读取稀疏八叉树,不插查询,只监督语言回答。195K资产组成585K指令,语言与视觉骨干冻结;单独用175K占据对训练补全网络。

  5. 5

    先补全占据,再交给外部模型生成网格

    图2中的3D U-Net以二元交叉熵补全稀疏占据,0.5阈值转成坐标;TRELLIS结合原图或文本采样结构潜变量并解码带纹理网格。原生S-Octree没有颜色材质通道,不应把最后的纹理输出当作LLM已学会原生PBR。

02

实验与证据

完整正文、附录A–E、约束解码算法、评测提示与全部消融已读;图2视觉核验;项目页、代码目录、LICENSE、模型卡与权重文件清单已核对。未运行模型。

来源证据主训练69K步、16张H20、批量64;补全155K步、8张RTX5090、批量64。 4.1;表S1 ↗

我的解读可训练参数少于全量微调仍需要大规模计算,Mac上不适合直接复现训练。

来源证据1000个Toys4K资产,图生三维FID:ShapeLLM-Omni38.21、OctLLM31.58、TRELLIS18.15。 表1 ↗

我的解读17.4%改善限定统一多模态LLM对照,专用模型仍有明显优势;不是整体三维生成最佳。

来源证据文生三维Inception FID52.36到45.61,但DINO FID169.28到175.58、CLIP22.46到22.30。 表1 ↗

我的解读不同指标有分歧,不能称相对ShapeLLM-Omni全面改善。

来源证据理解200对象,渲染裁判18.14到46.88;PointLLM-13B在附录同指标48.06。 表2;表S2 ↗

我的解读主表仅列7B时看似全体最优,附录13B超过本文;裁判为Qwen3.8-Max,GPT-img是指标名称。

来源证据MMLU64.65与HellaSwag67.44保持;GSM8K83.54到83.01,IFEval75.41到69.87。 表2及语言保持分析 ↗

我的解读文本通路参数相同不保证新增输出头绝不干扰自由生成;需区分词表屏蔽设置。

来源证据飞机消融去MASK FID61.08、去三维位置32.84、去mask suppression28.03,完整26.31。 表S6 ↗

我的解读位置查询比其他两项移除的降幅更大,但该结论仅来自单类别消融。

来源证据路由LoRA秩256保留语言,图像FID32.44对全秩26.31;文本KID0.98对1.07。 表S8 ↗

我的解读全秩不是所有指标都更好,不能说LoRA必然导致语言遗忘。

来源证据四张A100上稀疏化峰值58GB到44GB,每epoch2.17到1.37小时;完整八叉树FID27.54对稀疏26.31。 图S7及D ↗

我的解读证明该子集的资源收益和接近质量,不代表完整系统显存44GB或推理快1.6倍。

来源证据200提示单张RTX5090:本文自回归37.59秒,ShapeLLM-Omni19.92、OctGPT52.53。 表S3 ↗

我的解读计时排除补全、网格重建和渲染,不能写成37.59秒端到端交付;也不是最快对照。

来源证据图生CLIP为每资产24视角最高相似度;FID取4视角,无纹理基线用Hunyuan3D-2.1补材质。 B3–B4 ↗

我的解读评测包含视角选择和外部材质步骤,渲染指标不等于各面几何和原生纹理准确性。

03

开放情况与使用许可

官方仓库包含训练、推理、配置、评测和数据工具;Hugging Face列出5个模型权重分片与独立占据补全权重,模型卡说明须使用自定义三维加载实现。未下载大模型或独立复现。

LICENSE原创OctLLM代码MIT,模型卡标MIT;仓库明确保留Llama 2社区许可、Gaussian Splatting研究评估条款及其他第三方许可,不能把整个依赖链概括为MIT。论文图2属arXiv非独占托管许可。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

在相同飞机子集协议下,仅替换表示,FID从33.10到26.31,理解语义分数也上升,支持显式空间结构的价值。

冻结语言通路使MMLU、HellaSwag与基础模型相同;单独的token路由LoRA也能保留语言,说明关键是路由隔离。

反方 · 哪些结论还不够

增加约28亿可训练参数且依赖外部补全和TRELLIS,训练参数较少不能等同总模型轻量或全管线低成本。

全模型IFEval75.41降69.87,原因是新增网格词表误触发;屏蔽词表是额外推理设置,不能把表中结果写成零退化。

渲染FID和CLIP并不直接验证三维拓扑、可编辑部件、UV连续性或物理材质。

综合判断

这是有完整实现可进一步检验的显式几何语言方案。当前证据支持统一几何生成与描述,以及隔离参数减轻语言遗忘;尚不是原生材质、编辑与生产资产的统一模型。

我会先做的验证

建议实验(尚未执行):固定下游解码器与总参数预算,在更多类别比较显式八叉树、潜变量和路由LoRA;同时报告原始占据误差、网格孔洞、薄结构保留、UV接缝、完整推理时间,并在屏蔽与不屏蔽新增词表时分别测通用对话。

继续探索3D 生成