TRELLIS:用稀疏结构 latent 统一 3D 资产表示的研究基线
trellis
微软研究院的 TRELLIS 提出一种稀疏结构化 latent(SLAT),让同一个生成结果可以解码成辐射场、3D 高斯或网格三种表示,并把「先生成稀疏体素结构、再在活跃体素上生成特征」拆成两段。它是我们理解当代 3D 生成技术路线的关键论文级资产,不是拿来交付产品的工具。
- 置信度
- 待复现
- 单一来源,本站尚未验证
- 成熟度
- 研究
- 研究 → 演示 → 产品 → 生产
我们的判断<p>TRELLIS 值得单独立一条,不是因为它的产物比商用服务好,而是因为它把 3D 生成里最难的一件事——<strong>表示与生成解耦</strong>——做出了一个干净的样板。一次生成、三种解码(辐射场 / 3DGS / mesh)意味着下游可以按用途选表示,而不是被生成模型的输出格式绑死。</p><p>它的档位是研究:仓库可跑、权重可得,但推理速度、显存占用与稳定性都是研究代码水平;没有服务化封装,也没有针对生产批量的错误处理。我们把它标为 D 级(待复现),因为它的对比数字来自论文自身,我们没有独立跑过同一套基准。</p>
核心思想:两段生成 + 一种可多路解码的 latent
TRELLIS 的流程分两步。第一步在一个规整的稀疏体素网格上生成结构:哪些体素是活跃的。第二步只在活跃体素上生成局部特征,得到 SLAT。这个设计把「物体占多大空间、什么拓扑」与「表面长什么样」分开处理,避免了直接在稠密 3D 张量上做扩散的显存与质量双重代价。
SLAT 的关键性质是它可以被不同的解码器读成不同的 3D 表示:辐射场(NeRF 类)、3D 高斯泼溅、以及网格。对下游来说这是实质性的解耦——同一份生成结果,可以按渲染管线的需求选表示,而不必重新生成。
为什么它对 AIGC 脉络重要
- 它给了「3D 生成」一个可讨论的中间表示。此前每条路线都在自己的输出格式里比较,SLAT 让不同解码路径共享同一份生成语义。
- 稀疏结构先行的思路被广泛沿用。把结构预测与外观生成分开,是当前多数高质量 3D 生成系统的共同骨架。
- 它是研究复现的锚点。想验证某个商用服务的 3D 能力到底强在哪,拿 TRELLIS 做同 prompt 对比,比看发布会截图有用得多。
边界与失败模式
- 速度:研究级实现,单件生成耗时与显存都不适合在线服务。
- 拓扑:网格解码给出的是提取式几何,不是美术可直接使用的四边面拓扑,仍需重拓扑。
- 薄结构与细节:体素分辨率决定细节上限,细杆与镂空结构受限于结构阶段的分辨率。
- 可复现性:仓库依赖与环境较为挑剔,我们尚未在自有环境完成一次完整复现,故置信度记为 D。
它适合谁
研究者与需要自建 3D 能力的团队。如果你的团队要认真做 3D 生成(无论是自建服务还是评估供应商),TRELLIS 是必须亲手跑过一遍的参照实现:读过论文和跑过推理,对「3D 生成现在能做到什么」的判断会完全不同。