Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

Paper3D Gaussian Splatting3DGS

Fashion-3DLR:基于成对时尚元素的可控3D服装生成

提出Fashion-3DLR,基于成对时尚元素实现可控3D服装生成,服务于3D内容生成与数字人/机器人外观建模。

Shenghao Yang, Hongtao Zhang, Yuhan Yi, Zhihao Tang, Zihao Cui, Lian Wen, Han Yan, Yuan Gao, Mingbo Zhao2026年7月25日3 分钟阅读
EN

Fashion-3DLR:基于成对时尚元素的可控3D服装生成

论文:Fashion-3DLR: A Controllable 3D Garment Generation Using Pairwise Fashion Elements for Intelligent Design

作者:Shenghao Yang, Hongtao Zhang, Yuhan Yi, Zhihao Tang, Zihao Cui, Lian Wen, Han Yan, Yuan Gao, Mingbo Zhao

机构:东华大学、上海人工智能实验室

链接arXiv:2607.23189 | 代码GitHub


一句话总结

Fashion-3DLR 提出了一个可控的 3D 服装生成框架,通过 GFF-DiT 模块将草图和纹理等异构设计元素融合到统一潜在空间,再由整流流变换器生成几何潜在表示,可解码为 3D 高斯和网格,并支持 3DGS 驱动的布料物理仿真和虚拟试穿。


研究背景与动机

2D 生成模型已广泛应用于数字时尚产业,但 3D 服装生成仍处于早期阶段。核心挑战在于:时尚设计中不同设计元素(如草图、纹理、油画笔触)的语义信息在 3D 表示中存在复杂的耦合关系,难以直接映射到高质量 3D 服装资产。现有 3D 生成方法(如 Hunyuan3D、Tripo、Trellis)在处理多模态时尚输入时存在几何不稳定、纹理退化和拓扑错误等问题,常常生成坍塌的"煎饼"结构或与服装意图矛盾的水密网格。

此外,3D 服装生成需要满足三个关键需求:跨模态语义消歧(不同设计元素间的语义对齐)、高质量生成(结构合理且非水密的服装拓扑)、以及直观可编辑性(设计师可控的属性修改)。本文正是围绕这三个需求构建了端到端框架。

框架总览

图1:给定成对设计元素(如草图和纹理),Fashion-3DLR 生成高质量 3D 服装资产。


方法详解

1. 整体流程

Fashion-3DLR 的管线从成对设计元素(草图 $b$ 和纹理 $o$)出发,首先通过 GFF-DiT 模块提取并融合异构设计元素的语义信息到统一潜在空间,然后通过整流流变换器(RFT)生成包含 3D 结构和外观细节的服装潜在表示 $\mathcal{S}$,最后通过不同的上采样解码器转换为 3DGS 表示或网格,支持灵活的下游应用。

整体管线

图2:Fashion-3DLR 整体管线,处理成对设计元素并生成 3DGS 和网格。

2. 服装特征融合扩散变换器(GFF-DiT)

GFF 模块是 Fashion-3DLR 的核心特征提取与融合组件。草图 $b$ 和纹理 $o$ 分别通过卷积层下采样得到中间特征 $\hat{b}_i$ 和 $\hat{o}_i$。纹理特征 $\hat{o}_i$ 经过残差块和两个不同卷积层,生成两个可学习因子 $\Lambda_i$ 和 $\Theta_i$:

$$ \mathcal{G}(o) \rightarrow \{\Lambda_i, \Theta_i\} $$

同时,草图特征 $\hat{b}_i$ 计算均值 $\hat{b}_i^m = \text{mean}(\hat{b}_i)$ 和方差 $\hat{b}_i^s = \text{var}(\hat{b}_i)$。为实现草图与纹理之间的交互通信,用纹理导出的可学习因子调制草图特征:

$$ \mathcal{F}_{\{\Lambda_i, \Theta_i\}}(b) = (\Theta_i \mid \mathcal{G}(o)) \otimes \left[\frac{\hat{b}_i - \hat{b}_i^m}{\hat{b}_i^s}\right] \oplus (\Lambda_i \mid \mathcal{G}(o)) $$

其中 $\oplus$ 表示乘法,$\otimes$ 表示逐元素加法。随后进行反向调制,将融合后的草图特征再次通过 $\mathcal{G}$ 生成新的因子 $\Lambda_{i+1}$ 和 $\Theta_{i+1}$,调制纹理特征:

$$ \mathcal{F}_{\{\Lambda_{i+1}, \Theta_{i+1}\}}(o) = \Theta_{i+1} \otimes \left[\frac{\hat{o}_i - \hat{o}_i^m}{\hat{o}_i^s}\right] \oplus \Lambda_{i+1} $$

最终通过零卷积层 $\mathcal{Z}$ 得到融合特征 $x_i$:

$$ x_i = \mathcal{Z} \cdot \mathcal{F}_{\{\Lambda_{i+1}, \Theta_{i+1}\}}(o) $$

这种对称处理消除了数据内的差异,最终融合特征集 $\mathcal{X}_i = \{x_i, x_{i+1}, x_{i+2}, x_{i+3}\}$ 经过线性层生成潜在噪声,与时间步嵌入一起输入 DiT 模块,生成融合条件特征 $\mathcal{M}$ 作为 3D 服装生成的控制条件。

GFF模块

图3:GFF 模块的结构细节,展示草图和纹理的双向调制过程。

3. 服装潜在生成(整流流变换器)

整流流变换器(RFT)用于生成服装潜在 $\mathcal{S}$。变换器块由自注意力层、交叉注意力层和前馈网络顺序组成。密集噪声网格被序列化为噪声潜在,结合位置编码输入变换器进行去噪。3D 服装资产被划分为体素网格,每个网格包含激活体素标记和视觉特征。

具体而言,通过在球面上随机采样相机视角渲染图像,使用预训练编码器(DINOv2)提取特征图,将每个体素投影到多视角特征图上检索对应位置特征并取平均,生成最终视觉特征。条件 $\mathcal{M}$ 通过交叉注意力层作为键和值注入,噪声潜在通过自注意力层作为查询注入。经过 $N$ 个变换器块后,得到既反映输入纹理 $o$ 和草图 $b$、又具有正确 3D 特征的服装潜在 $\mathcal{S}$。

4. 两阶段训练优化

GFF-DiT 模块的训练损失为:

$$ \mathcal{L}^{GFF}(\theta) = \mathbb{E}_{z_0, t, o, b, \epsilon} \left[\left\|\epsilon - \epsilon_\theta(z_t, t, \mathrm{f}(o,b))\right\|_2^2\right] $$

其中 $\mathrm{f}$ 表示 GFF 过程,$\epsilon_\theta$ 是 DiT 网络。训练完成后冻结 GFF-DiT 权重。整流流变换器采用线性插值前向过程,给定数据样本 $n_0$ 和噪声 $\varepsilon$:

$$ n(t) = (1-t)\,n_0 + t\,\varepsilon, \qquad v(n,t) = \nabla_t n $$

通过最小化条件流匹配(CFM)目标训练速度场 $v_\theta$:

$$ \mathcal{L}^{CFM}(\theta) = \mathbb{E}_{t, n_0, \varepsilon} \left[\left\|v_\theta(n,t) - (\varepsilon - n_0)\right\|_2^2\right] $$

5. 3DGS 物理仿真服装

静态服装实例被重建为非结构化 3D 高斯核 $\{x_p, \sigma_p, A_p, C_p\}_{p \in \mathcal{P}}$,其中 $x_p$、$\sigma_p$、$A_p$、$C_p$ 分别表示高斯中心、不透明度、协方差矩阵和球谐系数。针对棉、丝绸、羊毛和尼龙四种面料,为每种面料实例化对应材料模型,并在商业布料仿真器中生成参考动态行为。每个高斯被赋予基于连续介质力学的运动学,使用 MPM 求解器。物理参数 $\vartheta = \{k_b, k_s, k_{sh}, \rho\}$(弯曲刚度、拉伸刚度、剪切刚度和面密度)控制高斯场演化:

$$ A_p(t) = F_p(t)\, A_p\, F_p(t)^\top, \qquad x_p(t) = \phi(X_p, t) $$

其中 $F_p(t)$ 是变形梯度,$\phi(\cdot)$ 是变形映射。通过最小化仿真高斯动力学与参考布料视频的差异来优化参数:

$$ \mathcal{L}^{\text{gauss}}(\vartheta) = \arg\min_{\vartheta} \left\|F^{\text{video}} - F^{\text{gauss}}(\vartheta)\right\|^2 $$
flowchart TD
    A["输入: 草图 b + 纹理 o"] --> B["GFF-DiT 特征融合"]
    B --> B1["纹理特征 → Λ_i, Θ_i"]
    B1 --> B2["双向调制: 草图↔纹理"]
    B2 --> B3["零卷积 → 融合特征 X"]
    B3 --> C["DiT 生成条件 M"]
    C --> D["整流流变换器 RFT"]
    D --> D1["体素网格 + 视觉特征"]
    D1 --> D2["自注意力: 噪声潜在为Q"]
    D2 --> D3["交叉注意力: 条件M为K,V"]
    D3 --> E["服装潜在 S"]
    E --> F["3DGS 解码"]
    E --> G["网格解码"]
    F --> H["3DGS 物理仿真"]
    G --> I["虚拟试穿"]
    style B fill:#e1f5fe
    style D fill:#fff3e0
    style E fill:#e8f5e9

实验结果

实验设置

训练数据:GFF-DiT 在约 15.2K 样本上训练,耗时约 30 小时,单次推理约 40 秒。RFT 在 SewFactory 数据集(19.1K 高质量 3D 服装)和 DeepFashion3D 上微调。评估指标包括 FID(生成质量)、CLIP↓(语义一致性,越低越好)、LPIPS↓(轮廓相似性,越低越好)、CLIP-I score↑(语义对应性,越高越好)。

定量对比

表1:3D生成(草图+纹理融合)的定量对比
方法FID CLIP ↓LPIPS ↓CLIP-I score ↑
Hunyuan3D-3.0 [2025]0.46480.70010.7946
Tripo [2024]0.45240.68030.7961
Trellis [CVPR2025]0.71420.78420.6615
Sparc3D [NeurIPS2025]0.83080.78250.6638
ReconViaGen [ICLR2026]0.86370.81130.6395
Fashion-3DLR (ours)0.27430.59460.9271

Fashion-3DLR 在所有指标上全面领先,FID 从最佳基线 0.4524 降至 0.2743(降低 39.4%),CLIP-I score 从 0.7961 提升至 0.9271(提升 16.5%)。

虚拟试穿对比

表2:基于缝纫图案的服装生成定量对比
方法FID CLIP ↓LPIPS ↓CLIP-I score ↑
DressCode [SIGGRAPH2024]0.45240.68030.8311
ChatGarment [CVPR2025]0.46480.70010.7946
Fashion-3DLR (ours)0.27430.59460.9271

消融实验

表3:GFF-DiT 模块的消融实验
配置FID CLIP ↓LPIPS ↓CLIP-I score ↑
无 GFF-DiT0.68740.74290.6983
完整模型0.27430.59460.9271

移除 GFF-DiT 后 FID 从 0.2743 升至 0.6874(恶化 150.6%),CLIP-I score 从 0.9271 降至 0.6983,证明 GFF-DiT 在多模态特征融合中的关键作用。

用户研究

24 名参与者评估了 200 组生成结果,Fashion-3DLR 在用户偏好度上达到 83.82%,显著优于 ChatGarment(73.25%)和 DressCode(64.41%)。

定性结果

图4:使用草图+纹理和草图+油画笔触的定性生成结果。

SOTA对比

图5:与基线方法的定性对比,Fashion-3DLR 保持结构保真度和纹理一致性。


局限性

  1. 跨表示交互限制:3DGS 服装无法与基于网格的人体模型直接交互,跨表示物理仿真的兼容性尚未解决。
  2. 缝纫图案结构缺失:网格服装缺乏缝纫图案级别的结构信息,限制了工业级制版流程的衔接。
  3. 训练数据规模:GFF-DiT 仅在约 15.2K 样本上训练,对极端风格或罕见设计元素(如不对称剪裁、复杂褶皱)的泛化能力可能受限。

总结与展望

Fashion-3DLR 通过 GFF-DiT 实现异构时尚元素的统一潜在空间融合,结合整流流变换器和双解码器(3DGS/网格),生成可控的 3D 服装资产。在 3DGS 物理仿真方面,通过 MPM 求解器实现面料相关的动态行为,支持棉、丝绸、羊毛和尼龙四种材质的布料仿真。实验表明其在所有定量指标和用户偏好上全面超越现有 SOTA 方法。

金句:「通过对称双向调制将草图与纹理的语义信息在潜在空间中深度融合——而非简单拼接——Fashion-3DLR 实现了从 2D 设计元素到 3D 服装资产的语义一致性转换,为智能时尚设计提供了网格与高斯双路径的统一生成框架。」

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
FA-RDP:频率自适应反应扩散策略

FA-RDP:频率自适应反应扩散策略

In contact-rich manipulation, action multimodality and reactivity dominate different stages of a single episode. Before contact, multiple trajectories might be equally valid, making it important to preserve diverse action modes. After contact, geometric constraints and force limits narrow the solution space, while successful execution demands rapid responses to force feedback. However, standard diffusion policies use a fixed inference frequency and sampling steps throughout the episode, forcing a fundamental compromise: low-frequency, multi-step sampling better preserves pre-contact multimodality but responds slowly to force feedback, whereas high-frequency sampling improves reactivity but tends to collapse distinct pre-contact modes. To resolve this tradeoff, we present FA-RDP, a frequency-adaptive reactive diffusion policy. A shared multi-frequency visual-force Transformer predicts action chunks at both low and high frequencies, while a learned multimodality indicator dynamically selects multi-step low-frequency sampling before contact and one-step high-frequency sampling as action ambiguity decreases. We further introduce Manifold Consistency Distillation (MCD), which reparameterizes the diffusion network to predict actions on the robot action manifold while retaining DDPM-based residual supervision. Experiments on three contact-rich manipulation tasks show that FA-RDP achieves the highest success rate while preserving diverse pre-contact trajectory modes. Code and videos are available at https://fa-rdp.github.io.

Paper2026年7月30日
PhiZero:基于物理语言的世界模型

PhiZero:基于物理语言的世界模型

We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future videos directly in pixel space, leaving the underlying world dynamics implicit within high-dimensional visual predictors. Motivated by humans' ability to abstract predictive structure from visual experience and organize it in natural language for explicit reasoning, we learn physical language from in-the-wild videos through self-supervision and use it to explicitly reason about how the physical world evolves. Accordingly, PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos. Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution. We further show its potential for realistic and interactive world modeling, fine-grained action-conditioned simulation, and zero-shot motion transfer.

Paper2026年7月30日
Booster Lab:可部署人形运动学习的数据中心化管线

Booster Lab:可部署人形运动学习的数据中心化管线

将异构运动源(人体演示+仿真采集)转化为可部署的 Booster T1 运动策略,四阶段管线将运动数据视为学习回路可控部分:数据策展→real-to-sim适配→AMP强化学习→跨仿真器验证+部署。

步态优化人形机器人AMP2026年6月26日