PAPER DEEP DIVE
面向视觉-语言-动作操作的Real2Sim2Real:基于AMD ROCm的流水线
提出基于AMD ROCm的Real2Sim2Real流水线,服务于视觉-语言-动作操作,降低VLA训练与部署的硬件门槛。
物理AI——将大型视觉-语言-动作(VLA)模型与在真实世界中行动的具身智能体集成——已成为AI的下一个主要前沿。本文提出一个端到端、完全由AMD加速的具身操作技术栈,涵盖数据中心训练芯片、Radeon PRO仿真/渲染GPU和Ryzen AI边缘计算,由开源ROCm软件栈统一。通过四个递进演示证明:训练和部署基于VLA的操作策略不需要CUDA锁定生态系统。所有流水线原生运行在ROCm+PyTorch上,可在免费Radeon Cloud Platform上复现。
1. 引言与硬件栈
从生成式AI到智能体AI再到物理AI的演进,对计算提出了更高要求:大规模并行仿真计算、大内存VLA策略训练加速器、以及边缘低延迟推理。AMD硬件组合覆盖整个流水线:
图1展示了AMD的物理AI硬件到社区栈:开放硅片(MI/Radeon/Ryzen)→ 开放ROCm+HIP软件栈(上游到PyTorch和JAX,可从CUDA移植)→ 开源社区(LeRobot、HuggingFace、ModelScope)→ 高频社区活动。
| 硬件层 | 代表产品 | 关键规格 | 定位 |
|---|---|---|---|
| 数据中心 | Gen 1 / Gen 2 | 192GB/288GB HBM, 5.3/8TB/s | 训练VLA策略、大规模仿真 |
| Radeon PRO | W7900 / R9700 | 48GB/32GB GDDR6 | 高保真仿真渲染、桌面AI |
| Ryzen AI | Max+ 395 | 128GB UMA, NPU | 边缘/机器人端推理 |
开放硬件、开放计算栈和快速增长的开发者社区的组合实现了快速迭代——这正是物理AI研究所需的特性,因为每个仿真-训练-部署周期必须重复多次来缩小仿真到真实的差距。
2. 演示1:Sim-to-Real 操作
图2展示了端到端VLA工作流:Genesis物理仿真器生成机器人演示 → 转换为LeRobot数据集格式 → 训练SmolVLA策略 → 仿真验证 → 部署到真实Franka机械臂。全程在AMD ROCm和Radeon GPU上加速。
合成数据生成对训练用的抓取任务分布达到100%成功率。SmolVLA-450M微调在约7-11分钟内完成4000步训练,峰值VRAM使用低于2.4GB——低到策略训练、仿真rollout和验证可共享单张桌面级Radeon PRO GPU。从合成演示生成到仿真验证再到真实Franka部署的完整循环在一小时内完成。
$$T_{\text{train}} \approx 7\text{-}11 \text{ min}, \quad \text{VRAM}_{\text{peak}} < 2.4 \text{GB}, \quad T_{\text{full\_loop}} < 1 \text{hr}$$训练效率比传统CUDA集群方案显著降低——单张桌面GPU即可完成全流程:
$$\text{效率} = \frac{\text{训练步数}}{\text{时间} \times \text{VRAM}} = \frac{4000}{10 \times 2.4} \approx 167 \text{ 步/(min·GB)}$$关键发现:纯仿真演示训练的策略直接迁移到物理臂,无需额外真实世界微调,表明Genesis过程化随机化已足以缩小基本抓取放置任务的仿真到真实差距。
3. 演示2:语义对象选择(One-of-Three)
图3展示了语义对象选择:给定自然语言指令,策略须在视觉相似的干扰物中识别并放置正确目标对象。不同于演示1仅需运动能力,演示2测试VLA策略的语言条件分支——模型须融合指令的语言嵌入与视觉场景来解决参照歧义。
$$\text{选择正确性} = f(\text{语言嵌入} \oplus \text{视觉场景} \oplus \text{运动能力})$$VLA策略的联合条件分布形式化为:
$$\pi(a_t | o_t, l_t) = p_\theta(a_t | \text{ViT}(o_t), \text{LM}(l_t))$$其中 $o_t$ 是视觉观测,$l_t$ 是语言指令,$a_t$ 是动作输出。语义接地要求 $\text{LM}(l_t)$ 正确解析对象引用。
因为底层SmolVLA骨干和ROCm训练流水线与演示1共享,此任务几乎不增加基础设施成本——相同的450M参数检查点和低于2.4GB VRAM训练足迹——同时验证语义接地作为独立于操作精度的策略质量维度。运动能力与语义接地的分离有助于诊断失败模式:抓取好但选错对象表明语言-视觉融合缺陷,反之亦然。
4. 演示3:Real2Sim 合成训练数据流水线
图4展示了Real2Sim流水线:真实图像和相机位姿通过3D高斯泼溅(3DGS)重建为场景,与Genesis物理引擎融合,转换为交互式LeRobot格式训练数据。四个阶段:
| 阶段 | 内容 | 输出 |
|---|---|---|
| 1. 3DGS重建 | 真实环境高保真重建 | 实时可渲染高斯场景 |
| 2. 场景注入 | 高斯点云加载到Genesis | 照片级静态背景+Franka+交互物体 |
| 3. 训练信号生成 | 物理仿真自动生成rollout数据 | 轨迹、多视角RGB、深度、分割、动作 |
| 4. 域随机化 | 物体布局、材质、光照、相机随机 | 大规模高多样性增强数据 |
3DGS渲染的高斯原语公式为:
$$G(x) = e^{-\frac{1}{2}(x-\mu)^T \Sigma^{-1} (x-\mu)} \cdot \alpha \cdot c$$其中 $\mu$ 是位置、$\Sigma$ 是协方差、$\alpha$ 是不透明度、$c$ 是颜色。此混合表示兼得两全:真实捕获场景的视觉真实性和几何保真度(避免扩大仿真到真实视觉差距的"仿真感"),加上仿真才能提供的无限、安全、低成本的rollout生成。3DGS重建、神经渲染、物理仿真和VLA训练都是计算密集但算术异构的(光栅化/渲染 vs 刚体物理 vs Transformer训练),是AMD统一计算能力的良好压力测试。
graph LR
A[真实图像+位姿] --> B[3DGS重建
Radeon GPU]
B --> C[高斯场景表示]
C --> D[Genesis物理引擎
注入Franka+交互物体]
D --> E[VLA训练信号生成
轨迹/RGB/深度/动作]
E --> F[域随机化增强]
F --> G[LeRobot格式数据集]
G --> H[SmolVLA训练]
H --> I[真实Franka部署]
style B fill:#f9f,stroke:#333,stroke-width:2px
style I fill:#bfb,stroke:#333,stroke-width:2px
5. 演示4:大规模强化学习训练
图5展示了使用Unilab框架的四足(Unitree Go2)和双足/人形(Unitree G1)机器人强化学习训练,包括全身跟踪(WBT)、行走、摇杆控制和动态翻转。使用FastSAC、FlashSAC、PPO等算法。
| 设备 | FastSAC G1 WBT | FlashSAC Go2 Joy | FlashSAC G1 Walk | PPO G1 Flip |
|---|---|---|---|---|
| RTX 4090(基线) | 58.8 | 6.0 | 18.3 | 109.0 |
| RTX 4090 + AMD 9950X3D | 18.5 | 1.1 | 3.0 | 16.4 |
| AMD 8060S + AI MAX 395 | 33.6 | 4.2 | 9.4 | 19.6 |
| Apple M5 Max | 75.0 | 4.5 | 18.8 | 16.8 |
表1报告了各设备/任务对的每秒步数吞吐量。三个关键观察:
RL训练吞吐量定义为:
$$\text{吞吐量} = \frac{\text{环境步数/秒}}{\text{批量大小} \times \text{并行环境数}}$$观察1:吞吐量高度任务相关而非纯硬件相关——RTX 4090在PPO/G1 Flip上领先(109.0步/秒)但在FlashSAC/Go2 Joy上最慢(6.0步/秒),表明算法特定的CPU/GPU同步和批量敏感性主导某些RL算法的吞吐量。
观察2:RTX 4090+AMD 9950X3D配置在所有四个任务上都不如纯RTX 4090基线,与Unilab的RL训练至少部分CPU/主机绑定一致。
观察3:集成的AMD Ryzen AI MAX 395(8060S iGPU + UMA)在某些任务(FastSAC/G1 WBT, FlashSAC/Go2 Joy)上提供优于离散GPU+AMD CPU配置的吞吐量,尽管是单芯片移动/边缘级部件——UMA设计消除主机-设备拷贝开销对紧密仿真-训练循环的RL负载是实质优势。
6. 开发者资源
所有四个流水线可在Radeon Cloud Platform上免费复现,托管可运行GPU笔记本涵盖本文全部演示。Real2Sim流水线笔记本在RDNA4或RDNA3.5节点上约30分钟内完成端到端合成数据生成、SmolVLA微调和闭环评估,完全在设备上运行,无需外部数据集下载。AMD AI开发者计划(中国)提供200小时免费云计算。
7. 局限性
局限性1:任务复杂度有限。演示1的sim-to-real验证仅针对基本抓取放置任务,更复杂的多步骤操作、柔性物体或精细操作未验证,仿真到真实差距可能更大。
局限性2:RL基准非全面。RL吞吐量比较仅覆盖4个任务对和4种设备配置,未涵盖所有主流RL算法或更长的训练时间尺度,跨硬件RL基准须按算法解读而非单一聚合数字。
局限性3:生态依赖。依赖Genesis、LeRobot、SmolVLA等外部开源项目,其持续维护和兼容性影响流水线长期可用性。
8. 总结
本文呈现四个递进技术演示,共同构成完全基于AMD开放硬件和软件栈的端到端具身操作和运动研究闭环路径。演示1展示纯仿真训练策略直接迁移到物理Franka臂;演示2扩展到语言接地的语义对象选择;演示3通过3DGS重建真实环境并重新注入物理仿真来大规模生成照片级交互训练数据;演示4扩展到四足和人形运动的大规模强化学习。四个演示是一个连续流水线的四个阶段:仿真、操作、重建和泛化。每个阶段——3D重建、神经渲染、物理仿真、VLA策略训练、强化学习和真实机器人部署——都在单一开放一致的ROCm+PyTorch软件栈上跨AMD硬件层运行,无需在任何点切换到CUDA锁定工具链。



