NVIDIA PixelUMM:去掉 VAE 和 ViT,纯像素空间统一理解与生成

视频加载中
视频加载中Robots Digest 介绍 NVIDIA 研究 PixelUMM(arXiv:2609.38597):统一多模态模型里彻底移除 VAE 与 ViT,图像与视频任务都直接在原始像素空间操作,单个无编码器模型同时承担视觉理解与生成。本条为视频摘要,论文详情见 arXiv 链接。
Category: research
Author: @robotsdigest
Date: 2026-10-04T00:00:00
Duration: 30.0s





