OPEN SOURCE DEEP DIVE
Zing-0.5:高效实时交互式世界模型
涌跃智能开源的因果世界模型:文本提示与键盘动作实时改变世界演化,因果KV缓存+四步DMD采样实现单GPU长时程实时rollout,WBench榜单实时世界模型第一。
项目定位:单卡实时可交互的因果世界模型
Zing-0.5 是涌跃智能(Seedleap.ai)开源的 高效因果世界模型,目标是"让世界可玩":模型持续地从当前状态向前滚动生成视觉世界,而文本提示与键盘动作可以在滚动过程中实时改变世界的语义、运动与未来状态。它在 WBench 排行榜上综合排名第 2、实时世界模型中排名第 1,采用 Apache-2.0 协议发布。
与传统"文本→视频"的单向生成不同,交互式世界模型的核心是 因果性:控制信号(键盘、文本)作为原因注入,世界状态作为结果演化。Zing 把一次交互会话表示为带时间戳的提示词与键盘控制(JSONL 格式),模型因果地消费这些控制并记录世界的滚动视频——交互式应用只需把自己的提示词与键盘事件映射到同一控制 schema 即可。
两种控制通道
1. 键盘方向控制
W/A/S/D/I/J/K/L 八个键映射为 [N, 8] 的动作张量(取值 0–1),控制移动与交互。文本初始化的滚动中 N = output.frames - 1;图像初始化的滚动中 N = output.frames。这正是游戏式"可玩世界"的输入形态。
2. 文本提示驱动的状态改变
文本提示既可以初始化世界(如"日出时平静的湖面"),也可以在滚动中途通过 text_prompt_interval 控制切换语义——按 [start, end) 像素帧区间分段,区间必须有序、无缝、不重叠。这让"走到一半天气突变""场景切换"这类动态叙事成为可能。
输入格式上,每一行 JSONL 是一次独立的世界滚动:user/text 消息定义初始世界,target/video 消息定义滚动的输出规格(帧数、宽高)与控制序列。宽高必须被 32 整除,参考帧+生成帧遵循 1 + 4N 的时序结构(与 VAE 对齐)。
工程实现:因果 KV 缓存 + DMD 少步采样
Zing 能在单卡上做到响应式的长时程滚动,靠两个关键技术:
- 因果 KV 缓存:滚动式推理只保留必要的历史注意力。默认滑窗配置
97/9(local-attn-size/sink-size)面向 H100 或 80GB+ 显存;33/5面向小显存或在线实时推理;-1/0则退化为全历史注意力。sink 帧在整个滚动中始终可见;提示词驱动的状态变化后,新提示词的首个块离开常规尾窗时会被钉住。这些选项只影响运行时缓存行为,不改变检查点参数。 - 四步 DMD 采样:大幅压缩扩散采样步数,是"实时"的另一个前提。
运行时依赖固定的模型目录布局:generator/model.pt 必须直接包含生成器 state dict(参数名与形状严格匹配,不接受包装过的检查点、改名、adapter 或部分 state dict),pretrained/ 下放文本编码器、tokenizer 与 VAE。
上手体验
仓库提供四个开箱即用的滚动样例,覆盖四种交互模式:长时程动作 T2V、动作 TI2V(图像初始化)、提示词切换、动作+提示词切换组合。一条命令即可复现:
CUDA_VISIBLE_DEVICES=0 ZING_PYTHON=/path/to/python bash run.sh \
--pretrained-dir /path/to/Zing-0.5/pretrained \
--checkpoint /path/to/Zing-0.5/generator/model.pt \
--messages examples/case3_action_t2v.jsonl \
--output-dir outputs/case3 --seed 0
权重在 HuggingFace(seedleap/zing-0.5)与 ModelScope 同步发布,基于 Wan2.2 TI2V-5B 体系,技术报告即将发布。
点评
Zing-0.5 展示了世界模型从"离线生成"走向"实时可交互"的一条务实路径:因果控制接口 + 单卡可跑的推理管线,使它天然适合作为具身智能的可玩仿真环境或交互式内容应用的生成后端。当前版本是推理发布(训练代码未开源),但完整的控制 schema、滑窗配置与样例使其可以直接集成进下游应用。对于关注世界模型的读者,它的 [start,end) 区间控制协议和 4N+1 时序约束是值得借鉴的工程设计。