30 秒功夫熊猫两段无缝拼接:ComfyUI-H3-Motion-Context 破解 MiniMax H3 15 秒限制——latent 直切 + 音轨续接,不转场不掉画质

视频加载中
视频加载中开发者 @eternityspring 演示(29 秒视频):MiniMax H3 单次最多生成 15 秒,做短剧怎么接才不突兀?他推荐 ComfyUI-H3-Motion-Context 开源方案,演示了一段 30 秒的功夫熊猫——「我不说的话,谁能看出是两段生成的」。常见做法是拿上一段最后一帧做图生视频,但静态图没有运动信息,模型只能猜人往哪走、多快,接缝处经常卡顿或动作突变。Motion Context 的做法:把上一段最后 22 帧(0.92 秒)原样钉在下一段开头,每步采样都不动它们——模型看到的是真实运动而非猜测;画面和声音直接从上一段的 latent 里切出(不做 VAE 解码再编码),逐 bit 保持原数字,消除长链色彩漂移与软化;被钉的音频窗口在接缝处结束并向回延伸,音轨是「继续」而非「重启」,有节拍的配乐一听便知。生成后用 Trim 节点剪掉开头 22 帧,两段首尾直接拼接,无需转场。关键提示词技巧:下一段开头先描述上一段如何结束——同一角色、同样景别、同样动作保持一两秒再写新剧情。逐帧检查接缝前后姿势、位置、表情全部对上。项目核心节点:Motion Context / Trim / Save-Load Latent(跨 run 携带 H3 成对视频+音频 latent)/ Seam Probe(量化接缝是「真延续」还是「逼真模仿」)/ Chain 循环节点(Approve 自动推进索引、segments 设定连跑段数),不修改 ComfyUI 本体,版式校验失败即拒绝运行。
Category: voice-interaction
Author: @eternityspring
Date: 2026-10-02T00:00:00
Duration: 29.291s




