可灵:把「图生视频」做成影视分镜工具的那条国产主线
kling
快手可灵是国内最早把视频生成推到「能接商业单」水位的模型之一,强项不在纯文生视频,而在图生视频与运镜控制:先由图像环节锁定构图与角色,再让视频模型在这张确定的关键帧上补间,配合首尾帧约束与镜头运动指令,做出可预测的短片段。它代表的是当前视频生成真正能进生产管线的姿势——不是一句话出片,而是「分镜 + 关键帧 + 补间」的三段式工作流。我们对它的能力宣称只给 C 级(厂商口径),因为公开对比多为精选样本。
- 置信度
- 厂商宣称
- 只有官方模型卡/发布会,无独立复测
- 关键指标
- 单次生成时长档位
- 厂商宣称 · 2025-06
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断<p>把可灵放进这个阶梯,理由不是「它得分最高」,而是它<strong>把视频生成的可用姿势定了下来</strong>:纯文生视频在商业交付里几乎不可用(构图与角色都无法预先确定),而图生视频 + 首尾帧约束让创作者先拿到一张自己认可的关键帧,再把它变成运动。这个分工让「不可控」变成了「上游可控、下游有限可控」,是目前唯一能稳定交付的工作流形态。</p><p>置信度如实标 <strong>C(厂商宣称)</strong>。可核验的只有两件事:产品确实在公开提供服务、并且持续迭代到多档时长与运镜控制;至于「物理真实感业界领先」「支持 X 秒长视频不崩」这类表述,我们<strong>没有做过同提示词的横向对照</strong>,公开评测样本普遍是精选,所以不作为结论使用。</p><p>值得盯的一点:可灵的运镜控制(推拉摇移、环绕、跟随)是视频域里少见的<strong>把摄像机当成一等参数</strong>的产品化尝试。如果这条线走通,视频生成就从「抽卡」变成「调度」,而调度能力正是 agent 化创作工具的前提。</p>
它解决的问题:视频生成的「不可控」
纯文生视频在生产环境里有一个致命问题:你无法预先知道会拿到什么。构图、机位、角色长相、光照全部由模型决定,提示词只能施加很弱的影响,于是一次交付变成几十次抽卡。可灵的产品化路径是把这个不确定性推到上游——先用图像模型(或设计师自己画的稿)确定关键帧,再让视频模型在这张确定的画面上生成运动。这样至少构图、主体、色调是可控的,不可控的只剩「怎么动」。
这一步看起来只是工作流调整,实际改变了整个环节的成本结构:抽卡次数从几十次降到几次,因为失败的原因变少了(不再同时赌构图和运动)。这也是为什么这个域里真正的生产力工具都在往「图生视频」收敛。
三个可用度分层
| 用法 | 当前可用度 | 说明 |
|---|---|---|
| 产品/物体的短展示(旋转、推进、材质反光) | 高 | 主体简单、运动幅度小,最容易稳定交付 |
| 氛围镜头(风景、街景、天气、光影变化) | 高 | 没有人手与人脸,失败模式少 |
| 单人中景的简单动作(走动、转身、抬头) | 中高 | 需要首尾帧约束,时长越长越容易崩 |
| 多人交互与手部特写 | 低 | 手指增减、穿模是高频失败点 |
| 带对白的口型同步叙事 | 低 | 需要专门的口型管线,不要指望一次生成 |
运镜控制为什么重要
可灵把推、拉、摇、移、环绕、跟随这类摄像机运动做成了可选参数。这件事的意义超出「视频更好看」:它意味着创作者可以用影视语言而不是自然语言形容词来描述需求。「缓慢推进到面部特写」是一个有明确定义的镜头指令,而「电影感的震撼画面」不是。参数化的镜头语言让生成结果可复现,也让多镜头之间的剪辑节奏可以被规划。
往前一步看,这正是 agent 接管创作流程的接口:一个能读懂分镜表的 agent,需要的不是「写提示词的能力」,而是「填镜头参数的能力」。
边界与失败模式
- 时长上限:单次生成停在 5-10 秒档位,更长的内容靠首尾帧接力拼接,接缝处会有风格与身份的轻微跳变,需要人工挑帧。
- 物理是纹理统计:流体、布料、刚体碰撞看起来对,但在需要守恒的场景(倒水的量、球反弹的高度、物体数量)会露馅。
- 文字与 logo:画面里的招牌、包装文字几乎必错,商业素材要么后期贴,要么在关键帧阶段就避开。
- 声音是另一条管线:输出静音,配音、配乐、音效都要单独做,口型对齐只在专门功能里可用。
- 成本量级:按秒计价,单条 5-10 秒的成本比一张图高一到两个数量级;考虑到重 roll 三到十次是常态,预算要按这个倍数算。
待核验清单(我们下一步做什么)
要把这条从 C 升到 B 以上,需要:用同一批提示词与同一组关键帧,横向对照可灵与其他两到三家视频模型的时序一致性与运镜遵循度;量化「首尾帧约束下身份漂移」的程度(首帧与末帧的人脸相似度);记录各档时长下的单条成本与排队时间。这些跑完之前,本页读数按厂商口径理解。