Gemini Omni:视频交付单位从「一次抽卡」变成「一段可对话的编辑过程」
gemini-omni
Google DeepMind 的视频与多模态生成模型,官方定位 create anything from any input, starting with video:逐步对话编辑视频,每次编辑建立在上一次之上并维持连贯场景,交付单位从一个镜头提到可改素材;另两条:真实世界知识、任意参考合成单一输出。水位连票数读:Artificial Analysis 竞技场(2026-09-22,本站同步)文生视频榜 gemini-omni-1.1-flash 以 Elo 1516 第 1,但只有 1,784 票、CI ±15;第 2 同门 1513、26,576 票、±9,3 分差远小于各自 CI,统计不可区分,即 Omni 系列并列榜首。图生视频榜第 1 是 minimax-h3(1495、57,112 票),Omni 以 1488、3,734 票第 2。定价:输入 $1.50/1M tokens,输出文本 $9.00/1M、视频 $17.50/1M,720p 约 $0.10/秒、30 秒约 $3。付费层 GA、免费层无。闭源不可自托管、不能微调。置信度 A(已确认),本站视频域首条 A 档;A 指读数可信可核,不等于无争议第一。
- 置信度
- 已确认
- ≥2 个独立来源,或本站 harness 复现通过
- 关键指标
- Arena T2V Elo(1784 票)
- 已确认 · 2026-09
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断我们给它 A 档(已确认),这是本站视频域第一条 A 档资产,依据很具体:能力面与定价来自 Google 官方文档,水位读数来自与本站无利益关系的第三方竞技场(Artificial Analysis),而那个第三方的原始票数和置信区间我们完整保留并公开。两个独立来源互相印证,这是本站置信度体系里 A 档的定义。但 A 档的含义要说准:它是「读数可信、来源可核」,不是「它是无可争议的第一名」。
这条资产最值得学的地方恰恰是它的读数该怎么读。T2V 榜首 1516 分只有 1,784 票、CI ±15;第二名是同门的 gemini-omni-flash,1513 分、26,576 票、CI ±9。相差 3 分,而两行的置信区间都远大于 3 分,统计上不可区分。I2V 上更直接:第一名是 minimax-h3(1495,57,112 票,CI ±5),Omni 以 1488 排第二,差 7 分而自身 CI 是 ±11,同样不可区分。所以正确的表述是「Omni 系列处在统计榜首区间」,而不是「Arena 第一名」。这正是低票数新模型的典型形态:刚上榜、票少、Elo 波动大。本站把票数写进指标名而不是藏进正文,是因为一个不带票数的 Elo 在这个域里几乎是误导。
产品判断上,Omni 的真正贡献不是画质,是把视频生成的交付单位从「一次抽卡」换成「一段可反复编辑的素材」。官方那个「Nano Banana,但用于视频」的类比是准确的:Nano Banana 成为图像域转折点靠的是多轮编辑之间保持一致,而不是单张更好看。配合任意参考(图像/文本/视频/音频)合成单一输出,它把「多模态输入」从两个端点的拼接变成了真正的统一面。代价也要算清:$17.50/1M 视频输出、5,792 tokens/秒 720p、约 $0.10/秒,意味着一段 30 秒素材约 $3,而对话式编辑的成本是轮数乘单价——五轮迭代就是 $15 量级。抽卡失败只损失一次,对话编辑每一轮都重新计费整个输出,这是两种范式在成本结构上的根本差别,预算时必须分开算。另外免费层不可用,评估它先要付钱。闭源不可自托管、不能微调,对数据主权敏感的团队是硬门槛。本站没有实际调用过 API,「物理直觉」与「跨轮一致性」至今仍是官方描述而非我们量过的读数,这是这条 A 档资产里唯一还悬着的部分。
它解决的问题:视频生成的交付单位从「一次抽卡」变成「一段可对话的编辑过程」
当前视频生成模型的共同痛点不是画质,是不可控:你给一个 prompt,抽一次卡,不满意就换个措辞重抽,前一次满意的部分和这一次不满意的部分无法分开保留。Google DeepMind 对 Gemini Omni 的官方定位是「Create anything from any input - starting with video」,并用了一个非常准确的类比:「把它想成 Nano Banana,但用于视频」。
Nano Banana 之所以成为图像域的转折点,靠的不是单张画质,是多轮编辑之间保持一致。Gemini Omni 把同一件事搬到视频上,官方描述是「通过自然的、逐步的对话编辑任何视频,每一次编辑都建立在上一次之上,维持一个一致、连贯的场景」。这句话是整个产品的核心:它把视频生成的交付单位从「一个镜头」提到了「一段可以被反复修改的素材」。
另外两条官方能力面同样重要:
- 应用真实世界知识:把对物理的直觉理解与 Gemini 的历史、科学、文化知识结合,官方的说法是「弥合从照片级真实到有意义的叙事之间的差距」。物理直觉决定物体运动是否可信,世界知识决定「1920 年代的巴黎街头」这类指令是否被执行对。
- 任意参考合成:把图像、文本、视频、音频任意参考组合成单一连贯输出。这是真正的多模态输入面,不是「文生视频 + 图生视频」两个端点的拼接。
第三方水位:读这个第一名要连票数一起读
本站同步的 Artificial Analysis 竞技场(2026-09-22 抓取)上,Gemini Omni 系列占据了文生视频榜的前两名与图生视频榜的第 2 名:
| 榜单 | 名次 | 型号 | Elo | 票数 | 置信区间 |
|---|---|---|---|---|---|
| 文生视频(T2V) | 1 | gemini-omni-1.1-flash | 1516 | 1,784 | ±15 |
| 2 | gemini-omni-flash | 1513 | 26,576 | ±9 | |
| 5 | dreamina-seedance-2.0-720p | 1479 | 56,318 | ±8 | |
| 6 | wan3.0 | 1476 | 2,598 | ±13 | |
| 图生视频(I2V) | 1 | minimax-h3 | 1495 | 57,112 | ±5 |
| 2 | gemini-omni-1.1-flash | 1488 | 3,734 | ±11 | |
| 6 | gemini-omni-flash | 1465 | 87,155 | ±6 |
这张表本站刻意把票数和置信区间一并列出,因为它改变了结论的读法:
- T2V 的第一名只有 1,784 票,置信区间 ±15。而第二名是同门的 gemini-omni-flash,26,576 票、±9、1513 分。两者相差 3 分,而两行的置信区间都远大于 3 分,统计上不可区分。正确的表述是「Omni 系列并列榜首」,而不是「1.1 Flash 是第一名」。
- 票数扎实的高位读数属于别家:seedance-2.0 有 56,318 票、CI 只有 ±8、1479 分。它的分数比 Omni 低约 35 分,但那个 35 分是统计上站得住的差距。
- 图生视频榜第一名不是 Omni,是 minimax-h3(1495,57,112 票,±5)。Omni 1.1 Flash 以 1488 排第二,差 7 分,而它自己的 CI 是 ±11——差距小于自身置信区间,同样不可区分。
所以本站对这条资产的水位判断是:Gemini Omni 处在文生视频竞技场的统计榜首区间,但没有以可区分的优势领先;在图生视频上与榜首同样不可区分。这与「Arena 第一名」的通俗说法有实质差别,而那个差别正是低票数新模型的典型形态——刚上榜、票少、Elo 波动大。我们把 metric 卡片的读数写成 1516 但把票数放进指标名,就是为了让这个前提在卡片上可见。
可用性与定价:已从 Preview 转为正式 GA
截至本站核验,Gemini API 上的 gemini-omni-1.1-flash(商品名 Gemini Omni Flash)已经面向付费层开发者正式可用(generally available),不再是 preview;另有一个 gemini-omni-flash-preview 端点并存。消费侧在 Gemini app 与 Google Flow 里可用。
| 项 | 读数 |
|---|---|
| 输入 | $1.50 / 1M tokens(文本、图像、视频、音频同一价) |
| 输出(含 thinking tokens) | $9.00 / 1M(文本)、$17.50 / 1M(视频) |
| 视频计费速率 | 720p 每秒视频 = 5,792 tokens |
| 折算单价 | 约 $0.10 / 秒 720p 视频 |
| 免费层 | 不可用 |
$0.10/秒这个数字要放进上下文读:一段 30 秒的 720p 素材约 $3.0,一次多轮对话编辑如果迭代五轮就是 $15 量级。对话式编辑的真实成本是「轮数 × 单价」,这是它与「抽卡式生成」在成本结构上的根本差别——抽卡失败你只损失一次,对话编辑每一轮都要重新计费整个输出。免费层不可用也意味着评估它必须先付钱。
与同门 Veo、与本站收录的其它视频资产的关系
Google 自己同时维护 Veo(定位「生成带音频的电影级视频」)与 Gemini Omni,这不是重复而是分工:Veo 是一次生成高质量成片,Omni 是可对话编辑的多模态合成。本站同时收录 Seedance(字节的音视频联合生成主线,交付单位 30 秒叙事)、Kling、Wan 与 Flux,几条路线的技术选择各不相同,竞技场读数也互有胜负——T2V 榜 Omni 系列居前、I2V 榜 minimax-h3 居前,没有一个模型双榜登顶。本站因此不在这个域排单一冠军,而是并列收录并按榜单标注各自的水位与票数。
边界
- 榜首读数的票数极低:T2V 1,784 票、I2V 3,734 票,对比同榜其它型号的数万到数十万票。Elo 在这个票数量级上波动很大,本站下次同步时名次完全可能变化。
- 闭源、不可自托管:没有权重可下载,不能微调,不能私有部署。素材与 prompt 必须经 Google。
- 免费层不可用:评估与试错都要付费,没有零成本试用路径(消费侧的 Gemini app 除外)。
- 多轮编辑的成本随轮数线性增长:见上,这是对话式范式的固有代价,不是缺陷但要计入预算。
- 「物理直觉」「真实世界知识」是官方描述,不是可打分的读数:本站没有做过物理一致性基准测试(例如 VideoPhy 类评测),也没有量过跨轮编辑的身份/场景一致性衰减。
- 720p 计价档:更高分辨率的计费速率官方未在同一处给出,长片与高分辨率场景的成本需另行核算。
我们的核验状态
事实来自三处实读:Google DeepMind 的 Gemini Omni 官方模型页(产品定位、Nano Banana 类比、对话式逐步编辑、物理直觉与世界知识、任意参考合成、Gemini app 与 Google Flow 可用性)、Gemini API 定价页(gemini-omni-1.1-flash 的 GA 状态、$1.50 输入、$9.00 文本 / $17.50 视频输出、5,792 tokens/秒 720p、约 $0.10/秒、免费层不可用、以及并存的 preview 端点),以及本站自己同步的 Artificial Analysis 竞技场 T2V / I2V 两个榜(2026-09-22 抓取,名次、Elo、票数、置信区间与 preliminary 标记逐行核对)。
置信度记 A(已确认),这是本站视频域第一条 A 档资产,依据是两个独立来源互相印证:能力面与定价来自官方文档,水位读数来自与本站无利益关系的第三方竞技场,而且那个第三方的原始票数与置信区间我们都保留并公开。A 档在这里的准确含义是「读数可信、来源可核」,不等于「它是无可争议的第一名」——恰恰相反,我们在正文里明确指出榜首在统计上与第二名不可区分,在 I2V 上也不领先于 minimax-h3。
本站没有做的部分同样要写清:我们没有调用 API 生成过视频,没有测过多轮编辑的一致性衰减,没有跑过物理一致性基准,也没有对同一段 prompt 做过与 Seedance、Kling、Veo 的盲测对比。要做到这些需要付费 API 额度与一套固定的评测 prompt 集,是我们下一步可以真正落地的工作;在那之前,「对话式编辑是否真的一致」这一条仍然只是官方描述。