Skip to content
返回领域赋能

能力资产

语音与音频影音创作梯顶

Gemini 3.8 Flash TTS:把导演级语音指导做成 API 参数

gemini-3-8-flash-tts

Google 的语音生成模型(gemini-3.8-flash-tts),官方定位 studio-grade voice fidelity、expressive acting 与 long-form stability,有声书翻车不是单句难听,是念到第三小时音色漂了。设计把作用域切开:文本字段严格当逐字稿,表演指令走另一条通道不会被念出来,修掉「(叹气)」被念出来的老问题;整轮风格走 speech_metadata.style,词级情感用竖线标签只影响那一个词。音色四类:预置、扩展库、语音设计 ID(自然语言造音色后复用)、克隆 ID,设计与克隆是 3.8 才补齐。规格:130 语言、自动检测输入语言,默认 WAV 24 kHz,单请求最多 2 个说话人且只能用预置音色。计费按音频 token、25 tokens 一秒,付费层每百万 tokens $0.50 输入 / $9.00 输出(至 2026-12-31,之后 $1.00/$18.00)。边界:24 kHz 非母带级;克隆合规责任在使用方。本站 12 个榜无语音榜,与 ElevenLabs v3 并列不排名。置信度 C(厂商宣称):未做可懂度测量与盲听对比。

C
置信度
厂商宣称
只有官方模型卡/发布会,无独立复测
全支持
关键指标
语音设计+克隆+多说话人
厂商宣称 · 2026-09
成熟度
产品
研究 → 演示 → 产品 → 生产
我们的判断

我们给它 C 档(厂商宣称)。这个域的置信度天花板本来就低:本站同步的 12 个第三方榜单里一个语音榜都没有,所以没有任何独立读数可引,能核的只有官方文档里的特性矩阵与定价。C 档不是贬低它,是承认「支持 130 种语言」「录音棚级保真」这类描述我们没法打分。

它真正的工程贡献是把逐字稿和表演指令的作用域彻底分开。这一步看起来只是 API 设计,但它解决了整个 TTS 领域长期存在的一类不可预测行为:舞台指导写在文本里,模型有时演出来、有时念出来。3.8 TTS 的切法是「`text` 严格是逐字稿、`speech_metadata.style` 管整轮持续风格、竖线标签管单个词的内联情感」,再叠上多人抢话与重叠语音,等于把「导演给演员讲戏」这件事结构化成了参数。对做有声书与播客生产线的团队,这个可预测性比音质本身更值钱。

价格方向是另一件值得单独指出的事:3.8 Flash TTS 的音频输出是 $9.00/M tokens,而上一代 3.1 Preview 是 $20.00——能力提升的同时价格降到不到一半,按 25 tokens/秒折算约每分钟 $13.5,2027-01-01 起翻倍到约 $27。旗舰迭代通常涨价,这条反向,所以它对「长音频规模化生产」的成本结构影响是实质性的。另外免费层输出会被用于改进产品、付费层不会,这一行对企业是硬约束。边界要读清楚:多说话人单请求最多 2 人且只能用预置音色,群戏做不到;官方还明确建议长回复靠拆轮次而不是靠更强的风格提示,表现力在长文本上要买结构不买 prompt。语音克隆的合规责任在使用方,模型能力不等于授权。

Text-to-SpeechVoice CloningVoice Design谷歌
Google官网2 min read3

它解决的问题:把「导演级语音指导」变成 API 参数

传统 TTS 的表达能力停在选音色和调语速:你只能挑一个预置声音,再拉几个滑块。要做播客、有声书、配音,你需要的是可指导的表演——这一句要压着说、那一句要笑出来、两个人要抢话。Gemini 3.8 Flash TTS(`gemini-3.8-flash-tts`)把这件事做进了模型:文本字段被严格当作逐字稿,表演指令走另一条通道,不会被念出来。

这条设计是整个模型的关键,值得单独说。以前常见的做法是把「(叹气)」写进文本里让模型自己理解,结果它有时念出来、有时演出来,行为不可预测。3.8 TTS 把作用域明确切开:

  • 整轮持续的风格走 `speech_metadata.style`(情绪、节奏、音量、韵律),例如 `"style": "cheerful and friendly"`。
  • 词内联的情感标签直接写在逐字稿里,用竖线包起来:`"Then let's ship it |absolutely| and watch the dashboards."`,只影响那一个词。
  • 重叠与抢话用多个竖线段模拟两人同时说话,官方明确写了这个能力「在 gemini-3.8-flash-tts 上效果最好」。

官方对这套的定位是「studio-grade voice fidelity, expressive acting, and long-form stability」——录音棚级保真、有表演性的演绎、长文本稳定。三个词里最容易被忽略的是长文本稳定:有声书真正的失败模式不是单句难听,是念到第三小时音色漂了、情绪塌了。

能力矩阵与同门型号的分档

型号单/多说话人语音设计语音克隆定位
gemini-3.8-flash-tts支持(≤2 人预置音色)支持支持本站收录的这一条:表现力天花板
gemini-3.8-flash-lite-tts支持支持支持同 schema、高吞吐低成本档,支持 101 种语言
gemini-3.1-flash-tts-preview支持不支持不支持上一代:低延迟、性价比,但没有设计与克隆

分档逻辑读清楚很重要:语音设计(voice design)与语音克隆(voice replication)是 3.8 这一代才补齐的两块,3.1 Preview 没有。所以「Gemini 能做 TTS」和「Gemini 能按描述造一个新声音 / 能复刻一个真人声音」是两件事,后者才是配音与有声书生产线的刚需。

音色来源共四类,都在 `generation_config.speech_config` 里配:预置音色(如 `Kore`、`Puck`)、扩展音色库(`GET /v1beta/voices` 可检索,支持按 `type=prebuilt` 与关键词过滤)、语音设计 ID(`voice_...`,先用自然语言描述造出音色再复用)、语音克隆 ID(`voice_...` 或无状态的 `voicekey_...`)。多说话人单请求最多 2 人且只能用预置音色,要把自定义设计或克隆音色混进多人对话,官方文档指向需要分开处理。

语言覆盖与输出规格

  • 130 种语言,输入语言自动检测,不需要显式指定。同门 Flash-Lite TTS 支持 101 种。覆盖到 Acehnese(阿拉伯字母书写)、Akan、Awadhi、Balinese 这一级,已经不是「主流语言包」而是长尾覆盖。
  • 默认输出 WAV(`audio/wav`,RIFF 头、16-bit 小端 PCM、单声道、默认 24 kHz);流式模式默认给无头的 raw Linear PCM(`audio/l16`,24 kHz 单声道 16-bit),便于连续拼接而不必每块都带容器头。编码与采样率可在 `response_format` 里改。
  • 计费单位是音频 token,25 tokens 对应 1 秒音频。这是把「一秒多少钱」换算清楚的钥匙,见下一节。
  • 纯文本入、纯音频出:TTS 型号不接受音频或图像输入。要理解音频得走 Live API 或音频理解那条线,不是这个模型。

价格:官方给了明确的涨价时间表

免费层付费层(每 1M tokens)
输入(文本)免费$0.50(至 2026-12-31)→ $1.00(2027-01-01 起)
输出(音频)免费$9.00(至 2026-12-31)→ $18.00(2027-01-01 起)
用于改进产品

把 25 tokens/秒 代进去算,当前价位的音频产出成本约为每分钟 $13.5($9.00/M ÷ 25 × 60);2027-01-01 之后翻倍到约每分钟 $27。对比参照:上一代 3.1 Flash TTS Preview 是 $1.00 输入 / $20.00 输出,所以 3.8 在能力提升的同时把音频输出价格降到了不到一半,这在旗舰模型迭代里是不常见的方向,也是本站把它作为音频域梯顶的一条硬理由。

另外「免费层输出会用于改进产品、付费层不会」这一行对企业用户是实质差别,不是脚注。

边界

  • 多说话人硬限 2 人,且限预置音色:做群戏、做三个以上角色的有声书,单请求做不到,得自己拼接并保持音色一致性。
  • 逐字稿语义是严格的:写进 `text` 的东西会被念出来。舞台指导必须放到 `style` 或竖线标签里,放错位置就是事故——这是这套 API 最主要的踩坑点。
  • 官方文档明确建议不要用「更强的风格提示」硬顶长回复:正确做法是把长回复拆成更短的轮次、per-turn style 留空或用一个固定短串。也就是说表现力在长文本上要靠结构而不是靠 prompt 强度,这与很多人对「加描述就能更好」的直觉相反。
  • 24 kHz 默认采样率:够播客与有声书,但不是母带级。要更高采样率得显式配 `sample_rate`,且模型上限并非无限制。
  • 语音克隆的合规责任在使用方:复刻真人声音涉及肖像/声音权与各地法规,模型能力不等于授权。本站不评估这一层,但它属于必须写明的边界。
  • 没有公开的第三方 TTS 榜读数:本站同步的 12 个第三方榜单里没有任何语音榜,所以这条资产无法给出「第几名」,能力面只能靠官方文档的特性矩阵与定价来读。

我们的核验状态

事实来自 Google 官方两处文档实读:Gemini API 语音生成指南(型号矩阵、逐字稿与 `speech_metadata` 的作用域切分、竖线内联情感标签、重叠语音、四类音色来源、多说话人 ≤2 人限制、130/101 语言表、WAV 与 L16 输出规格、长文本最佳实践)与 Gemini API 定价页(`$0.50/$9.00` 现价与 2027-01-01 起的 `$1.00/$18.00`、25 tokens/秒、免费层与付费层的数据使用差别、3.1 Preview 的 `$1/$20` 对照)。

置信度记 C(厂商宣称),原因要说准:「支持语音设计与克隆」「130 种语言」「studio-grade 保真」这些都是官方文档的自我描述,不是可打分的基准读数。本站没有在 130 种语言里逐语种做过可懂度测试,没有对同一段文本做过与 ElevenLabs v3、OpenAI TTS 的盲听对比,也没有量过长文本(例如连续 3 小时有声书)的音色漂移。要升到 A 档,需要:固定的多语种测试集上做可懂度与说话人相似度测量、组织盲听偏好对比、以及长文本稳定性的定量测量(音色漂移、韵律塌陷)。

本站把它作为音频域梯顶的理由不是「它最好」,而是它是当前少数把语音设计、语音克隆、多说话人表演、内联情感控制四件事同时做进一个 API 的模型,且价格与规格全部公开可核。同期本站收录的 ElevenLabs v3 走的是另一条强项(70+ 语言、Text to Dialogue、~280ms 实时档、以及 Scribe 与 Music 的完整音频栈),两条并列,不排名次——这个域没有第三方榜,任何名次都是我们编的。

同域资产:语音与音频

3
语音与音频影音创作梯顶C

Eleven v3:一条把「说、听、唱」做齐的商用音频栈

ElevenLabs 的旗舰语音合成模型,官方称情感最丰富、最具表现力:戏剧化演绎、70+ 种语言、单次 5,000 字符、自然的多说话人对话,并随 v3 提供独立的 Text to Dialogue API,把多角色对白做成接口而不是 prompt 技巧。本站把它列为音频域梯顶,依据是背后唯一一条把说、听、唱都做齐的商用音频栈:TTS 四档、ASR 三档(含 Medical)、音乐两档。TTS 四档三轴互斥:v3 表现力最强但非实时、单次 5,000 字符;Flash v2.5 延迟约 75ms、每字符便宜 50%;Multilingual v2 长文本最稳却只有 29 语言;没有全能档,按场景分型号。ASR 侧 Scribe v2 覆盖 90+ 语言、32 人分离。延迟都是模型侧口径,不含网络与上游 LLM 时间,不能当 SLA 读。边界:长文本要自己分段,接缝处的韵律与音色一致性由你负责;闭源不可自托管,数据主权敏感场景是硬门槛。本站第三方榜里没有语音榜,与 Gemini 3.8 Flash TTS 并列不排名。置信度 C(厂商宣称):未复算 WER、未做盲听对比。

70+语言覆盖厂商宣称 · 2026-09
产品ElevenLabs官网
Eleven v3:一条把「说、听、唱」做齐的商用音频栈
视频生成影音创作梯顶C

可灵 3.0 系列:音频原生进模型、画面到 4K,参数化镜头语言仍是它的护城河

快手可灵是国内最早把视频生成推到「能接商业单」水位的一条主线,长期强项不在纯文生视频,而在图生视频与运镜控制:先由图像环节锁定构图与角色,再让视频模型在确定的关键帧上补间,配合首尾帧约束与推/拉/摇/移/环绕/跟随的镜头参数,做出可预测的短片段。3.0 系列(官方 release-note 横幅:全面开放 API)带来三处实质跃迁——音频原生进模型(5/10/12 秒音频档)、图像与视频原生 2K/4K、智能分镜与元素参考把多镜头连贯从剪辑问题变成模型可控问题;型号分工为 3.0 / 3.0 Omni / 3.0 Turbo、Kling Image 3.0 与 -omni、Native 4K Video、Motion Control。竞技场水位说实话:图生视频 kling-v3-pro 第 19(Elo 1354),前面是 MiniMax h3、gemini-omni、wan3.0、seedance-2.5。3.0 系列的官方发布精确日期我们未拿到权威源,指标日期只按可核验月份记 2026-09。闭源、只走厂商接口;我们未做基准复现,置信度记 C。

3.0 / Omni / Turbo当前旗舰系列厂商宣称 · 2026-09
产品快手 Kuaishou官网
可灵 3.0 系列:音频原生进模型、画面到 4K,参数化镜头语言仍是它的护城河
视频生成影音创作梯顶C

Seedance 2.5:把视频交付单位从「一个镜头」提到「30 秒叙事」

字节 Seed 的视频生成主线。1.x 是文生/图生的静音短镜头,2.0 起换成统一多模态音视频联合生成架构(文本/图像/音频/视频四类输入),2.5 把交付单位直接提到 30 秒一段叙事,并支持再续写两次、白模控制、绿幕编辑、专业运镜与表演调度。第三方水位是它最硬的地方:本站同步的 Artificial Analysis 竞技场(2026-09-22)图生视频 dreamina-seedance-2.5-720p 第 4(Elo 1477),文生视频 2.0 第 5(1479)、2.5 第 7(1474)。闭源,只走 Dreamina / 火山引擎 / BytePlus,不能自托管与微调;SeedVideoBench-2.0 是内部评测,无法独立复现。我们未做基准复现,置信度记 C(厂商宣称)。

30s单次生成叙事时长厂商宣称 · 2026-09
产品ByteDance Seed官网
Seedance 2.5:把视频交付单位从「一个镜头」提到「30 秒叙事」