Gemini 3.8 Flash TTS:把导演级语音指导做成 API 参数
gemini-3-8-flash-tts
Google 的语音生成模型(gemini-3.8-flash-tts),官方定位 studio-grade voice fidelity、expressive acting 与 long-form stability,有声书翻车不是单句难听,是念到第三小时音色漂了。设计把作用域切开:文本字段严格当逐字稿,表演指令走另一条通道不会被念出来,修掉「(叹气)」被念出来的老问题;整轮风格走 speech_metadata.style,词级情感用竖线标签只影响那一个词。音色四类:预置、扩展库、语音设计 ID(自然语言造音色后复用)、克隆 ID,设计与克隆是 3.8 才补齐。规格:130 语言、自动检测输入语言,默认 WAV 24 kHz,单请求最多 2 个说话人且只能用预置音色。计费按音频 token、25 tokens 一秒,付费层每百万 tokens $0.50 输入 / $9.00 输出(至 2026-12-31,之后 $1.00/$18.00)。边界:24 kHz 非母带级;克隆合规责任在使用方。本站 12 个榜无语音榜,与 ElevenLabs v3 并列不排名。置信度 C(厂商宣称):未做可懂度测量与盲听对比。
- 置信度
- 厂商宣称
- 只有官方模型卡/发布会,无独立复测
- 关键指标
- 语音设计+克隆+多说话人
- 厂商宣称 · 2026-09
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断我们给它 C 档(厂商宣称)。这个域的置信度天花板本来就低:本站同步的 12 个第三方榜单里一个语音榜都没有,所以没有任何独立读数可引,能核的只有官方文档里的特性矩阵与定价。C 档不是贬低它,是承认「支持 130 种语言」「录音棚级保真」这类描述我们没法打分。
它真正的工程贡献是把逐字稿和表演指令的作用域彻底分开。这一步看起来只是 API 设计,但它解决了整个 TTS 领域长期存在的一类不可预测行为:舞台指导写在文本里,模型有时演出来、有时念出来。3.8 TTS 的切法是「`text` 严格是逐字稿、`speech_metadata.style` 管整轮持续风格、竖线标签管单个词的内联情感」,再叠上多人抢话与重叠语音,等于把「导演给演员讲戏」这件事结构化成了参数。对做有声书与播客生产线的团队,这个可预测性比音质本身更值钱。
价格方向是另一件值得单独指出的事:3.8 Flash TTS 的音频输出是 $9.00/M tokens,而上一代 3.1 Preview 是 $20.00——能力提升的同时价格降到不到一半,按 25 tokens/秒折算约每分钟 $13.5,2027-01-01 起翻倍到约 $27。旗舰迭代通常涨价,这条反向,所以它对「长音频规模化生产」的成本结构影响是实质性的。另外免费层输出会被用于改进产品、付费层不会,这一行对企业是硬约束。边界要读清楚:多说话人单请求最多 2 人且只能用预置音色,群戏做不到;官方还明确建议长回复靠拆轮次而不是靠更强的风格提示,表现力在长文本上要买结构不买 prompt。语音克隆的合规责任在使用方,模型能力不等于授权。
它解决的问题:把「导演级语音指导」变成 API 参数
传统 TTS 的表达能力停在选音色和调语速:你只能挑一个预置声音,再拉几个滑块。要做播客、有声书、配音,你需要的是可指导的表演——这一句要压着说、那一句要笑出来、两个人要抢话。Gemini 3.8 Flash TTS(`gemini-3.8-flash-tts`)把这件事做进了模型:文本字段被严格当作逐字稿,表演指令走另一条通道,不会被念出来。
这条设计是整个模型的关键,值得单独说。以前常见的做法是把「(叹气)」写进文本里让模型自己理解,结果它有时念出来、有时演出来,行为不可预测。3.8 TTS 把作用域明确切开:
- 整轮持续的风格走 `speech_metadata.style`(情绪、节奏、音量、韵律),例如 `"style": "cheerful and friendly"`。
- 词内联的情感标签直接写在逐字稿里,用竖线包起来:`"Then let's ship it |absolutely| and watch the dashboards."`,只影响那一个词。
- 重叠与抢话用多个竖线段模拟两人同时说话,官方明确写了这个能力「在 gemini-3.8-flash-tts 上效果最好」。
官方对这套的定位是「studio-grade voice fidelity, expressive acting, and long-form stability」——录音棚级保真、有表演性的演绎、长文本稳定。三个词里最容易被忽略的是长文本稳定:有声书真正的失败模式不是单句难听,是念到第三小时音色漂了、情绪塌了。
能力矩阵与同门型号的分档
| 型号 | 单/多说话人 | 语音设计 | 语音克隆 | 定位 |
|---|---|---|---|---|
| gemini-3.8-flash-tts | 支持(≤2 人预置音色) | 支持 | 支持 | 本站收录的这一条:表现力天花板 |
| gemini-3.8-flash-lite-tts | 支持 | 支持 | 支持 | 同 schema、高吞吐低成本档,支持 101 种语言 |
| gemini-3.1-flash-tts-preview | 支持 | 不支持 | 不支持 | 上一代:低延迟、性价比,但没有设计与克隆 |
分档逻辑读清楚很重要:语音设计(voice design)与语音克隆(voice replication)是 3.8 这一代才补齐的两块,3.1 Preview 没有。所以「Gemini 能做 TTS」和「Gemini 能按描述造一个新声音 / 能复刻一个真人声音」是两件事,后者才是配音与有声书生产线的刚需。
音色来源共四类,都在 `generation_config.speech_config` 里配:预置音色(如 `Kore`、`Puck`)、扩展音色库(`GET /v1beta/voices` 可检索,支持按 `type=prebuilt` 与关键词过滤)、语音设计 ID(`voice_...`,先用自然语言描述造出音色再复用)、语音克隆 ID(`voice_...` 或无状态的 `voicekey_...`)。多说话人单请求最多 2 人且只能用预置音色,要把自定义设计或克隆音色混进多人对话,官方文档指向需要分开处理。
语言覆盖与输出规格
- 130 种语言,输入语言自动检测,不需要显式指定。同门 Flash-Lite TTS 支持 101 种。覆盖到 Acehnese(阿拉伯字母书写)、Akan、Awadhi、Balinese 这一级,已经不是「主流语言包」而是长尾覆盖。
- 默认输出 WAV(`audio/wav`,RIFF 头、16-bit 小端 PCM、单声道、默认 24 kHz);流式模式默认给无头的 raw Linear PCM(`audio/l16`,24 kHz 单声道 16-bit),便于连续拼接而不必每块都带容器头。编码与采样率可在 `response_format` 里改。
- 计费单位是音频 token,25 tokens 对应 1 秒音频。这是把「一秒多少钱」换算清楚的钥匙,见下一节。
- 纯文本入、纯音频出:TTS 型号不接受音频或图像输入。要理解音频得走 Live API 或音频理解那条线,不是这个模型。
价格:官方给了明确的涨价时间表
| 项 | 免费层 | 付费层(每 1M tokens) |
|---|---|---|
| 输入(文本) | 免费 | $0.50(至 2026-12-31)→ $1.00(2027-01-01 起) |
| 输出(音频) | 免费 | $9.00(至 2026-12-31)→ $18.00(2027-01-01 起) |
| 用于改进产品 | 是 | 否 |
把 25 tokens/秒 代进去算,当前价位的音频产出成本约为每分钟 $13.5($9.00/M ÷ 25 × 60);2027-01-01 之后翻倍到约每分钟 $27。对比参照:上一代 3.1 Flash TTS Preview 是 $1.00 输入 / $20.00 输出,所以 3.8 在能力提升的同时把音频输出价格降到了不到一半,这在旗舰模型迭代里是不常见的方向,也是本站把它作为音频域梯顶的一条硬理由。
另外「免费层输出会用于改进产品、付费层不会」这一行对企业用户是实质差别,不是脚注。
边界
- 多说话人硬限 2 人,且限预置音色:做群戏、做三个以上角色的有声书,单请求做不到,得自己拼接并保持音色一致性。
- 逐字稿语义是严格的:写进 `text` 的东西会被念出来。舞台指导必须放到 `style` 或竖线标签里,放错位置就是事故——这是这套 API 最主要的踩坑点。
- 官方文档明确建议不要用「更强的风格提示」硬顶长回复:正确做法是把长回复拆成更短的轮次、per-turn style 留空或用一个固定短串。也就是说表现力在长文本上要靠结构而不是靠 prompt 强度,这与很多人对「加描述就能更好」的直觉相反。
- 24 kHz 默认采样率:够播客与有声书,但不是母带级。要更高采样率得显式配 `sample_rate`,且模型上限并非无限制。
- 语音克隆的合规责任在使用方:复刻真人声音涉及肖像/声音权与各地法规,模型能力不等于授权。本站不评估这一层,但它属于必须写明的边界。
- 没有公开的第三方 TTS 榜读数:本站同步的 12 个第三方榜单里没有任何语音榜,所以这条资产无法给出「第几名」,能力面只能靠官方文档的特性矩阵与定价来读。
我们的核验状态
事实来自 Google 官方两处文档实读:Gemini API 语音生成指南(型号矩阵、逐字稿与 `speech_metadata` 的作用域切分、竖线内联情感标签、重叠语音、四类音色来源、多说话人 ≤2 人限制、130/101 语言表、WAV 与 L16 输出规格、长文本最佳实践)与 Gemini API 定价页(`$0.50/$9.00` 现价与 2027-01-01 起的 `$1.00/$18.00`、25 tokens/秒、免费层与付费层的数据使用差别、3.1 Preview 的 `$1/$20` 对照)。
置信度记 C(厂商宣称),原因要说准:「支持语音设计与克隆」「130 种语言」「studio-grade 保真」这些都是官方文档的自我描述,不是可打分的基准读数。本站没有在 130 种语言里逐语种做过可懂度测试,没有对同一段文本做过与 ElevenLabs v3、OpenAI TTS 的盲听对比,也没有量过长文本(例如连续 3 小时有声书)的音色漂移。要升到 A 档,需要:固定的多语种测试集上做可懂度与说话人相似度测量、组织盲听偏好对比、以及长文本稳定性的定量测量(音色漂移、韵律塌陷)。
本站把它作为音频域梯顶的理由不是「它最好」,而是它是当前少数把语音设计、语音克隆、多说话人表演、内联情感控制四件事同时做进一个 API 的模型,且价格与规格全部公开可核。同期本站收录的 ElevenLabs v3 走的是另一条强项(70+ 语言、Text to Dialogue、~280ms 实时档、以及 Scribe 与 Music 的完整音频栈),两条并列,不排名次——这个域没有第三方榜,任何名次都是我们编的。