Eleven v3:一条把「说、听、唱」做齐的商用音频栈
elevenlabs-v3
ElevenLabs 的旗舰语音合成模型,官方称情感最丰富、最具表现力:戏剧化演绎、70+ 种语言、单次 5,000 字符、自然的多说话人对话,并随 v3 提供独立的 Text to Dialogue API,把多角色对白做成接口而不是 prompt 技巧。本站把它列为音频域梯顶,依据是背后唯一一条把说、听、唱都做齐的商用音频栈:TTS 四档、ASR 三档(含 Medical)、音乐两档。TTS 四档三轴互斥:v3 表现力最强但非实时、单次 5,000 字符;Flash v2.5 延迟约 75ms、每字符便宜 50%;Multilingual v2 长文本最稳却只有 29 语言;没有全能档,按场景分型号。ASR 侧 Scribe v2 覆盖 90+ 语言、32 人分离。延迟都是模型侧口径,不含网络与上游 LLM 时间,不能当 SLA 读。边界:长文本要自己分段,接缝处的韵律与音色一致性由你负责;闭源不可自托管,数据主权敏感场景是硬门槛。本站第三方榜里没有语音榜,与 Gemini 3.8 Flash TTS 并列不排名。置信度 C(厂商宣称):未复算 WER、未做盲听对比。
- 置信度
- 厂商宣称
- 只有官方模型卡/发布会,无独立复测
- 关键指标
- 语言覆盖
- 厂商宣称 · 2026-09
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断我们给它 C 档(厂商宣称)。这一档的判断和音频域整体一样受限于证据形态:本站能核到的全是规格与定价(语言数、字符上限、延迟档位、特性清单),而「最具表现力」「state-of-the-art 语音识别」「临床音频少 35% 错误」这些都是官方自述。本站没有跑过 WER、没有做过盲听偏好对比、也没有量过长文本分段后的韵律连续性,所以我们不把这些升成 A。加上这个域根本没有第三方榜,C 档是唯一诚实的标法。
它值得进梯顶的理由不在单个模型,在栈的完整度:TTS 四档、ASR 三档、音乐两档,是同一家商用供应商里唯一把「说、听、唱」三条工序都做齐的。真实的音频生产从来不是只有合成——一段视频配音要 TTS,要字幕就要 ASR 的词级时间戳与说话人分离,要配乐就要能局部 inpainting 的音乐模型。把这三件事放在一套 API 与一套账号体系里,省下的是集成成本而不是单价。Scribe v2 那几条参数尤其值得读:1000 个术语的 keyterm prompting、65 类实体检测、32 人说话人分离,这套配置明显是冲着企业会议与专业转写去的,不是通用 demo。
但选型时要认清那张表里的取舍:表现力、延迟、语言面三轴互斥,没有全能档。v3 表演性最强却只有 5,000 字符,长文本最稳的 Multilingual v2 只支持 29 种语言,~75ms 的 Flash v2.5 表现力与语言面都更窄。所以正确做法是按场景分型号,而不是找一个「最好的」用到底。另外两类风险必须写明:一是所有延迟数字都是模型侧口径,不含网络与上游 LLM 出字时间,而真实语音 agent 里 LLM 那一段通常更大,不能当端到端 SLA 用;二是闭源不可自托管,数据必须过 ElevenLabs,这对医疗、政务、金融录音这类数据主权敏感场景是硬门槛,即使有 Scribe v2 Medical 这个垂直版本。声音克隆的合规责任始终在使用方,能力不等于授权。
它解决的问题:把音频做成一条完整的生产线,而不是一个 TTS 接口
Eleven v3 是 ElevenLabs 的旗舰语音合成模型,官方描述是「情感最丰富、最具表现力的语音合成模型」,四个特性:戏剧化演绎与表演性、70+ 种语言、单次 5,000 字符上限、支持自然的多说话人对话。
但本站把它作为音频域梯顶的一条来收录,判断依据不只是这一个模型,而是它背后唯一一条把「说、听、唱」三件事都做齐的商用音频栈:TTS(v3 / v3 Conversational / Multilingual v2 / Flash v2.5)+ ASR(Scribe v2 / Realtime / Medical)+ 音乐(Eleven Music v2.5 / v2)。语音域的竞争早已不是「谁的音色更像人」,而是「谁能把配音、字幕、配乐三条工序放在同一套 API 与同一套账号体系里」。
型号分档:表现力、延迟、稳定性是三个互相拉扯的轴
| 型号 | 延迟 | 语言 | 单次字符上限 | 适用 |
|---|---|---|---|---|
| Eleven v3 | 非实时档 | 70+ | 5,000(约 5 分钟音频) | 有声书、播客、配音:要表演性 |
| Eleven v3 Conversational | ~280ms | 70+ | - | 实时对话 agent,带 audio tags 细粒度控制 |
| Eleven Multilingual v2 | - | 29 | 10,000 | 长文本最稳的一档 |
| Eleven Flash v2.5 | ~75ms | 32 | 40,000 | 电话/低延迟场景,API 每字符价格便宜 50% |
这张表里最值得读的是三者的取舍关系:表现力最强的 v3 单次只有 5,000 字符,长文本最稳的 Multilingual v2 只支持 29 种语言,延迟最低的 Flash v2.5 表现力与语言面都更窄。没有任何一档同时拿到全部三个轴的最优,所以工程上的正确做法是按场景分型号,而不是选一个「最好的」用到底。官方给的场景建议也是这个方向:v3 用于多角色互动的音频体验、长篇旁白与情绪对白;并随 v3 提供了独立的 Text to Dialogue API,把「多角色对白」当成一个专门的接口而不是 prompt 技巧。
~280ms 与 ~75ms 这两个数字要读准口径:它们都是官方标注的模型延迟(文档里带脚注标记),不含网络往返、不含你的上游 LLM 出字时间。真实语音 agent 的端到端延迟里,LLM 那一段通常比 TTS 大得多。
ASR 侧:Scribe v2 的参数密度比 TTS 更值得读
- 90+ 种语言的准确转写,支持智能语言检测。
- Keyterm prompting,最多 1000 个术语:把领域词表喂进去,专名与术语的识别率才撑得住。这一条对企业场景(医疗、法律、内部代号)是刚需,也是通用 ASR 最容易失败的地方。
- 实体检测,65 类实体:输出的不只是文本,是带类型标注的文本。
- 词级时间戳 + 说话人分离最多 32 人:32 人这个数字明显是奔着会议与多人访谈去的。
- Scribe v2 Realtime:~150ms 实时转写,同样 90+ 语言、词级时间戳、实体检测。
- Scribe v2 Medical:针对临床音频微调,在临床音频上比 Scribe v2 少 35% 的转写错误,日常语音准确率持平,特性/语言/定价/API 完全一致。这是本站见到少数把「垂直微调带来多少错误率下降」量化写出来的商用音频产品。
音乐侧:Eleven Music v2.5
v2.5 是当前最强档,官方描述是更好的质量与 prompt 遵循度、更丰富的旋律、更深的编曲与更分层的乐器;工作流与 v2 一致,保留三件对生产真正有用的能力:composition plans(结构化编排计划)、audio reference(参考音频)、inpainting(局部重绘音频)。v2 的定位是「录音棚级音乐、自然语言 prompt、任意风格」,可控制流派、风格与结构。
其中 inpainting 是最容易被忽略、但实际最省事的一件:一段配乐里只有四小节不对,重生成整段意味着前面满意的部分也一起赌掉,能局部改才是真正的生产工具。
边界
- v3 单次 5,000 字符:约 5 分钟音频。长文本要自己分段,分段处的韵律连续性与音色一致性由你负责,模型不保证跨请求一致。
- 表现力、延迟、语言面三轴互斥:见上表,不存在全能档。
- 闭源、不可自托管:没有权重可下载,无法在自有环境部署,数据必须经 ElevenLabs。对数据主权敏感的场景(医疗、政务、金融录音)这是硬门槛,即使 Scribe v2 Medical 提供了垂直版本。
- 延迟数字是模型侧口径:~280ms / ~150ms / ~75ms 都带官方脚注,不含网络与上游 LLM,不能直接当作端到端 SLA。
- 「SOTA」「35% 更少错误」都是官方自述:本站没有在自有测试集上复算 WER,也没有做过与 Gemini TTS、OpenAI TTS、Whisper 系的盲测对比。
- 声音克隆的合规责任在使用方:能力不等于授权,各地对声音权与合成音频标注的要求不同。
- 没有第三方语音榜:本站同步的 12 个第三方榜单里没有语音/音频榜,所以这条资产无法给排名。
我们的核验状态
事实来自 ElevenLabs 官方 Models 文档实读全文:TTS 四档(v3 的 70+ 语言 / 5,000 字符 / 多说话人对话,v3 Conversational 的 ~280ms 与 audio tags,Multilingual v2 的 29 语言 / 10,000 字符,Flash v2.5 的 ~75ms / 32 语言 / 40,000 字符 / 每字符便宜 50%)、v3 的适用场景与 Text to Dialogue API、ASR 三档(Scribe v2 的 90+ 语言 / 1000 术语 / 65 类实体 / 词级时间戳 / 32 人分离,Realtime ~150ms,Medical 临床音频少 35% 错误)、音乐两档(v2.5 的 composition plans / audio reference / inpainting,v2 的风格与结构控制)。
置信度记 C(厂商宣称)。理由与 Gemini 3.8 Flash TTS 那条一致:这里所有可核的东西都是规格与定价,不是质量读数。「最具表现力」「state-of-the-art 语音识别」「临床音频少 35% 错误」都是官方自述,本站没有跑过 WER、没有做过盲听偏好、没有量过 5,000 字符分段拼接后的韵律连续性。要升到 A 档,需要:在固定的多语种测试集上测 WER 与说话人相似度、组织盲听对比、以及量出长文本分段后的一致性衰减。
本站把它与 Gemini 3.8 Flash TTS 并列放在音频域梯顶,而不是排先后。两者的强项确实不同:ElevenLabs 赢在栈的完整度(说、听、唱三条线都有商用产品,ASR 侧的参数密度尤其高)与延迟分档;Gemini 3.8 Flash TTS 赢在语音设计 + 克隆 + 内联情感控制在一个模型里,且语言面更宽(130 对 70+)、音频输出定价公开且更低。这个域没有第三方榜,所以我们只并列事实,不编名次。