Eleven v4:把克隆保真度推到会反噬训练数据的一代
ElevenLabs 新一代语音合成模型,分 Eleven v4(最高质量档)与 Eleven v4 Turbo(实时档,中位推理延迟约 100ms,官方脚注明确不含应用与网络延迟)两个型号,官方口径是在输出质量、音色准确度、一致性、情感、演绎、audio tags 与语言覆盖上全面优于 v3 并建议迁移。本站把它列为音频域闭源语音方向的梯顶,依据是这一代把优化目标从「更好听」换成了「更像」:参考音色的音色、节奏、演绎与其他习惯一并复刻,官方自己承认准确度与个人偏好不总是同一件事、你可能仍更喜欢它在 v3 里的声音。配套的工程含义很硬——数据清洗的责任被推回使用方,官方把展示样例明确标注为未做任何后期(无 EQ、压缩、归一化、去齿音、去喷麦),并直说听到削波与喷麦大概率是训练数据里的、模型只是准确捕捉了下来。可交付面是三个数:Turbo 约 100ms、单次 10,000 字符约 10 分钟音频(v3 为 5,000,长文本分段接缝多一倍)、官方称 90+ 语言而 FAQ 逐条列出 87 种,这个差我们照原样并列不替它抹平。四条边界必须认清:跨语言口音是默认行为变更而非开关(生成语言与参考语言不一致时出目标语言的地道发音,做成 toggle 官方称仍是研究项目、无时间表),依赖「带母语口音说外语」的人设要先实测;控制面收窄,只剩 Stability 与 Similarity,Style 与 Speed 滑块取消、SSML 不支持,细粒度演绎改用 audio tags 且官方坦承还不完美;模型持续演化是官方明写的,发布后仍会继续训练、行为可能随时间变化,把音色当品牌资产的团队要周期性重测;Voice Design 生成的音色在 v4 上可能不那么有表现力。闭源不可自托管,数据必须过 ElevenLabs,克隆合规责任在使用方;可自托管对照是 CosyVoice 3、VibeVoice、Kokoro(语音)与 YuE2(音乐,非商业许可)。与本站已收的 Eleven v3 是同一商用栈上的两代,不是替代关系。置信度 C(厂商宣称):无第三方可核验基准,本站未做盲听。
~100msv4 Turbo 中位推理延迟(模型侧,不含应用与网络)厂商宣称 · 2026-09
Eleven v4:把克隆保真度推到会反噬训练数据的一代Suno:把音乐生产后半段工序全部收进一个产品
文生歌这条路做得最完整的商业平台:一句风格描述、自己的歌词、一段哼唱或一段 riff 都能起步,几秒出带人声与配器的完整歌曲,然后在同一产品里延伸、改段、换风格、抽分轨、做母带。本站把它列为音频域音乐方向的闭源梯顶,依据是工序完整度而不是单点音质——绝大多数生成式音乐产品只覆盖出草稿与选一版两步,Suno 用 Stem 分离(最多 12 轨)、MIDI 导出与 Suno Studio 把改段、重编、母带接上了,Studio 给的是传统 DAW 语义(多轨时间线、take lanes、comping、手动 BPM 治速度漂移、逐 clip 变速变调),不是又一个 prompt 框;Custom Models 用 6 首以上自有作品训练最多 3 个私有风格变体,Voices(前身 Personas)用自己的演唱样本出歌并带本人验证步骤。档位切分很关键:免费档能做完创作(生成、歌词、Cover、裁剪淡入淡出、音频上传),Stem、Add Vocals、Voices、Custom Models 都在 Pro 或 Premier,Studio 仅 Premier 且仅桌面网页,所以实际选型要按 Premier 算成本。第三方基准里版本号并不等于质量:WildSongBench 上 v5 得 6.8721,高于 v6 的 6.5562 与 v6 Wild 的 6.4195,v4.5 6.6995、v5.5 6.7150,官方也明确要求按能力而非版本号描述。边界:闭源不可自托管,未发布的旋律与歌词必须上传;无稳定版本语义,同一首歌重生成会随模型更新而变;商用权利随订阅档位;控制粒度落在段落与风格上,没有可编辑的和弦轨,需要乐理级修改要么靠 Studio 多轨重编,要么选 YuE2 那种暴露 ABC 乐谱的开放模型。置信度 C(厂商宣称),基准由 m-a-p 提交,本站未复算。
6.8721WildSongBench SongBench 均分(v5,第三方测)厂商宣称 · 2026-09
Suno:把音乐生产后半段工序全部收进一个产品VoiceStudio:把商用语音栈的整套工序搬到本地,并默认开给 agent
开源、完全本地的语音工作台(debpalash/VoiceStudio,AGPL-3.0,Python + Electron),自我定位为 ElevenLabs 的本地替代品:声音克隆、声音设计、视频配音、听写、转写与有声书制作,官方称覆盖 646 种语言。仓库 2026-04-09 建仓,到 2026-09-29 有 42,831 star / 5,005 fork。本站把它列为音频域本地自托管方向的梯顶,依据不是某个模型更强,而是抽象层有用:开源语音能力散落在十几个仓库里,各有自己的权重格式、设备要求、克隆接口与许可,拼一条「克隆音色→转写→对齐→配音→有声书」的产线,工程量主要花在粘合上;VoiceStudio 把 17 个 TTS 与 11 个 ASR 引擎收进统一注册表,逐引擎上报设备(CUDA/MPS/CPU)、是否可克隆、max_ref_seconds 与 ref_strategy,并给出可跑的工作流。对 agent 尤其关键:本地 API 与 MCP server 是产品自带的一等能力,README 直接给了可粘进 Claude Code / Codex / Cursor 的安装指令,还支持 npx skills add 装 skill,意味着编码 agent 可以把配音与转写当工具调用而不需要人点界面。参考音频口径也严谨:上限 75 秒,但真正进模型多少由引擎决定并逐引擎上报,超限时自动与已保存的转写会被忽略,给默认 OmniVoice 传超过 20 秒并附文本会以 [clone_ref_too_long] 直接报错。指标口径要说清:官方 docs/benchmarks.md 有一套真实 harness(逐阶段 profiling、内存不足拒绝启动、只收具名硬件与版本上的 RTF 热态与峰值显存、明确没有数字是估的),但结果一栏写着 No verified rows yet,所以本站不给它任何性能数字,卡片上只用本站自核的 GitHub star 数并据此记 A 档(可核验);这个 A 只针对数字为真,不针对它比 ElevenLabs 好。四条边界:AGPL-3.0 是强 copyleft 且带网络条款,嵌进对外 SaaS 需开放自己的服务端源码,闭源商用要么进程隔离只调本地 API(自行法律评估)要么改用 Apache-2.0 的 CosyVoice 3 / Kokoro 自行组装;模型各自有许可(Breeze-TTS-2 权重研究非商用、Supertonic-3 与 PocketTTS 需额外许可、GPT-SoVITS 要跑自己的 server),商用前逐模型核对;646 种语言是仓库自述,真实覆盖取决于所选引擎(Parakeet 25 种欧洲语言、FunASR 50+、Whisper 系更广),本站未逐语言核验;桌面端只剩 Electron,0.5.3 是最后一个 Tauri 版本,老用户必须迁移。它与 Eleven v4 在梯度上并存而不互相替代:一个代表闭源商用栈的质量上限与省心,一个代表本地自托管的数据主权与引擎可替换性。
42,831GitHub Stars(2026-09-29,本站经 GitHub API 核)已确认 · 2026-09
产品debpalash (open source)官网Repo VoiceStudio:把商用语音栈的整套工序搬到本地,并默认开给 agentEleven v3:一条把「说、听、唱」做齐的商用音频栈
ElevenLabs 的旗舰语音合成模型,官方称情感最丰富、最具表现力:戏剧化演绎、70+ 种语言、单次 5,000 字符、自然的多说话人对话,并随 v3 提供独立的 Text to Dialogue API,把多角色对白做成接口而不是 prompt 技巧。本站把它列为音频域梯顶,依据是背后唯一一条把说、听、唱都做齐的商用音频栈:TTS 四档、ASR 三档(含 Medical)、音乐两档。TTS 四档三轴互斥:v3 表现力最强但非实时、单次 5,000 字符;Flash v2.5 延迟约 75ms、每字符便宜 50%;Multilingual v2 长文本最稳却只有 29 语言;没有全能档,按场景分型号。ASR 侧 Scribe v2 覆盖 90+ 语言、32 人分离。延迟都是模型侧口径,不含网络与上游 LLM 时间,不能当 SLA 读。边界:长文本要自己分段,接缝处的韵律与音色一致性由你负责;闭源不可自托管,数据主权敏感场景是硬门槛。本站第三方榜里没有语音榜,与 Gemini 3.8 Flash TTS 并列不排名。置信度 C(厂商宣称):未复算 WER、未做盲听对比。
70+语言覆盖厂商宣称 · 2026-09
Eleven v3:一条把「说、听、唱」做齐的商用音频栈Gemini 3.8 Flash TTS:把导演级语音指导做成 API 参数
Google 的语音生成模型(gemini-3.8-flash-tts),官方定位 studio-grade voice fidelity、expressive acting 与 long-form stability,有声书翻车不是单句难听,是念到第三小时音色漂了。设计把作用域切开:文本字段严格当逐字稿,表演指令走另一条通道不会被念出来,修掉「(叹气)」被念出来的老问题;整轮风格走 speech_metadata.style,词级情感用竖线标签只影响那一个词。音色四类:预置、扩展库、语音设计 ID(自然语言造音色后复用)、克隆 ID,设计与克隆是 3.8 才补齐。规格:130 语言、自动检测输入语言,默认 WAV 24 kHz,单请求最多 2 个说话人且只能用预置音色。计费按音频 token、25 tokens 一秒,付费层每百万 tokens $0.50 输入 / $9.00 输出(至 2026-12-31,之后 $1.00/$18.00)。边界:24 kHz 非母带级;克隆合规责任在使用方。本站 12 个榜无语音榜,与 ElevenLabs v3 并列不排名。置信度 C(厂商宣称):未做可懂度测量与盲听对比。
全支持语音设计+克隆+多说话人厂商宣称 · 2026-09
Gemini 3.8 Flash TTS:把导演级语音指导做成 API 参数可灵 3.0 系列:音频原生进模型、画面到 4K,参数化镜头语言仍是它的护城河
快手可灵是国内最早把视频生成推到「能接商业单」水位的一条主线,长期强项不在纯文生视频,而在图生视频与运镜控制:先由图像环节锁定构图与角色,再让视频模型在确定的关键帧上补间,配合首尾帧约束与推/拉/摇/移/环绕/跟随的镜头参数,做出可预测的短片段。3.0 系列(官方 release-note 横幅:全面开放 API)带来三处实质跃迁——音频原生进模型(5/10/12 秒音频档)、图像与视频原生 2K/4K、智能分镜与元素参考把多镜头连贯从剪辑问题变成模型可控问题;型号分工为 3.0 / 3.0 Omni / 3.0 Turbo、Kling Image 3.0 与 -omni、Native 4K Video、Motion Control。竞技场水位说实话:图生视频 kling-v3-pro 第 19(Elo 1354),前面是 MiniMax h3、gemini-omni、wan3.0、seedance-2.5。3.0 系列的官方发布精确日期我们未拿到权威源,指标日期只按可核验月份记 2026-09。闭源、只走厂商接口;我们未做基准复现,置信度记 C。
3.0 / Omni / Turbo当前旗舰系列厂商宣称 · 2026-09
可灵 3.0 系列:音频原生进模型、画面到 4K,参数化镜头语言仍是它的护城河