OPEN SOURCE DEEP DIVE
妙幕 SmartSub:视频转字幕、字幕翻译、AI 配音与声音克隆、字幕烧录——一站式开源桌面工具
妙幕(SmartSub)是一款 5.5k Stars 的开源音视频字幕与配音桌面工具(MIT 许可证),把语音转文字、字幕翻译、校对润色、TTS 配音、烧录合成整条流水线装进一个应用。支持 8 类转写引擎(whisper.cpp/faster-whisper/FunASR/Qwen3-ASR/FireRedASR/Parakeet 等)、20 个翻译服务、本地 TTS 配音与零样本声音克隆。内置 AI 创作助手(多模态视觉诊断 + Agentic 工具调用)和 111 个 MCP 工具 + CLI 命令,支持 Cursor/Claude Code/Codex 外部 AI 调度。整条流水线可完全免费跑通,跨 Windows/macOS/Linux,全平台 GPU 加速。
项目概述
妙幕(SmartSub)是一款开源的音视频字幕与配音桌面工具,把「语音转文字 → 字幕翻译 → 校对润色 → TTS 配音 → 烧录合成」整条流水线装进一个应用。5.5k Stars、MIT 许可证,跨 Windows / macOS / Linux 三平台,支持 NVIDIA CUDA、AMD/Intel Vulkan、Apple Core ML/Metal 全平台 GPU 加速。整条流水线可以完全免费跑通——本地模型转写、内置免费翻译源、本地 TTS 配音(含声音克隆)、本地 ffmpeg 烧录,不需要任何 API Key。
核心能力
在线视频下载
粘贴 B 站、YouTube 等平台链接即可直接下载,双引擎(yt-dlp 支持 1800+ 站点,lux 支持国内平台)按平台自动匹配。可同时下载平台官方字幕(含自动生成字幕),任务向导中自动配对——有官方字幕就无需再转写。支持导入站点 Cookie 解锁高清画质与会员内容,Cookie 仅保存在本地。
字幕生成(转写)
支持 8 类转写引擎逐任务切换:
- whisper.cpp(内置):默认引擎,支持 ggml 量化模型与 GPU 加速,随应用内置开箱即用
- faster-whisper:基于 CTranslate2,速度更快,模型按需从 HuggingFace 下载
- FunASR:SenseVoice(中/英/日/韩/粤)与 Paraformer-zh,中文表现优秀,通过内置 sherpa-onnx 原生库运行
- Qwen3-ASR:通义千问语音识别(qwen3-asr-0.6b / 1.7b)
- FireRedASR:FireRedASR-AED large,中英表现优秀
- NVIDIA Parakeet:英语 TDT v2、多语种 TDT v3(25 种欧洲语言)、日语 0.6B CTC
- 本地 Whisper CLI:调用自行安装的 whisper 兼容命令
- 云端听写:9 家在线服务商(OpenAI 兼容、ElevenLabs Scribe、Deepgram、火山引擎豆包、腾讯云、阿里云、讯飞、Gladia、Xiaomi MiMo),免 GPU,支持多服务商多实例
AI 字幕精修(可选):大模型语义断句 + 批量校正——断句按语义重组且时间轴仍精确到词,校正修同音字、去语气词、规范标点;服务商默认跟随 AI 翻译配置(本地 Ollama 零成本),失败自动回退规则断句。
字幕翻译
20 个翻译服务:内置免费翻译(必应/谷歌免费接口,自动回退与限速)、百度、阿里云、腾讯、讯飞、火山引擎、豆包、小牛、DeepLX、Azure、Google,以及 Ollama(本地模型)、DeepSeek、Gemini、通义千问、SiliconFlow、Azure OpenAI、DeerAPI 等大模型服务。兼容任意 OpenAI 风格 API。输出纯译文或「原文+译文」双语字幕。每个 AI 服务支持自定义请求参数(String/Float/Boolean/Array/Object/Integer 类型),支持导出导入。
字幕校对
内置校对台,逐句对照视频检查修改,定位精准。支持撤销/重做,单条删除可恢复。AI 一键润色,并可随时呼出右侧 AI 助手进行对话式修改与答疑。
TTS 配音与声音克隆
独立配音工作台:一份字幕 + 可选视频,逐条语音合成并自动对齐时间轴。
本地引擎离线免费:
- Kokoro 多语 v1.1:中/英,103 个音色
- VITS 中文 AIShell3:中文,174 个说话人音色
- ZipVoice 声音克隆:零样本克隆,一段参考音频 + 对应文本即建即用
云端服务:Edge TTS(免费)、OpenAI 兼容端点、Azure Speech(700+ 音色)、火山引擎豆包(声音复刻 2.0)、ElevenLabs(即时克隆)、Xiaomi MiMo。
时间轴对齐机制:合成前按目标时长预控语速,合成后实测时长复核,不足时向相邻静音间隙借用时间;超过 1.5 倍语速红线的行进入人工处理清单。创建克隆音色时自动质检参考音频(时长、信噪比、削波、音量等)。
视频合成(字幕烧录)
硬字幕(永久烧进画面)与软字幕(流复制方式无损封装可切换字幕轨)两种模式。字体、字号、颜色、描边、阴影、九宫格位置与多种预设样式,所见即所得实时预览。
AI 创作助手(智能副驾)
妙幕深度融合了现代 AI 协同与 Agentic 自动化能力:
- 随时唤起:快捷键 ⌘J(macOS)/ Ctrl+J(Windows/Linux)呼出右侧抽屉面板,会话记录自动持久化保存在本地
- 工作台深度上下文感知:智能感知当前界面状态,自动关联视频播放进度、选中字幕行、邻近上下文、任务列表运行状态与近期报错日志
- Agentic 自主工具调用:全面打通底层 111 个自动化工具,可根据自然语言指令直接代劳——如「把当前视频转成中英双语字幕并合成」
- 字幕精修与安全编辑:说「把当前这句改得更口语化」即可修改,实时渲染在编辑器中并进入撤销/重做栈,严格版本保护,说「保存」才写入物理文件
- 多模态视觉截图诊断:点击相机图标一键捕获当前工作区,结合视觉多模态大模型分析报错弹窗与控件状态,秒级给出排查方案
- 多类型文件与媒体对话:支持拖拽音视频、字幕、参考文稿及图片到对话框,音视频文件不上传云端仅传递本地路径
- 主流大模型自由接入:支持 DeepSeek、通义千问、Gemini、SiliconFlow、DeerAPI 及任意 OpenAI 兼容端点
MCP 协议与 CLI 命令行自动化
- 111 个标准 MCP 工具与对应 CLI 命令:无死角覆盖音视频下载、转写、翻译、校对、配音、封装、格式转换、音频抽取及模型配置全链路
- 免配置 Node.js 运行时:直接复用应用自带的 Electron/Node 运行时,客户端用户和外部 AI 完全不需要额外安装 Node.js
- 主流 AI 客户端一键打通:Cursor(一键导入)、Codex(TOML 配置)、Claude Code(一键注册)及通用客户端 JSON 配置
- 无窗口后台守护:AI 工具或 CLI 首次调用时自动启动无界面后台常驻守护,与桌面客户端无缝共享任务状态、配置和模型资源,闲置自动回收
- 强大的 CLI 命令行:提供 smartsub 统一入口,支持 pipeline.run 一键编排、JSON/stdin 管道传参、任务状态轮询与去重机制
全流程免费方案
| 环节 | 免费方案 | 说明 |
|---|---|---|
| 视频下载 | yt-dlp / lux 开源引擎 | 应用内一键安装 |
| 语音转写 | whisper.cpp / faster-whisper / FunASR / Qwen3-ASR / FireRedASR / Parakeet | 模型下载一次,离线可用 |
| 字幕翻译 | 内置免费翻译(必应/谷歌)、Ollama 本地大模型、DeepLX | 零配置开箱即用 |
| TTS 配音 | 本地 Kokoro / VITS / ZipVoice 声音克隆;Edge TTS 免费档 | 本地模型离线合成,无用量限制 |
| 字幕烧录 | 内置 ffmpeg | 本地合成 |
技术架构
基于 Nextron(Next.js + Electron)构建,主要使用 JavaScript/TypeScript。转写引擎通过 whisper.cpp 原生 addon 和 sherpa-onnx 原生库运行,无需 Python 环境。GPU 加速支持 NVIDIA CUDA(11.8.0/12.2.0/12.4.0/13.0.2)、AMD/Intel Vulkan、Apple Core ML/Metal,应用内下载加速包,加载失败自动回退 CPU。
安装方式
Windows/Linux x64 和 macOS(Apple 芯片/Intel)均有安装包。macOS 推荐使用 Homebrew:
brew tap buxuku/tap
brew install --cask smartsub
brew upgrade --cask smartsub
三步上手:安装后下载语音模型 → 选择任务拖入文件或粘贴链接 → 开始处理。
致谢与社区
项目基于 whisper.cpp(本地转写引擎)、sherpa-onnx(FunASR/Qwen3-ASR/FireRedASR/Parakeet 与本地 TTS 运行时)、FFmpeg(音视频处理与字幕烧录)构建。QQ 交流群:655348339。MIT 许可证。