微软开源 VibeVoice-ASR:一小时会议录音一次转完,说话人/时间戳/内容一次前向全给出(5.4 万 star)

视频加载中
视频加载中微软开源 VibeVoice 语音家族(GitHub 已 5.4 万+ star,MIT 协议)中的统一语音识别模型 VibeVoice-ASR(7B,2026-01 开源):长达 60 分钟的会议录音**单次前向**直接输出结构化转录——谁在说(说话人识别)、何时说(时间戳)、说了什么(内容),一个模型同时完成转写+分说话人+时间对齐(传统方案需三个模型)。原生支持 50+ 语言自动检测、句中语码切换(英中混说)、自定义热词/上下文提升人名与术语准确率;支持本地部署,敏感录音不出设备。技术底座是家族共用的 7.5Hz 超低帧率连续语音 tokenizer(常规语音模型 50-75Hz,压缩 3200 倍,90 分钟音频仅约 4 万 token 进 LLM 上下文)+ LLM 骨干 + diffusion 头。家族还有 TTS-1.5B(90 分钟 4 说话人长音频生成,ICLR 2026 Oral)、Realtime-0.5B(300ms 首音实时 TTS)、ASR-Streaming(边说边转写,2026-09)与 ASR-BitNet(异构量化压到 1.58GB,3+ CPU 线程实时推理无需显卡,VibeASR.cpp)。开发者 axichuhai 强调其纯 CPU 方案让会议内容完全留在本地处理。
Category: voice-interaction
Author: @axichuhai
Date: 2026-09-30T00:00:00
Duration: 21.8s
Reference: https://github.com/microsoft/VibeVoice



![Fish Audio ASR 升级:区分说话人、就地标注 [laughter] 等情绪线索](/static/img/twitter/FishAudio_2104617131920748857.card.webp)

