Fish Audio ASR 升级:区分说话人、就地标注 [laughter] 等情绪线索

视频加载中
视频加载中Fish Audio 宣布其语音识别(ASR/STT)模型升级,主打「结束无聊的转写稿」:同一段音频里自动区分不同说话人,理解说话人的情绪状态,并把 [laughter]、[surprised] 这类情绪线索作为标签直接写进转写文本,让字幕、会议纪要和对话记录保留语气与非语言信息,而不只是把词认对。官方称模型支持 83 种语言,并宣称是当前准确率最高的 STT 模型,已开放试用。对具身智能与人机语音交互而言,这一层是上游信号:说话人分离回答「谁在说」,情绪标签回答「以什么状态说」,两者都是对话式机器人在真实嘈杂场景里做轮次判断与意图理解的输入。
Category: perception
Author: @FishAudio
Date: 2026-09-28T00:00:00
Duration: 58.866s





