Audio8 ASR Infinite:滚动 KV Cache 支撑 24/7 不漂移的流式语音识别(Apache 2.0 开源)

视频加载中
视频加载中Edge0 开源 4B 参数流式语音识别模型 Audio8 ASR Infinite(Apache 2.0,中英双语)。核心:滚动 KV Cache 固定 30 秒上下文窗口 + 精确 RoPE 重定基(re-basing),旧帧持续逐出后位置编码仍数学一致——内存与延迟恒定,可 7×24 无限长转写不漂移。原生流式架构最快每秒解码 12.5 次,音频时钟可选 80/120/160 ms(对应 12.5/8.3/6.25 决策每秒),转写延迟 240–560 ms 可配置,一个 checkpoint 覆盖多档延迟预算。语义 VAD 能区分思考停顿、口吃与真正的话轮结束(传统声学 VAD 常失败)。成绩:aishell1/test CER 1.750%、aishell4 2.893%,大幅低于 Voxtral-Mini-4B-Realtime(16.8/16.5)与 nemotron-3.5-asr-streaming(12.9/14.7);英文 LibriSpeech 略逊(test.clean 3.04 vs 2.21)。支持 transformers 与适配版 vLLM(Docker 部署),面向会议转写、通话分析、全双工语音 agent 等常开麦克风场景;AK 还搭了 Hugging Face Space demo。机器人语音交互的实时转写层直接可用。
Audio8 ASR Infinite流式语音识别Streaming ASR语音识别Rolling KV CacheRoPE语义 VADSpeech Recognition开源模型Apache-2.0Hugging FacevLLM语音智能体实时转写
Category: voice-interaction
Author: @_akhaliq
Date: 2026-09-30T00:00:00
Duration: 28.45s

![Fish Audio ASR 升级:区分说话人、就地标注 [laughter] 等情绪线索](/static/img/twitter/FishAudio_2104617131920748857.card.webp)



