Audio8-ASR-Infinite - 原生流式中英双语语音识别模型
Audio8-ASR-Infinite 是维护者 Edge0 发布在 Hugging Face 上的原生流式语音识别模型,采用 apache-2.0 许可,基于 transformers 框架。据项目自述,它支持 80/120/160 ms 可选音频时钟与 240–560 ms 可配置转写延迟,配合滚动 KV Cache 可进行不限时长转写,并具备语义 VAD 与中英双语能力。
Audio8-ASR-Infinite 是一个原生流式(native streaming)语音识别模型,托管在 Hugging Face 上,任务类型为 automatic-speech-recognition,使用 transformers 框架。按项目自述,它的设计目标是把「响应速度」做到尽可能高:模型以原生流式架构每秒解码 12.5 次,并提供可选的音频时钟与可配置的转写延迟,让使用者在感知粒度、准确率与资源开销之间自行取舍。它面向的是需要低延迟、长时间连续转写的场景,例如实时字幕、会议记录、语音助手前端,以及需要 7×24 小时不间断运行的流式识别服务;同时支持中文与英文两种语言。
维护者与状态
该项目的维护者为 Edge0,仓库创建于 2026-09-21,最后更新于 2026-09-24。截至 2026-09-25,近 30 天下载量为 2853,点赞数为 540。许可证为 apache-2.0。
需要说明的是,事实表中没有给出该仓库的正式 release 记录,因此这里不对版本发布情况作任何推断;仓库的可见状态就是上述创建与更新时间。另据项目自述,当前提供的是 preview release(预览版),交付的是转写基础能力,而帧级语义感知仍在开发中,属于后续正式版本的范围。
主要能力
以下能力均来自项目自述(README / 模型卡),并非第三方评测结论:
- 高响应速度:项目称其原生流式架构每秒解码 12.5 次。
- 不限时长转写:借助滚动 KV Cache,项目自述内存占用与延迟可以保持恒定,即使在 7×24 小时连续运行下也不会漂移。
- 可选流式时钟:每个时钟步输出一个文本 token,对应每秒 12.5 / 8.3 / 6.25 次决策,用于在感知粒度与资源成本之间做平衡。
- 可配置转写延迟:使用者可以设定用多少延迟换取准确率。
- 语义 VAD:项目称其能区分思考停顿、口吃与真正的说话结束,而传统声学 VAD 在这些情况下通常容易误判。
- 双语支持:中文与英文。
关于运行点,项目自述给出了一组经过后训练的组合,并提示其他组合虽然可用但性能可能不是最优。据项目说明,target_delay_ms 必须是所选时钟的整数倍,因此即使某些延迟未在推荐表中列出,在任意时钟下仍可使用更长的延迟。推荐组合为:80 ms 时钟对应 frame_len 4、streaming_n_left_pad_tokens 18,可选延迟 240 / 320 / 480 / 560 ms;120 ms 时钟对应 frame_len 6、左填充 12,可选延迟 240 / 480 ms;160 ms 时钟对应 frame_len 8、左填充 9,可选延迟 320 / 480 ms。
在架构上,项目自述其继承了 Voxtral 实时音频架构与 DSM 风格的流式方案。据模型卡,因果音频塔初始权重来自 Voxtral Realtime 4B,音频投影器与帧长嵌入为随机初始化,解码器与 LM Head 来自 Qwen2.5-3B-Instruct,上述组件均经过训练。模型卡还给出了检查点规格:音频塔 32 层、隐藏维度 1280、128 个 mel bin、滑动窗口 750;文本解码器 36 层、隐藏维度 2048、16 个 query head 与 2 个 KV head;投影器最大帧长 8、投影维度 10240、使用 gelu;启用了帧长条件(use_frame_len_embedding: true);语义 VAD 头位于 semantic_vad_heads.safetensors,共 8 类,时间视野为 0.5 / 1.0 / 2.0 / 3.0 秒;词表大小 151936;dtype 为 bfloat16;权重为 8.17 GB 的 model.safetensors,另有语义 VAD 头文件。
使用入口
仓库地址:Edge0/Audio8-ASR-Infinite。
据项目说明,程序化的模拟流式解码可以借助仓库内嵌的远程代码完成,需要 trust_remote_code=True 加载 tokenizer、feature extractor 与模型,并调用 simulated_streaming_greedy_decode_batch 等接口;示例中通过一个鸭子类型的 AudioConfig 指定 raw_audio_samples_per_token、streaming_n_left_pad_tokens 与采样率,音频以 16 kHz 单声道、取值落在 [-1, 1] 的 float32 波形传入。项目特别提示:只支持完整合并后的权重目录(即该仓库原样提供的形态),不支持 adapter 形式或部分转换的权重。
对于 7×24 小时推理,项目自述推荐以 Docker Compose 作为标准部署路径,该栈同时提供网页演示:进入 docker 目录后设置 AUDIO8_MODEL_DIR 并执行 docker compose up -d,随后可通过 8080 端口(明文 HTTP)或 8443 端口(TLS 代理,需接受自签名证书)访问。同一套接字也可由终端驱动,项目给出了 python -m audio8_asr_infinite.examples.vllm_realtime_client 的调用示例,其中 18191 是 compose 文件对外发布的宿主端口,服务本身在 compose 网络内监听 18190。项目称滚动 KV 窗口为 30 秒并配合精确的 RoPE 重基准,这是长时间运行下内存与延迟保持有界的原因。
此外,项目还提供了 Torch 推理的模拟流式解码入口:python -m audio8_asr_infinite.examples.torch_streaming_decode,可传入检查点路径、音频文件、语言与转写延迟等参数。
许可与限制
许可证为 apache-2.0,按事实表原样记录。
据项目自述,需要注意的边界包括:其一,当前为预览版,交付的是转写基础能力,实时语义感知尚未包含在内;其二,检查点原生上下文为 30 秒,超长音频依赖滚动 KV Cache 机制;其三,只有经过后训练的帧长与延迟组合性能最优,其他组合可用但可能不是最佳;其四,target_delay_ms 必须为所选音频时钟的整数倍;其五,仅支持完整合并的权重目录,不支持 adapter 或部分转换权重;其六,模型卡中列出的评估结果由项目方给出,属于自述数据,本文未做独立复现。