AB
AiBoss站
project

parakeet-redux - 三值权重压缩到 178 MB 的 Parakeet 语音识别模型

parakeet-redux 是 moondream 发布在 Hugging Face 上的语音识别模型,把 parakeet-tdt-0.6b-v3 的编码器权重压成 -1、0、+1 三值,体积降到 178 MB。据项目自述,它在多语言与长音频上优于原版,在噪声场景下则明显落后。本文按官方事实表与项目自述整理其状态、能力、调用方式与许可边界。

parakeet-redux 是一个自动语音识别(automatic-speech-recognition)模型,托管在 Hugging Face 上,由 moondream 维护。据项目自述,它是 parakeet-tdt-0.6b-v3 的 1.58-bit 量化版本:架构相同、分词器相同,但编码器的每一个权重都被压成 -1、0 或 +1 三个取值之一,因此权重体积从 1.2 GB 降到 178 MB。它面向的是希望在 CPU 或 Apple 芯片上本地跑语音转写、又不想为模型体积和推理速度付出太多代价的开发者,尤其是需要多语言转写和长音频处理的场景。

需要先说明的是:本文没有实际运行过该项目,所有关于能力、速度与效果的说法都来自项目自述(README / 模型卡),请把它当作维护者的陈述而非中立评测。

维护者与状态

该项目由 moondream 维护,仓库位于 Hugging Face 模型库。根据官方接口数据,仓库创建时间为 2026-09-18,最后更新时间为 2026-09-23。截至 2026-09-25,近 30 天下载量为 1046 次,点赞数为 150。事实表中没有给出正式 release 信息,因此这里不对版本发布情况做任何推断。许可证为 cc-by-4.0。

主要能力

以下能力均据项目自述整理,未经独立验证:

  • 三值权重与极小体积:项目自述编码器权重全部为 -1、0 或 +1,权重体积 178 MB,而原版 parakeet-tdt-0.6b-v3 为 1.2 GB。
  • 多语言识别:项目自述支持 25 种语言,语言集合、分词器与输出约定(标点、大小写、数字写法)沿用原版模型。
  • 长音频处理:项目自述权重在编码器的 subsampler 上带有一个小型语音活动检测(VAD)头,推理框架 Photon 用它按停顿把录音切成不超过 30 秒的片段,因此不需要外部的 VAD 模型。
  • 时间戳输出:据项目说明,调用时可指定 timestamps="segment" 得到按句切分的起止时间,或指定 timestamps="word" 得到每个词的起止时间。
  • 多后端加速:项目自述通过 Photon 运行,在 x86 上使用 AVX-512 VNNI,在 ARM 上使用 NEON,在 Apple GPU 上使用 Metal。

项目自述还给出了若干对比数据,这里仅作转述:在 Open ASR Leaderboard 的 7 个英文测试集上,原版平均 WER 为 6.26,parakeet-redux 为 6.55;在 FLEURS 25 种语言上,原版为 11.62,parakeet-redux 为 10.56;在 TED-LIUM 3 的 11 段 10 至 20 分钟长音频上,原版为 2.71,parakeet-redux 为 2.51。项目自述同时承认,在背景噪声条件下差距最大:9 个 MUSAN 噪声条件的平均 WER 为 9.04,而原版为 6.72,并解释称三值编码器的声学余量更薄,低信噪比下更容易替换成发音相近的词,但漏字或凭空生成内容的频率并不高于原版。项目自述还提到,同架构的全精度版本 Parakeet Ultra 面向 GPU,在各项基准上均优于原版。

使用入口

模型仓库地址:parakeet-redux。

据项目说明,使用方式是安装 moondream 包(2.4.0 或更高版本)后通过 Photon 调用,Photon 可直接读取打包后的权重。项目自述给出的示例代码大致如下:

# pip install moondream (2.4.0 or later)
import moondream as md

# device: "cpu", "mps" or "cuda"; leave it out to take CUDA,
# then Apple silicon, then the CPU
with md.photon("moondream/parakeet-redux", device="cpu") as speech:
    result = speech.transcribe(audio="speech.wav")
    print(result["text"])

项目自述还说明,device 参数可省略,省略时按 CUDA、Apple 芯片、CPU 的顺序自动选择;时间戳模式通过 timestamps 参数切换,返回结果中 segments 为句子级条目,words 为词级条目。

许可与限制

许可证为 cc-by-4.0,与原始模型相同。项目自述明确说明该模型基于 NVIDIA 的 parakeet-tdt-0.6b-v3,语言集合、分词器与输出约定均沿用原版。

已知限制方面,据项目自述:噪声环境是它相对原版差距最大的场景,低信噪比下更容易出现同音词替换;它依赖 Photon 运行,项目自述中列出的所有速度数据都是在 Photon 上测得;长音频依赖模型自带的 VAD 头配合 Photon 的切分逻辑,而非外部 VAD 模型。项目自述中提到的速度数据(例如在 8 核 x86 上 113 倍实时、在 Apple M2 上 CPU 38 倍 / GPU 43 倍)均为维护者在其指定硬件与测试集上的测量结果,本文未做复现,也不对其准确性作判断。使用前建议结合自身音频条件与硬件环境评估。