project
Luna-TTS - 宇生月伴推出的文本转语音大模型
Luna-TTS 是上海交大系初创公司宇生月伴(VUI Labs)自研的文本转语音大模型。模型摒弃主流自回归路线,采用 Masked Diffusion 掩码扩散架构,基于 Qwen3-0.6...
Luna-TTS是什么
Luna-TTS 是上海交大系初创公司宇生月伴(VUI Labs)自研的文本转语音大模型。模型摒弃主流自回归路线,采用 Masked Diffusion 掩码扩散架构,基于 Qwen3-0.6B 训练,配合自研 Luna-Codec,在中英日韩 100 万小时语音数据上预训练。模型在 Hugging Face TTS Arena V2 盲听榜登顶全球第一,Artificial Analysis 权威榜位列第三、超越谷歌。
Luna-TTS的主要功能
- 多语言语音合成:支持中英日韩四种语言的高质量语音合成,音色自然、韵律流畅,适用于有声书与播客等长文本场景。
- 情绪与副语言控制:可精确控制 neutral、sad、surprised 等情绪,及呼吸、停顿、笑声、叹气等副语言细节。
- 实时流式输出:Luna-TTS Realtime 支持块级流式生成,首块延迟仅 41.6ms,端到端 RTF 低至 0.024。
- 音色一致与克隆:支持音色克隆与保持,长文本生成过程中音色稳定不漂移。
Luna-TTS的技术原理
-
Masked Diffusion 架构:放弃主流自回归路线,将语音 RVQ Token 网格作为整体,通过多轮迭代并行预测被掩码的位置,生成顺序由模型动态决定,避免误差沿前缀累积。
-
自研 Luna-Codec:将 24kHz 波形编码为 25Hz、8 码本的离散 Token 网格,码率仅 2.2kbps,采用因果编解码器实现流式、帧同步输出。
-
Qwen3 主干模型:基于 Qwen3-0.6B 继续训练,标准版使用双向注意力,Realtime 版改用块级因果注意力并配合 KV Cache 实现流式生成。
-
大规模训练与强化学习:在中英日韩四种语言上进行约 100 万小时预训练与 10 万小时高质量退火,将 GRPO 强化学习迁移到扩散去噪轨迹上,优化内容正确性与说话人一致性。
Luna-TTS的项目地址
- 项目官网:https://vuilabs-ai.github.io/luna-tts/
- arXiv技术论文:https://arxiv.org/pdf/2608.11593
Luna-TTS的同类竞品对比
| 对比维度 | Luna-TTS | ElevenLabs Eleven v3 |
|---|---|---|
| 开发团队 | 宇生月伴 VUI Labs(中国) | ElevenLabs(美国) |
| 技术路线 | Masked Diffusion 掩码扩散 | 自回归生成 |
| 模型参数 | 0.6B | 未公开 |
| 语言支持 | 中英日韩 | 多语言(32+) |
| 情绪控制 | 精细控制(neutral/sad/surprised 等) | 支持情绪与风格调节 |
| 副语言细节 | 呼吸、停顿、笑声、叹气 | 支持部分副语言 |
| 实时版本 | Luna-TTS Realtime(RTF 0.024) | Turbo v2.5(低延迟) |
| API 定价 | $80.0 / 1M chars | $100.0 / 1M chars |
| TTS Arena V2 | 第1名(Rating 1574) | 第10名(Rating 1176) |
| Artificial Analysis | 第3名(Elo 1220) | 第10名(Elo 1176) |
Luna-TTS的应用场景
- 智能客服与电销:替代传统语音机器人,提供自然、带情绪变化的对话体验,支持实时流式响应,降低用户挂断率。
- 有声内容与播客:为有声书、新闻播报、知识类播客生成高质量长文本语音,保持音色一致性与叙事韵律,支持多情绪段落切换。
- 在线教育与培训:为课程讲解、语言学习提供清晰标准的多语言发音,支持情绪调节以匹配教学内容(如鼓励、严肃、温和)。
- 车载与智能硬件:通过 Luna-TTS Realtime 低延迟特性,为车载导航、智能家居、耳机助手提供即时、自然的语音交互入口。
- 实时同传与会议助手:结合语音理解能力,在跨语言会议场景中实现低延迟、高自然度的语音翻译输出,提升沟通效率。