AB
AiBoss
project

Luna-TTS - 宇生月伴推出的文本转语音大模型

Luna-TTS 是上海交大系初创公司宇生月伴(VUI Labs)自研的文本转语音大模型。模型摒弃主流自回归路线,采用 Masked Diffusion 掩码扩散架构,基于 Qwen3-0.6...

Luna-TTS是什么

Luna-TTS 是上海交大系初创公司宇生月伴(VUI Labs)自研的文本转语音大模型。模型摒弃主流自回归路线,采用 Masked Diffusion 掩码扩散架构,基于 Qwen3-0.6B 训练,配合自研 Luna-Codec,在中英日韩 100 万小时语音数据上预训练。模型在 Hugging Face TTS Arena V2 盲听榜登顶全球第一,Artificial Analysis 权威榜位列第三、超越谷歌。

Luna-TTS的主要功能

  • 多语言语音合成:支持中英日韩四种语言的高质量语音合成,音色自然、韵律流畅,适用于有声书与播客等长文本场景。
  • 情绪与副语言控制:可精确控制 neutral、sad、surprised 等情绪,及呼吸、停顿、笑声、叹气等副语言细节。
  • 实时流式输出:Luna-TTS Realtime 支持块级流式生成,首块延迟仅 41.6ms,端到端 RTF 低至 0.024。
  • 音色一致与克隆:支持音色克隆与保持,长文本生成过程中音色稳定不漂移。

Luna-TTS的技术原理

  • Masked Diffusion 架构:放弃主流自回归路线,将语音 RVQ Token 网格作为整体,通过多轮迭代并行预测被掩码的位置,生成顺序由模型动态决定,避免误差沿前缀累积。
  • 自研 Luna-Codec:将 24kHz 波形编码为 25Hz、8 码本的离散 Token 网格,码率仅 2.2kbps,采用因果编解码器实现流式、帧同步输出。
  • Qwen3 主干模型:基于 Qwen3-0.6B 继续训练,标准版使用双向注意力,Realtime 版改用块级因果注意力并配合 KV Cache 实现流式生成。
  • 大规模训练与强化学习:在中英日韩四种语言上进行约 100 万小时预训练与 10 万小时高质量退火,将 GRPO 强化学习迁移到扩散去噪轨迹上,优化内容正确性与说话人一致性。

Luna-TTS的项目地址

  • 项目官网:https://vuilabs-ai.github.io/luna-tts/
  • arXiv技术论文:https://arxiv.org/pdf/2608.11593

Luna-TTS的同类竞品对比

对比维度 Luna-TTS ElevenLabs Eleven v3
开发团队 宇生月伴 VUI Labs(中国) ElevenLabs(美国)
技术路线 Masked Diffusion 掩码扩散 自回归生成
模型参数 0.6B 未公开
语言支持 中英日韩 多语言(32+)
情绪控制 精细控制(neutral/sad/surprised 等) 支持情绪与风格调节
副语言细节 呼吸、停顿、笑声、叹气 支持部分副语言
实时版本 Luna-TTS Realtime(RTF 0.024) Turbo v2.5(低延迟)
API 定价 $80.0 / 1M chars $100.0 / 1M chars
TTS Arena V2 第1名(Rating 1574) 第10名(Rating 1176)
Artificial Analysis 第3名(Elo 1220) 第10名(Elo 1176)

Luna-TTS的应用场景

  • 智能客服与电销:替代传统语音机器人,提供自然、带情绪变化的对话体验,支持实时流式响应,降低用户挂断率。
  • 有声内容与播客:为有声书、新闻播报、知识类播客生成高质量长文本语音,保持音色一致性与叙事韵律,支持多情绪段落切换。
  • 在线教育与培训:为课程讲解、语言学习提供清晰标准的多语言发音,支持情绪调节以匹配教学内容(如鼓励、严肃、温和)。
  • 车载与智能硬件:通过 Luna-TTS Realtime 低延迟特性,为车载导航、智能家居、耳机助手提供即时、自然的语音交互入口。
  • 实时同传与会议助手:结合语音理解能力,在跨语言会议场景中实现低延迟、高自然度的语音翻译输出,提升沟通效率。