AB
AiBoss站
快讯

AWS 博客:在 SageMaker AI 上部署 Qwen3-TTS 实时个性化语音

AWS 博客介绍如何将公开的 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型从 SageMaker JumpStart 部署到实时推理端点,实现基于短参考录音的语音克隆,并支持跨语言合成。

AWS 博客介绍 Qwen3-TTS 在 SageMaker AI 上的实时语音克隆部署

AWS 官方博客发布技术文章,介绍如何将公开的 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型从 Amazon SageMaker JumpStart 部署到全托管的实时推理端点。据该文章描述,该方案使用 SageMaker Python SDK 构建 JumpStartModel 对象并调用部署方法,由预置服务容器提供模型,无需自行编写推理处理程序;调用时请求体包含目标文本、base64 编码的参考音频及其转写文本,模型据此以参考说话人的音色合成新语音,输出为 24 kHz 音频。

背景与影响

文章称,Qwen3-TTS 由阿里云 Qwen 团队开发,覆盖中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语共 10 种语言,采用 Qwen3-TTS-Tokenizer-12Hz 语音分词器,并支持流式生成以适配低延迟交互场景。其中 Base 变体可基于数秒参考音频完成语音克隆,也可作为微调基础;与从预设音色生成语音的 CustomVoice 变体不同。文章列举的潜在用途包括内容本地化、客服与虚拟助手品牌音色、在线教育与有声书、创意原型以及实时对话式 AI。文章还提到,自托管方式下音频数据保留在用户自己的 AWS 环境中,成本随计算用量而非按字符计费,并可通过 CloudWatch 指标监控与调整端点规模。

限制与来源

上述内容来自 AWS 博客文章,属于厂商技术说明,其中涉及的语言支持范围、模型能力与部署细节均以官方文档及产品页面当前信息为准。文章未给出实测性能数据、定价或地区可用性信息,相关部署是否可用及具体计费方式需查阅 AWS 官网。语音克隆涉及个人声音权益,实际使用前应确认已获得说话人授权并遵守适用法律与平台政策。