AB
AiBoss
News

谷歌发布 Gemini 3.8 系列语音合成模型

谷歌 DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音合成模型,支持用自然语言提示创建自定义音色、逐行指导表演,并内置 SynthID 水印等安全措施。

核心事实

据谷歌 DeepMind 官方博客消息,谷歌推出两款新的文本转语音模型:Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS。官方称二者是迄今表现力最强的音频生成模型,可在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 中使用。

按官方描述,Flash TTS 侧重深度创作与角色设计,支持用自然语言提示从零创建音色,并对每一句台词的情绪、节奏、口音等做逐行控制;Flash-Lite TTS 则面向高吞吐、成本敏感的批量场景,如大规模配音和语音智能体。官方还提到音色复刻功能,称可基于约 30 秒音频样本重建一致的声音,并配有同意验证、SynthID 水印与 C2PA 凭证等机制。

背景与影响

这两款模型补充了谷歌的 Gemini Audio 系列,该系列此前已包含 3.5 Live Translate、3.5 Transcribe、3.8 Live 与 3.8 Live Extended Thinking。官方称新模型支持超过 100 种语言和方言,并提供 2000 种以上成品音色,同时提到音色混音(voice remixing)功能「即将推出」。

在生态层面,官方表示 Agora、LiveKit、Pipecat、Vercel 等开发者平台可借助 Gemini API 构建语音生成体验,Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang 等公司正在接入新模型。官方还称 Flash TTS 在 Hume AI 的 Voice Design Benchmark 上位列第一,Flash-Lite TTS 在 Overall Quality Index 上位列第二。

限制与来源

需要说明的是,上述基准排名、音色数量与语言覆盖均来自谷歌官方博客的自我表述,尚未获独立第三方确认;博客中提到的部分功能标注为「即将推出」,实际可用范围可能变化。价格、地区可用性、账号与语言支持等细节,请以谷歌官网当前信息为准。本文信息来源于 deepmind.google 的官方博客文章《Gemini 3.8 text-to-speech says hello》。