AB
AiBoss站
快讯

谷歌发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

谷歌 DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,主打近实时推理、视觉理解与后台任务执行,并已开始通过 Gemini API、Google AI Studio 等渠道分批推出。

核心事实

据谷歌 DeepMind 官方博客消息,谷歌发布了两款实时语音对话模型:Gemini 3.8 LiveGemini 3.8 Live Extended Thinking。官方称二者是其在实时对话方向上的最新模型,重点提升了智能水平与并行推理能力。

按官方描述,Gemini 3.8 Live 面向规模化与成本效率,结合对话智能、流畅对话与视觉接地能力;Gemini 3.8 Live Extended Thinking 则面向高复杂度任务,强调多步推理。两款模型均支持在对话过程中于后台执行工具与 API 调用,并可在对话中途自动检测与切换其声称支持的 97 种语言。

背景与影响

官方表示,这些模型面向开发者与企业提供构建语音智能体的基础能力,同时也会用于 Gemini 应用、Google Workspace 与搜索等场景。博客提到,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 上取得 82.6 分,在 τ-Voice 上为 68.6%,在 Sierra 的 τ-Voice-banking 基准上为 35.1%,Big Bench Audio 为 97.7%;Gemini 3.8 Live 在 Speech Agent Arena 中位列第二。上述数字均来自官方博客,尚未见第三方独立复现。

生态方面,官方称 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 等平台通过 Gemini Live API 支持开发者构建语音界面,并提到 Salesforce、Genspark、Lumeris 等合作方。官方还表示所有 AI 生成的音频均嵌入 SynthID 水印。

限制与来源

推出节奏方面,官方称两款模型自发布当日起分批推出:开发者可通过 Gemini API 与 Google AI Studio 使用;企业侧在 Gemini Enterprise 中为私密预览,并称将陆续登陆 Gemini Enterprise for Customer Experience;面向普通用户,3.8 Live 进入 Search Live,3.8 Live Extended Thinking 进入 Gemini Live,并在 Workspace 的 Docs、Gmail、Keep 中面向部分订阅用户开放。

需要说明的是,具体可用地区、账号类型、语言支持范围与定价,官方博客未给出完整清单,且可能随时调整,请以谷歌官网当前信息为准。本文内容整理自 deepmind.google 博客,未做独立测试,相关性能数据与合作伙伴表述均引自该来源。