快讯
谷歌发布 Gemini 3.8 Live with Live Avatar,为企业级对话加入实时视觉形象
谷歌 DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为企业用户提供带口型同步与表情的虚拟形象交互,目前已在 Gemini Enterprise 上线。
核心事实
据谷歌 DeepMind 官方博客消息,谷歌发布了 Gemini 3.8 Live with Live Avatar。该功能将低延迟流式视频与实时对话模型原生结合,使对话式 AI 具备近实时的视觉形象,可呈现口型同步、自然表情与流畅的轮流对话。官方表示,该功能自发布之日起在 Gemini Enterprise 中提供,并附有 API 文档供开发者参考。
背景与影响
该发布紧接上一周的 Gemini 3.8 Live 之后。官方称,Live Avatar 可同时处理视觉与音频输入,并支持异步工具调用——在对话持续进行的同时于后台触发工具调用并获取数据,以处理较复杂的任务。官方还表示该功能具备原生多语言语音到语音同步能力,可在 97 种语言之间切换,并动态调整口型与表情。除预设形象库外,企业可基于参考图像定制形象,但官方说明定制形象创建目前仅通过企业白名单(allowlisting)开放。在安全方面,官方称所有输出均以 SynthID 水印嵌入音频与视频,并提供了模型卡供查阅。
限制与来源
上述内容来自谷歌 DeepMind 博客,属于厂商自述,本文未做独立验证,也未获得可核实的实测数据或性能指标。功能可用范围、语言支持、定制形象开放条件与账号权限等,均可能随地区与时间变化,请以官网当前信息为准。本文不构成任何投资、法律或其他专业建议。