project
Gemini 3.5 Transcribe - 谷歌推出的最新语音转文本模型
Gemini 3.5 Transcribe 是 Google 推出的最新语音转文本模型,支持实时流式和预录音频处理两种模式,前者通过 Live API 实现亚秒级延迟,后者支持说话人归属...
Gemini 3.5 Transcribe是什么
Gemini 3.5 Transcribe 是 Google 推出的最新语音转文本模型,支持实时流式和预录音频处理两种模式,前者通过 Live API 实现亚秒级延迟,后者支持说话人归属与词级时间戳。Gemini 3.5 Transcribe 能自动清理填充词与自我纠正、识别 85 种以上语言及实时语言切换、自定义专业词汇,词错误率低至 2.6%,支持调用其他 Gemini 模型完成图像生成等复杂任务。
Gemini 3.5 Transcribe的主要功能
-
实时流式转录:通过 Live API 提供亚秒级延迟的连续双向语音转文本服务。
-
预录音频转写:通过 Interactions API 为录音文件提供带说话人归属和词级时间戳的精确转录。
-
智能文本清理:自动去除”嗯””啊”等填充词,修正自我纠正语句,并输出格式化文本。
-
自定义词汇适配:根据用户提供的专业术语和特殊拼写调整转录结果,准确识别邮政编码、订单号等字母数字组合。
-
多语言自动检测:支持 85 种以上语言的自动识别与转录,并能处理实时语言切换和多种口音方言。
-
多说话人区分:在预录音频中准确归属最多三位说话人的发言内容。
-
跨模型功能调用:在转录过程中可调用其他 Gemini 模型执行图像生成、文件分析等复杂任务。
-
屏幕上下文融合:结合设备屏幕内容和对话历史提升特定场景下的转录准确度。
Gemini 3.5 Transcribe的技术原理
- 端到端音频理解:模型直接从原始音频波形生成文本,避免中间表示引入的误差累积,同时保留语音中的语调、停顿等副语言信息用于语义消歧。
- 原生多模态融合:基于 Gemini 3.5 统一架构,音频与文本在共享的 Transformer 注意力空间中进行联合编码,使模型能建立声学特征与语义概念的直接映射。
- 上下文感知推理:通过长上下文窗口同时处理语音信号、屏幕截图文本和对话历史,用交叉注意力机制动态加权相关上下文,提升专有名词、文件名称和领域术语的识别精度。
- 增量流式解码:采用自适应分块与投机解码策略,在音频输入持续到达的同时进行局部语义整合,平衡低延迟需求与输出稳定性,支持双向交互中的即时响应与打断处理。
如何使用Gemini 3.5 Transcribe
-
开发者接入:通过 Gemini API 在 Google AI Studio 或 Gemini Enterprise Agent Platform 调用模型。
-
实时语音交互:用 Live API 调用
gemini-3.5-transcribe-live实现双向流式转录。 -
录音文件处理:用 Interactions API 调用
gemini-3.5-transcribe进行带时间戳的离线转写。 -
macOS 桌面端:在 Gemini macOS 应用中直接用语音输入、编辑文本并调用其他模型功能。
-
Android 输入法:在 Gboard 中开启 Rambler 功能,语音输入自动清理并支持语音改稿。
-
Chrome 浏览器:即将支持在任意网页输入框中语音输入与打字。
-
企业部署:通过 Gemini Enterprise Agent Platform 集成至客服与内部工作流。
-
第三方框架:借助 Agora、LiveKit、Vercel 等已接入 Live API 的平台快速搭建语音应用。
Gemini 3.5 Transcribe的核心优势
-
转录精度领先:流式场景词错误率低至 4.0%,非流式低至 2.6%,在嘈杂环境中仍能准确捕获字母数字实体。
-
延迟大幅优化:相比前代 Chirp 3,最终转录交付时间缩短 70%,实时流式响应达到亚秒级。
-
智能语义清理:自动去除填充词、修正自我纠正语句,并输出可直接使用的格式化文本。
-
多语言无缝切换:自动识别并转录 85 种以上语言,支持对话中的实时语言切换与多方言口音适配。
-
说话人精准归属:预录音频支持最多三位说话人的发言区分,并附带词级时间戳便于回溯定位。
-
屏幕上下文感知:结合设备屏幕内容与对话历史,显著提升文件名称、专业术语和活跃文档的识别准确度。
-
跨模型任务协同:内置 Function Calling 能力,可在转录过程中调用其他 Gemini 模型完成图像生成、文件分析等复杂操作。
Gemini 3.5 Transcribe的项目地址
- 项目官网:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
Gemini 3.5 Transcribe的同类竞品对比
| 对比维度 | Gemini 3.5 Transcribe | OpenAI GPT-4o-transcribe |
|---|---|---|
| 定位 | 智能语音转录模型,支持实时流式与预录音频 | GPT-4o 架构的专用转录模型,API 托管服务 |
| 词错误率 WER | 流式 4.0% / 非流式 2.6% | 约 2.5%(干净音频,行业领先) |
| 实时流式延迟 | 亚秒级,原生双向连续流式 | 支持流式,通过 Realtime API 实现 |
| 智能文本清理 | 自动去除填充词、修正自我纠正、格式化输出 | 不支持,输出原始口语化文本 |
| 说话人归属 | 原生支持最多 3 人区分 + 词级时间戳 | 不支持原生,需额外调用 diarize 端点 |
Gemini 3.5 Transcribe的应用场景
-
实时会议智能纪要:在多人会议中实时流式转录,自动区分说话人、清理口语填充词,调用 Gemini 模型即时生成会议摘要与待办事项。
-
多语言客服语音助手:通过 Live API 构建亚秒级延迟的语音客服系统,自动识别客户语言并实时切换,结合自定义词汇准确识别订单号、产品型号等关键信息。
-
医疗与法律口述记录:医生或律师通过语音口述病历、庭审记录,模型自动清理自我纠正语句并格式化专业术语,输出可直接归档的标准文档。
-
跨语言实时字幕与翻译:为直播、视频会议提供多语言实时字幕,用 85+ 语言自动检测能力,结合实时语言切换实现无缝跨语言沟通。
-
语音驱动编程与办公自动化:在 Google AI Studio 或 Gemini macOS 应用中,开发者通过语音描述需求即可生成代码,办公人员语音指令调用屏幕上下文完成跨应用文件总结与图像生成。