AB
AiBoss站
project

Gemini 3.5 Transcribe - 谷歌推出的最新语音转文本模型

Gemini 3.5 Transcribe 是 Google 推出的最新语音转文本模型,支持实时流式和预录音频处理两种模式,前者通过 Live API 实现亚秒级延迟,后者支持说话人归属...

Gemini 3.5 Transcribe是什么

Gemini 3.5 Transcribe 是 Google 推出的最新语音转文本模型,支持实时流式和预录音频处理两种模式,前者通过 Live API 实现亚秒级延迟,后者支持说话人归属与词级时间戳。Gemini 3.5 Transcribe 能自动清理填充词与自我纠正、识别 85 种以上语言及实时语言切换、自定义专业词汇,词错误率低至 2.6%,支持调用其他 Gemini 模型完成图像生成等复杂任务。

Gemini 3.5 Transcribe的主要功能

  • 实时流式转录:通过 Live API 提供亚秒级延迟的连续双向语音转文本服务。
  • 预录音频转写:通过 Interactions API 为录音文件提供带说话人归属和词级时间戳的精确转录。
  • 智能文本清理:自动去除”嗯””啊”等填充词,修正自我纠正语句,并输出格式化文本。
  • 自定义词汇适配:根据用户提供的专业术语和特殊拼写调整转录结果,准确识别邮政编码、订单号等字母数字组合。
  • 多语言自动检测:支持 85 种以上语言的自动识别与转录,并能处理实时语言切换和多种口音方言。
  • 多说话人区分:在预录音频中准确归属最多三位说话人的发言内容。
  • 跨模型功能调用:在转录过程中可调用其他 Gemini 模型执行图像生成、文件分析等复杂任务。
  • 屏幕上下文融合:结合设备屏幕内容和对话历史提升特定场景下的转录准确度。

Gemini 3.5 Transcribe的技术原理

  • 端到端音频理解:模型直接从原始音频波形生成文本,避免中间表示引入的误差累积,同时保留语音中的语调、停顿等副语言信息用于语义消歧。
  • 原生多模态融合:基于 Gemini 3.5 统一架构,音频与文本在共享的 Transformer 注意力空间中进行联合编码,使模型能建立声学特征与语义概念的直接映射。
  • 上下文感知推理:通过长上下文窗口同时处理语音信号、屏幕截图文本和对话历史,用交叉注意力机制动态加权相关上下文,提升专有名词、文件名称和领域术语的识别精度。
  • 增量流式解码:采用自适应分块与投机解码策略,在音频输入持续到达的同时进行局部语义整合,平衡低延迟需求与输出稳定性,支持双向交互中的即时响应与打断处理。

如何使用Gemini 3.5 Transcribe

  • 开发者接入:通过 Gemini API 在 Google AI Studio 或 Gemini Enterprise Agent Platform 调用模型。
  • 实时语音交互:用 Live API 调用 gemini-3.5-transcribe-live 实现双向流式转录。
  • 录音文件处理:用 Interactions API 调用 gemini-3.5-transcribe 进行带时间戳的离线转写。
  • macOS 桌面端:在 Gemini macOS 应用中直接用语音输入、编辑文本并调用其他模型功能。
  • Android 输入法:在 Gboard 中开启 Rambler 功能,语音输入自动清理并支持语音改稿。
  • Chrome 浏览器:即将支持在任意网页输入框中语音输入与打字。
  • 企业部署:通过 Gemini Enterprise Agent Platform 集成至客服与内部工作流。
  • 第三方框架:借助 Agora、LiveKit、Vercel 等已接入 Live API 的平台快速搭建语音应用。

Gemini 3.5 Transcribe的核心优势

  • 转录精度领先:流式场景词错误率低至 4.0%,非流式低至 2.6%,在嘈杂环境中仍能准确捕获字母数字实体。
  • 延迟大幅优化:相比前代 Chirp 3,最终转录交付时间缩短 70%,实时流式响应达到亚秒级。
  • 智能语义清理:自动去除填充词、修正自我纠正语句,并输出可直接使用的格式化文本。
  • 多语言无缝切换:自动识别并转录 85 种以上语言,支持对话中的实时语言切换与多方言口音适配。
  • 说话人精准归属:预录音频支持最多三位说话人的发言区分,并附带词级时间戳便于回溯定位。
  • 屏幕上下文感知:结合设备屏幕内容与对话历史,显著提升文件名称、专业术语和活跃文档的识别准确度。
  • 跨模型任务协同:内置 Function Calling 能力,可在转录过程中调用其他 Gemini 模型完成图像生成、文件分析等复杂操作。

Gemini 3.5 Transcribe的项目地址

  • 项目官网:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/

Gemini 3.5 Transcribe的同类竞品对比

对比维度 Gemini 3.5 Transcribe OpenAI GPT-4o-transcribe
定位 智能语音转录模型,支持实时流式与预录音频 GPT-4o 架构的专用转录模型,API 托管服务
词错误率 WER 流式 4.0% / 非流式 2.6% 约 2.5%(干净音频,行业领先)
实时流式延迟 亚秒级,原生双向连续流式 支持流式,通过 Realtime API 实现
智能文本清理 自动去除填充词、修正自我纠正、格式化输出 不支持,输出原始口语化文本
说话人归属 原生支持最多 3 人区分 + 词级时间戳 不支持原生,需额外调用 diarize 端点

Gemini 3.5 Transcribe的应用场景

  • 实时会议智能纪要:在多人会议中实时流式转录,自动区分说话人、清理口语填充词,调用 Gemini 模型即时生成会议摘要与待办事项。
  • 多语言客服语音助手:通过 Live API 构建亚秒级延迟的语音客服系统,自动识别客户语言并实时切换,结合自定义词汇准确识别订单号、产品型号等关键信息。
  • 医疗与法律口述记录:医生或律师通过语音口述病历、庭审记录,模型自动清理自我纠正语句并格式化专业术语,输出可直接归档的标准文档。
  • 跨语言实时字幕与翻译:为直播、视频会议提供多语言实时字幕,用 85+ 语言自动检测能力,结合实时语言切换实现无缝跨语言沟通。
  • 语音驱动编程与办公自动化:在 Google AI Studio 或 Gemini macOS 应用中,开发者通过语音描述需求即可生成代码,办公人员语音指令调用屏幕上下文完成跨应用文件总结与图像生成。