project
Gemini 3.5 Transcribe - Googleの最新音声認識モデル
Gemini 3.5 Transcribeは、Googleの最新の音声認識モデルであり、リアルタイムストリーミングと事前録音音声処理モードの両方をサポートしています。前者はLive APIを通じて1秒未満の低遅延を実現し、後者は話者識別機能をサポートしています。
Gemini 3.5 Transcribeとは何ですか?
Gemini 3.5 Transcribeは、Googleの最新の音声認識モデルで、リアルタイムストリーミングと事前録音音声処理の両方をサポートしています。前者はLive APIを通じて1秒未満の低遅延を実現し、後者は話者識別と単語レベルのタイムスタンプをサポートしています。Gemini 3.5 Transcribeは、フィラーワードの自動除去と自己修正、85以上の言語の認識とリアルタイムでの言語切り替え、専門用語のカスタマイズ、2.6%という低単語エラー率の達成、そして画像生成などの複雑なタスクを実行するための他のGeminiモデルの呼び出しをサポートしています。
Gemini 3.5 Transcribeの主な機能
-
リアルタイムフロー転写Live APIを介して、1秒未満の低遅延で双方向の音声認識サービスを継続的に提供します。
-
録音済み音声の文字起こしInteractions API を介して、話者情報と単語レベルのタイムスタンプを含む音声ファイルの正確な文字起こしを提供します。
-
インテリジェントなテキストクリーンアップ「えーと」「あー」などの間投詞を自動的に削除し、自己修正された文を修正し、書式設定されたテキストを出力します。
-
カスタム語彙の適応文字起こし結果は、ユーザーが指定した専門用語や特殊な綴りに基づいて調整され、郵便番号や注文番号などの英数字の組み合わせを正確に識別します。
-
多言語自動検出85以上の言語の自動認識と文字起こしをサポートし、リアルタイムでの言語切り替えや複数のアクセント・方言にも対応できます。
-
複数の話者を区別する録音済みの音声に含まれる最大3人の話者の発言を正確に識別します。
-
クロスモデル関数呼び出し文字起こしの過程で、画像生成や文書分析といった複雑なタスクを実行するために、他のGeminiモデルを呼び出すことができる。
-
画面コンテキストのブレンド特定のシナリオにおいて、デバイス画面の内容と会話履歴を組み合わせることで、文字起こしの精度を向上させます。
Gemini 3.5の技術的原理
- エンドツーエンドの音声理解このモデルは、元の音声波形から直接テキストを生成するため、中間表現によって生じるエラーの蓄積を回避しつつ、意味の曖昧さを解消するために、発話の抑揚や休止などの副言語情報を保持します。
- ネイティブマルチモーダル融合Gemini 3.5の統合アーキテクチャに基づき、音声とテキストは共有のTransformerアテンション空間に共同でエンコードされ、モデルが音響特徴と意味概念間の直接的なマッピングを確立することを可能にする。
- 文脈認識推論このシステムは、長いコンテキストウィンドウを通して音声信号、スクリーンショットのテキスト、対話履歴を同時に処理し、相互注意機構を用いて関連するコンテキストに動的に重み付けすることで、固有名詞、ファイル名、ドメイン用語の認識精度を向上させます。
- インクリメンタルストリーミングデコード音声入力が継続的に到着する間、適応型ブロック分割と投機的デコード戦略を採用して局所的な意味統合を実行することで、低遅延と出力安定性の必要性のバランスを取り、双方向のやり取りにおけるリアルタイム応答と中断処理をサポートします。
Gemini 3.5 Transcribeの使い方
-
開発者アクセスGemini API を介して、Google AI Studio または Gemini Enterprise Agent Platform でモデルを呼び出します。
-
リアルタイム音声対話Live API を使用して呼び出します
gemini-3.5-transcribe-live双方向ストリーミング文字起こしを実現します。 -
音声ファイルの処理Interactions API を使用して呼び出します
gemini-3.5-transcribeタイムスタンプ付きでオフライン文字起こしを実行します。 -
macOSデスクトップ版Gemini macOSアプリでは、音声を使ってテキストの入力、編集、その他のモデル機能の呼び出しを直接行うことができます。
-
Androidの入力方法GboardのRambler機能を有効にすると、音声入力の自動クリーンアップと音声編集のサポートが利用できます。
-
Chromeブラウザまもなく、あらゆるウェブページの入力ボックスで音声入力と文字入力がサポートされるようになります。
-
エンタープライズ展開Gemini Enterprise Agent Platformを通じて、顧客サービスおよび社内ワークフローに統合します。
-
サードパーティフレームワークAgora、LiveKit、Vercelなど、Live APIを統合したプラットフォームを使用して、音声アプリケーションを迅速に構築できます。
Gemini 3.5 Transcribeの主な利点
-
最高レベルの文字起こし精度エラー率はストリーミングシナリオで4.0%と低く、非ストリーミングシナリオでは2.6%と低く、ノイズの多い環境でも英数字を正確に認識できます。
-
レイテンシーが大幅に最適化されました前機種のChirp 3と比較して、最終的な文字起こしの配信時間は70%短縮され、リアルタイムストリーミングの応答速度は1秒未満に達します。
-
インテリジェントな意味的クリーンアップ不要な単語を自動的に削除し、自己修正文を修正し、そのまま使用できる整形済みテキストを出力します。
-
シームレスな多言語切り替え85以上の言語を自動的に認識して文字起こしし、会話中のリアルタイム言語切り替えや多方言アクセントへの適応をサポートします。
-
話者の正確な帰属事前に録音された音声は、最大3人の話者の発言を区別することを可能にし、単語レベルのタイムスタンプが含まれているため、簡単に遡って確認することができます。
-
画面コンテキスト認識デバイスの画面コンテンツと会話履歴を組み合わせることで、ファイル名、専門用語、およびアクティブなドキュメントの認識精度が大幅に向上します。
-
クロスモデルタスクコラボレーション組み込みの関数呼び出し機能により、文字起こし中に他のGeminiモデルを呼び出して、画像生成やファイル分析などの複雑な操作を実行できます。
ジェミニ3.5トランスクライブプロジェクトアドレス
- プロジェクト公式サイト:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
Gemini 3.5 Transcribeと類似の競合製品との比較
| 比較対象寸法 | Gemini 3.5 Transcribe | OpenAI GPT-4o-transcribe |
|---|---|---|
| 位置 | リアルタイムストリーミングと事前録音音声に対応した、高度な音声文字起こしモデル。 | GPT-4oアーキテクチャ固有の文字起こしモデル、APIホスティングサービス |
| 単語誤り率(WER) | フローサイトメトリー 4.0% / 非フローサイトメトリー 2.6% | 約2.5%(クリーンオーディオ、業界トップ) |
| リアルタイムストリーミングの遅延 | サブ秒単位のネイティブ双方向連続ストリーミング | リアルタイムAPIを介して実装されたストリーミングをサポートしています。 |
| インテリジェントなテキストクリーンアップ | 不要な単語の自動削除、自己修正、および書式設定済み出力。 | サポートされていません。生の会話形式のテキストを出力します。 |
| 話者の特定 | 最大3人までの人物識別と単語レベルのタイムスタンプをネイティブでサポート | ネイティブサポートは提供されていません。diarizeエンドポイントは別途呼び出す必要があります。 |
Gemini 3.5 Transcribeの応用事例
-
リアルタイム会議のインテリジェント議事録複数人参加の会議におけるリアルタイムストリーミング文字起こし。発言者を自動的に識別し、不要な単語を削除し、Geminiモデルを使用して会議の要約とToDoリストを即座に生成します。
-
多言語対応カスタマーサービス音声アシスタントLive API を介して、1秒未満の遅延で音声カスタマーサービスシステムを構築し、顧客の言語を自動認識してリアルタイムで切り替え、カスタム語彙を組み合わせることで注文番号や製品モデルなどの重要な情報を正確に識別します。
-
医療および法律に関する口頭記録医師や弁護士は、医療記録や裁判記録を口述筆記することができ、このモデルは自動的に自身の記述を整理・修正し、専門用語を適切な形式に整えて、直接アーカイブできる標準的な文書を出力する。
-
多言語対応のリアルタイム字幕作成と翻訳ライブストリーミングやビデオ会議向けに、85以上の言語を自動検出する機能とリアルタイム言語切り替え機能を備えた多言語リアルタイム字幕を提供し、シームレスな多言語コミュニケーションを実現します。
-
音声操作によるプログラミングとオフィスオートメーションGoogle AI StudioやGemini macOSアプリケーションでは、開発者は音声で要件を説明することでコードを生成でき、オフィスワーカーは音声コマンドを使用して画面コンテキストを呼び出し、アプリケーション間のファイル要約や画像生成を完了できます。