ニュース
GoogleがGemini 3.5 Transcribeをリリース
Googleは、リアルタイムストリーミングと録音ファイルの両方に対応したAPIを提供し、85以上の言語をサポートする音声認識モデル「Gemini 3.5 Transcribe」をリリースした。
Googleは、音声認識技術であるGemini 3.5 Transcribeをリリースし、Gemini APIおよびエンタープライズエージェントプラットフォームを通じて一般向けプレビュー版として提供を開始しました。
このモデルは、gemini-3.5-transcribe-live を使用してリアルタイムのストリーミング音声を処理し、gemini-3.5-transcribe を使用して事前に録音された音声を処理します。話者認識、単語レベルのタイムスタンプ、および 85 以上の言語をサポートしています。
参照:Googleの公式発表