ニュース
アリババのTongyiデュアルモード音声モデルであるFun-CosyVoice 3.5とFun-AudioGen-VDがリリースされました。
Tongyi Labsは、FreeStyleコマンド制御パラダイムの先駆けとなる2つの音声生成モデル、Fun-CosyVoice3.5とFun-AudioGen-VDをリリースしました。ユーザーは、固定ラベルに頼ることなく、自然な言語でトーン、感情、シーンなどの詳細を表現できます。Fun-CosyVoice3.5は、多言語再現と細かな表現制御をサポートし、タイ語やインドネシア語を含む4つの新しいあまり一般的でない言語を追加し、珍しい文字の誤読率を5.3%に低減しました。Fun-AudioGen-VDは、エンドツーエンドのサウンドデザインを実現し、文字固有の音色を生成し、環境音響効果をシミュレートします。