ニュース
ZhipuオープンソースGLM-TTS:多重報酬強化学習に基づく制御可能な発音音声合成
Zhipu AIは、産業グレードの音声合成システム「GLM-TTS」をリリースし、オープンソース化しました。2段階生成パラダイムを採用し、3秒間の音声複製と多方言クローニングに対応しています。強化学習による最適化後、文字誤り率(CER)は0.89%に達し、オープンソースモデルの中で最先端(SOTA)の性能を実現しています。主な技術的ブレークスルーとしては、マルチ報酬融合強化学習、洗練された発音制御(Phoneme-in)、そして独自開発の2D-Vocosボコーダーがあり、感情表現と発音精度を大幅に向上させています。