project
Fun-CineForge - Alibaba Tongyiが開発した、映画グレードのオープンソース・マルチモーダル吹き替えモデル。
Fun-CineForgeは、Tongyi Labsがオープンソース化した初の映画グレードのマルチモーダル吹き替えモデルです。CosyVoice3をベースに構築され、革新的な「時間的モダリティ」を導入することで、正確な音声と映像の同期を実現しています。このモデルは、モノローグ、ナレーション、対話、複数人シーンなどに対応しています。
Fun-CineForgeとは何ですか?
Fun-CineForgeは、Tongyi Labがオープンソース化した初の映画グレードのマルチモーダル吹き替えモデルです。CosyVoice3をベースに、革新的な「時間的モダリティ」を導入することで、正確な音声と映像の同期を実現しています。このモデルは、モノローグ、ナレーション、対話、複数人シーンに対応し、リップシンク、感情表現、音色の一貫性、時間軸の整合性という4つの主要な課題を解決します。Fun-CineForgeには、350本以上の映画やテレビシリーズを網羅したオープンソースのCineDubデータセット構築プロセスが付属しており、中国語の文字エラー率はわずか1.49%と低く、顔の遮蔽やカメラの切り替えといった複雑なシーンでも高品質な吹き替えを維持します。
Fun-CineForgeの主な機能
-
リップシンクこのモデルは、合成音声と動画内のキャラクターの口の動きとの高い同期をサポートし、正確な音声と映像の同期を実現します。
-
感情表現キャラクターの顔の特徴とコマンドの説明に基づいて、擬人化された表現と感情表現の自由な制御を実現している。
-
音色クローニングこのモデルは、入力音声の音色特性を参照することで、非常に類似したパーソナライズされた音声を合成することができる。
-
時刻合わせタイムスタンプに基づいて音声の開始と終了を制御し、話者が隠れていても適切なタイミングで音声を生成できる。
-
マルチシナリオ適応モノローグ、ナレーション、二人の対話、複数人の対話など、複雑な映画やテレビ番組の吹き替えシナリオに対応しています。
Fun-CineForgeの技術的原理
- マルチモーダル融合アーキテクチャこのモデルは、4種類の情報を同時に処理できます。視覚情報は唇の動きや表情を学習し、テキスト情報は登場人物のセリフの内容や感情的な手がかりを提供し、音声情報は予測対象として機能し、時間情報は発話のタイミングを制御し、話者の識別を行います。これら4つの情報が互いに補完し合うことで、正確な吹き替えを実現します。
- 時間的モード革新今回初めて、時間情報が独立した情報要素として吹き替えモデルに導入されました。開始時刻、継続時間、話者識別情報といった強力な教師信号を用いることで、モデルは「いつ、誰が話しているのか」を理解し、顔が隠れたりカメラが切り替わったりした場合でも、発話期間を正確に特定することができます。
- データ駆動型トレーニングこのモデルは、自動的に構築されるCineDubデータセットで学習されます。このデータセットは、音声分離、テキスト転写、話者分離などの処理を経て、映画やテレビ番組の素材から抽出されます。フレームレベルのリップデータ、ミリ秒レベルのタイムスタンプ、感情注釈が含まれており、モデルにマルチモーダルな監視信号を提供します。
Fun-CineForgeプロジェクトのアドレス
- プロジェクト公式サイト:https://funcineforge.github.io/
- GitHubリポジトリ:https://github.com/FunAudioLLM/FunCineForge
- ハギングフェイスモデルライブラリ:https://huggingface.co/FunAudioLLM/Fun-CineForge
Fun-CineForge アプリケーションシナリオ
-
映画・テレビのポストプロダクション映画やテレビシリーズの多言語吹き替えを提供し、口の動きや感情を正確に一致させ、カメラの切り替えや顔の隠蔽などの複雑なシーンにも対応します。
-
アニメーションとゲーム開発アニメーションキャラクターの音声と映像を同期させ、複数のキャラクターの声を区別できるようにし、ゲームのストーリーにおける声優のコストを削減します。
-
コンテンツのローカライズ海外の映画やテレビ番組を他言語に翻訳・吹き替えし、オリジナル作品の感情的なリズムを維持するとともに、ナレーションやモノローグといった長尺部分の翻訳にも対応している。
-
短い動画広告このモデルは、音声付き動画のナレーションを迅速に生成し、シーンの感情に合わせて声のトーンを調整し、特定の音色を複製してブランドの一貫性を維持することができます。
-
アクセシビリティこのモデルは、無音の動画に同期したナレーションを生成することができ、視覚障害のあるユーザーが映像を理解するのを助け、音声と字幕の正確なマッチングを実現します。