project
CogSound - Zhipu AIによる最新のサウンドエフェクトモデル
Zhipu AIの最新サウンドエフェクトモデル「CogSound」は、無音動画に魅力的なサウンドエフェクトを追加します。GLM-4Vの動画理解機能に基づき、CogSoundは動画に込められた意味や感情を正確に識別・理解し、無音動画のサウンドを向上させます。
CogSoundとは何ですか?
Zhipu AIの最新サウンドエフェクトモデル「CogSound」は、無音動画に魅力的なサウンドエフェクトを追加します。GLM-4Vの動画理解機能をベースに、CogSoundは動画の背後にある意味や感情を正確に識別・理解し、それに合った音声コンテンツを無音動画に追加します。爆発音、流水音、楽器の音、動物の鳴き声、乗り物の音など、より複雑なサウンドエフェクトを生成できます。このモデルのリリースは、Zhipu AIの動画生成における大きな進歩であり、特に動画のマルチモーダル体験を向上させ、没入感とリアリティを高める上で重要な意味を持ちます。
CogSoundの主な機能
- 映像に合った効果音を生成する。:CogSoundは映像に合わせた効果音を生成し、より豊かな視聴覚体験を提供します。
- 4K超高精細ビデオ生成に対応:10秒間の4K解像度、60フレームの超高精細ビデオと、それに合わせた効果音の生成をサポートしています。
- さまざまな再生ニーズに対応:様々な再生ニーズに対応するため、あらゆる比率での動画生成をサポートし、これらの動画に合わせた効果音も生成します。
- マルチチャンネルビデオ生成:同じコマンド/画像で、それぞれに対応する効果音付きの動画を4つ同時に生成できます。
- 動画生成体験を向上させる:CogSoundは効果音を追加することで、ビデオコンテンツの没入感とリアリティを高め、ビデオ制作体験をより完全で鮮やかなものにします。
- 効果音機能のパブリックベータ版:CogSoundのサウンドエフェクト機能は、まもなく一般向けベータテストが開始されます(11月末頃を予定)。ユーザーは以下の機能を利用できるようになります。 志浦清英 CogSoundが提供するサウンド生成サービスを体験してください。
CogSoundの技術的特徴
- Unetベースの潜在空間拡散:
- 高効率オーディオ生成CogSoundは、潜在拡散モデルを用いて、音声生成プロセスを高次元の元の空間から低次元の潜在空間へと変換することで、計算の複雑さを軽減します。
- 最適化されたU-Net構造拡散モデルの中核となるフレームワークとして、U-Net構造は、生成される音声の高品質と効率性を維持しながら、音声合成プロセスのパフォーマンスを向上させるように最適化されています。
- ブロックベースの時間的アライメントによるクロスアテンション:
- 音声機能と動画機能の相関関係を強化するCogSoundは、ブロック単位の時間的アライメントによる相互注意メカニズムを導入することで、長尺のビデオシーケンスと音声特徴間の特徴マッチングを最適化することができます。
- 正確な音声および映像マッピングフレームレベルのビデオ特徴とオーディオ特徴の関係性を学習することで、正確なオーディオ・ビデオマッピングを実現し、すべてのフレームが楽譜上の適切な位置を見つけ、すべての楽譜がビデオに正確に反映されるようにすることができます。
- 回転位置エンコーディング:
- 時系列モデリングの精度を向上させるCogSoundは回転位置符号化技術を統合し、シーケンス内の各位置に固有の識別子を提供し、位置間の相対的な関係を捉えることで、時間的な一貫性を向上させます。
- 継続性と自然な移行回転位置符号化は、音声シーケンスの連続性と自然な遷移を保証し、長尺の連続タスクを処理する際に音声生成における「途切れ」や「ずれ」を回避します。
CogSoundのアプリケーションシナリオ
- 動画コンテンツ制作これにより、動画コンテンツ制作者は、動画の表現力を高めるためのより幅広い効果音を利用できるようになります。
- 広告制作広告動画に適切な効果音を加えることで、広告の魅力と記憶に残りやすさを高めることができる。
- 映画やテレビ番組のポストプロダクション映画やテレビのポストプロダクションにおいて、映像に対応する音響効果を提供することで、制作効率と品質を向上させる。