ニュース
ByteDanceは、大規模な音声・映像全二重通信モデルであるSeedRealtimeを発表した。
ByteDanceのSeedプラットフォームは、ネイティブな全二重音声・動画モデルであるSeedRealtimeを発表しました。統一されたアーキテクチャに基づき、音声、動画、テキストをネイティブに統合することで、「見る、聞く、話す」というリアルタイムのマルチモーダルなインタラクションを実現します。このモデルは、音声と動画の同時理解、能動的なインタラクション、スムーズな対話リズムという3つの主要な機能を備えています。エンドツーエンドの評価では、対話リズムの問題がカスケード型モデルと比較して半減することが示されています。