project
Covo-Audio - テンセントのオープンソースのエンドツーエンド音声モデル
Covo-Audioは、Tencentが開発したオープンソースの70億パラメータを持つエンドツーエンドの音声モデルで、連続音声入力を直接処理し、音声出力を生成することができます。その中核となるイノベーションには、階層的な3モード音声テキストインターリーブアーキテクチャ、インテリジェントな話者デコードなどが含まれます。
Covo-Audioとは何ですか?
Covo-Audioは、Tencentが開発したオープンソースの70億パラメータのエンドツーエンド音声モデルで、連続音声入力を直接処理し、音声出力を生成できます。その中核となるイノベーションには、階層的な3モード音声テキストインターリーブアーキテクチャ、インテリジェンスと話者間の分離技術、ネイティブな全二重対話機能が含まれます。Qwen2.5-7BとWhisperをベースに構築されたこのモデルは、音声対話、音声理解、音声認識などのタスクにおいて最先端(SOTA)のパフォーマンスを実現しています。音声AIのための統一アーキテクチャとして、従来のカスケードシステムにおける遅延やエラーの蓄積を回避し、GPT-4oの音声機能に対する強力なオープンソース代替手段となっています。
Covo-Audioの主な機能
-
会話音声入力と音声出力のエンドツーエンドで、自然な複数ターンの対話型インタラクションをサポートします。
-
音声理解このモデルは、音響的特徴と意味内容を深く統合することで、高忠実度音声信号の包括的な分析を実現します。
-
音声理解このモデルは非音声シナリオへの拡張をサポートしており、環境音、音楽、その他の一般的な音声に対する包括的な知覚能力を備えています。
-
全二重相互作用低遅延でリアルタイムな双方向音声通信をネイティブにサポートしており、自然な割り込みと即時応答を可能にします。
Covo-Audioに関する重要な情報と使用要件
-
開発者テンセント
-
モデルサイズ70億個のパラメータ(7B)
-
建築タイプエンドツーエンドの統合オーディオ言語モデル
-
オープンソース版:Covo-Audio-Chat
-
基本モデルQwen2.5-7B(LLMバックボーン)+Whisper(オーディオエンコーダー)
-
モデルフォーマットセーフテンサー、BF16精度
-
紙:arXiv:2602.09823
-
オープンソースライセンス専用ライセンス(倉庫で確認する必要があります)
-
適用可能なシナリオ研究および実験的応用
-
Python版≥ 3.11(推奨)
-
依存関係のインストール:合格
requirements.txtワンクリックインストール -
コア依存関係:Transformers、BigVGAN、huggingface-hub
-
ハードウェアリソースBF16推論をサポートするGPUが必要です(十分なVRAMを推奨)。ローカル環境とクラウド環境の両方での推論が可能です。
Covo-Audioの主な利点
-
エンドツーエンドの統合アーキテクチャこのモデルは、従来のASR→LLM→TTSというカスケード方式から脱却し、音声同士の直接マッピングを実現することで、エラーの蓄積を排除し、推論の遅延を大幅に削減します。
-
3モード深部融合連続的な音響特徴、離散的な音声トークン、および自然言語テキストを重ね合わせ、交互に配置することにより、高忠実度の韻律と堅牢な意味論の効果的な整合が確立される。
-
知性と音色を切り離すこのモデルは、複数話者による学習を活用して、対話のインテリジェンスを話者の特徴から分離し、柔軟な転送と高品質な音声のパーソナライズされたカスタマイズを可能にします。
-
ネイティブの全二重通信機能このモデルは、低遅延ストリーミング処理を用いてリアルタイムの双方向インタラクションを実現し、自然な割り込みや即時応答をサポートし、人間の会話体験を近似的に再現します。
-
オープンソースエコシステムの価値このモデルは70億個のパラメータを用いて性能とコストのバランスを取り、オープンで包括的な技術スタックによってアプリケーションの敷居を下げ、中国語音声AIのための独立かつ制御可能な基盤ソリューションを提供する。
Covo-Audioの使い方
- 環境準備Python 3.11 環境を作成し、依存関係をインストールするには、`conda create -n covoaudio python=3.11` と `conda activate covoaudio` を実行し、その後 `pip install -r requirements.txt` を使用して依存関係をインストールします。
- コードを取得`git clone https://github.com/Tencent/Covo-Audio.git` を実行して公式の GitHub リポジトリをローカル マシンにクローンし、次に `cd Covo-Audio` コマンドを使用してプロジェクト ディレクトリに移動します。
- モデルをダウンロードHuggingFaceツールをインストールし、`pip install huggingface-hub`と`hf download tencent/Covo-Audio-Chat --local-dir ./covoaudio`を実行して、事前学習済みの重みをダウンロードしてください。モデルは自動的に上書きされるか、指定されたディレクトリに保存されます。
- 設定パスモデルの保存場所をカスタマイズする必要がある場合は、`example.sh` 内の `model_dir` および `decode_load_path` パラメータを実際のパスに合わせて変更してください。
- 推論を実行中ワンクリック推論スクリプト bash example.sh を実行するか、example.py 内の音声ファイルパスを変更してカスタム入力インタラクションを実装します。
- カスタム使用example.py 内の入力オーディオパスを独自のファイルに置き換えることで、モデルとのエンドツーエンドの音声対話が可能になります。
Covo-Audioプロジェクトの住所
- GitHubリポジトリ:https://github.com/Tencent/Covo-Audio
- ハギングフェイスモデルライブラリ:https://huggingface.co/tencent/Covo-Audio-Chat
- arXiv技術論文:https://arxiv.org/pdf/2602.09823
Covo-Audioの競合製品比較
| 寸法 | Covo-Audio | GPT-4o (Voice) | Mini-Omni |
|---|---|---|---|
| 開発者 | テンセント | OpenAI | オープンソースコミュニティ |
| モデルサイズ | 7Bパラメータ | 非公開(推定数千億ドル)。 | 2Bパラメータ |
| 建築 | エンドツーエンドの統合 | エンドツーエンドネイティブ | エンドツーエンドの統合 |
| オープンソースのステータス | 完全オープンソース | クローズドソースAPI | オープンソース |
| 全二重通信に対応 | ネイティブ低遅延 | ネイティブサポート | 限定的なサポート |
| 中国向け最適化 | ディープ最適化 | ユニバーサル多言語 | 基本サポート |
| 導入コスト | 中型(シングルカード対応可能) | 高(API呼び出し) | 低(軽量) |
Covo-Audioの応用事例
-
インテリジェントな顧客サービスこのモデルは、エンドツーエンドの低遅延インタラクションと全二重割り込み機能をサポートしており、自然で流暢なリアルタイム音声Q&Aやマルチボイスのパーソナライズされたサービスを実現します。
-
スマートハードウェアこのモデルは、スマートスピーカー、車載システム、ホームコントロールシステム向けに、オフラインまたはクラウドベースの音声アシスタント機能を提供することができます。
-
コンテンツ作成複数キャラクターによるセリフの吹き替え、ポッドキャストコンテンツ、リアルタイム音声翻訳サービスの効率的な生成をサポートします。
-
教育と訓練: 音声の感情的および韻律的な詳細を深く理解し、口頭練習指導や仮想講師などの没入型でパーソナライズされた教育およびインタラクティブなシステムを構築する。
-
アクセシビリティサービス視覚的なインターフェースを自然な音声対話に置き換えることで、視覚障害者や高齢者が、文字入力や画面操作をすることなく、情報を入手したり機器を操作したりできる便利な方法を提供する。