project
Fun-Audio-Chat - Alibaba Tongyiによるオープンソースのエンドツーエンド音声対話モデル
Fun-Audio-Chatは、Alibaba CloudのTongyi Bailingチームがオープンソース化した次世代のエンドツーエンド音声対話モデルで、音声理解、感情認識、タスク実行の機能を備えています。このモデルは、5Hzと25Hzのフレームレートを併用するデュアル解像度設計を採用しています。
Fun-Audio-Chatとは何ですか?
Fun-Audio-Chatは、アリババクラウドのTongyi Bailingチームがオープンソース化した次世代のエンドツーエンド音声対話モデルで、音声理解、感情認識、タスク実行機能を備えています。このモデルはデュアル解像度設計を採用し、5Hzと25Hzのフレームレートで連携して動作することで、類似製品と比較してGPUコンピューティングリソースを約50%削減しています。その核となるイノベーションは、Core-Cocktailという2段階のトレーニング戦略にあり、壊滅的な忘却を効果的に回避するとともに、多言語音声翻訳やロールプレイング機能もサポートしています。OpenAudioBenchなどの国際ベンチマークにおいて、オープンソースのFun-Audio-Chat-8Bは、音声対話や感情認識などのタスクでGLM4-Voiceなどの競合製品を凌駕しています。すでにインテリジェントな顧客サービスや感情的なコンパニオンシップなどのシナリオに適用されており、ModelScopeやHuggingFaceプラットフォームを通じて無料でダウンロードして利用できます。
Fun-Audio-Chatの主な機能
- エンドツーエンドの音声対話本システムはエンドツーエンドの音声対話方式を採用し、音声入力から直接音声出力を生成するため、従来方式における音声認識(ASR)+言語モデル(LLM)+テキスト音声合成(TTS)のマルチモジュール接続が不要となり、より高い効率と低い遅延を実現します。
-
感情認識ユーザーが感情を直接表現しなくても、意味、声のトーン、話す速度、間などの細部を通して、ユーザーの感情状態を感知することができる。
-
感情的な反応ユーザーが怒っているとき、不安なとき、または嬉しいとき、このモデルは適切な量の慰め、仲間意識、共感を提供し、まるで友人と会話しているかのような体験を提供する。
- 自然言語によるコマンド実行このモデルは音声機能呼び出しに対応しており、ユーザーは自然言語でコマンドを発行でき、システムは関連する機能を自動的に呼び出して複雑なタスクを完了させることができます。
- オープンソースで使いやすい8Bモデルの重み、推論コード、および関数呼び出しアクセス例はすべてオープンソースであるため、開発者は簡単にダウンロードして使用できます。
Fun-Audio-Chatの技術的原理
- エンドツーエンドのS2SアーキテクチャFun-Audio-Chatは、音声入力から直接音声出力を生成する音声間通信(S2S)エンドツーエンドアーキテクチャを採用しており、従来の音声認識(ASR)、大規模言語モデル(LLM)、テキスト音声合成(TTS)といった複数のモジュールを連結する必要がありません。これにより、処理効率が大幅に向上し、システム遅延が低減され、よりスムーズな音声対話体験が実現します。
- デュアル解像度設計このモデルは革新的なデュアル解像度処理メカニズムを採用しています。共有LLM層は5Hzのフレームレートで効率的な意味処理を実行し、SRH(音声再構成ヘッド)は25Hzのフレームレートで高品質の音声を生成します。これにより、音声品質を維持しながらGPUの計算負荷を約50%削減し、パフォーマンスと効率のバランスを実現しています。
- 何百万時間にも及ぶマルチタスクデータトレーニングこのモデルは、音声理解、音声による質問応答、感情認識、ツール呼び出しといった現実世界のシナリオを網羅する、数百万時間に及ぶマルチタスクデータで学習されています。ユーザーの意図をより現実的な方法で理解することができます。OpenAudioBench、MMAU、Speech-ACEBench、VStyleといった複数の権威あるベンチマークにおいて、同規模のモデルの中でトップの成績を収め、GLM4-Voice、Kimi-Audio、Baichuan-Omniといった競合モデルを総合的に凌駕する性能を発揮します。
- 感情認識能力Fun-Audio-Chatは、声のトーン、話す速度、間合いといった非言語的な手がかりから感情を感知する、優れた感情認識機能を誇ります。ユーザーが感情を直接表現しなくても、正確に感情を識別し、適切な応答を提供することで、より自然で人間味のある会話体験を実現します。
- 音声関数呼び出し関数このモデルは、自然な音声コマンドによる関数呼び出しに対応しています。ユーザーは音声でコマンドを発するだけで、システムが関連する関数を自動的に呼び出し、複雑なタスクを完了させることができます。これにより、モデルの応用範囲が広がり、単なる会話だけでなく、真に「物事を成し遂げる」ことが可能になります。
Fun-Audio-Chatプロジェクトのアドレス
- プロジェクト公式サイト:https://funaudiollm.github.io/funaudiochat/
- GitHubリポジトリ:https://github.com/FunAudioLLM/Fun-Audio-Chat
- ハギングフェイスモデルライブラリ:https: //huggingface.co/FunAudioLLM/Fun-Audio-Chat-8B
- 技術論文:https://github.com/FunAudioLLM/Fun-Audio-Chat/blob/main/Fun-Audio-Chat-Technical-Report.pdf
Fun-Audio-Chatの応用シナリオ
-
ボイスチャットFun-Audio-Chatは、ユーザーとの自然で流暢な音声会話を可能にし、まるで実際の人と会話しているかのような体験を提供するため、日常的なチャットやソーシャルインタラクションに適しています。
-
感情的な繋がりこのモデルはユーザーの感情を感知し、慰め、励まし、共感など、それに応じて反応することができます。孤独感や不安を感じている時、あるいは誰かと話したい時などに適しています。
-
インテリジェントデバイス制御ユーザーは、スマートホーム機器やスマートウェアラブルなどのスマートデバイスを音声コマンドで操作することで、より便利に操作できます。
-
音声カスタマーサービスカスタマーサービス場面において、Fun-Audio-Chatはユーザーの質問を理解し、正確な回答を提供することで、カスタマーサービスの効率性とユーザーエクスペリエンスを向上させます。
-
ロールプレイユーザーは、eスポーツの解説者やバーチャルアシスタントなど、特定の役割を担うモデルを指定することで、さまざまな娯楽や仕事のニーズに対応できます。