project
FLM-Audio - 北京人工知能研究院がオープンソース化した全二重音声対話モデル。
FLM-Audioは、北京人工知能研究院、スピンマトリックス、シンガポールの南洋理工大学が共同で発表したネイティブ全二重音声対話モデルです。中国語と英語の両方をサポートしています。ネイティブ全二重アーキテクチャを採用しており、…
FLM-Audioとは何ですか?
FLM-Audioは、北京人工知能研究院(BAAI)、Spin Matrix、シンガポールの南洋理工大学(NTU)が共同で発表したネイティブ全二重音声対話モデルです。中国語と英語の両方をサポートしています。ネイティブ全二重アーキテクチャを採用し、各タイムステップで音声、発話、モノローグの各チャネルを統合することで、従来の時分割多重方式における高遅延の問題を回避しています。独自の自然なモノローグとデュアルトレーニングパラダイムにより、対話における自然な人間のコミュニケーションにより近いモデルを実現し、非同期アライメントの問題を効果的に解決しています。FLM-Audioはわずか100万時間分のデータでトレーニングされており、データ量を大幅に削減しながらも、高品質な応答と俊敏で自然な反応を実現しています。また、ノイズやユーザーの割り込みに対しても高い耐性を備えています。
FLM-Audioの主な機能
-
全二重音声対話これにより「同時リスニングと同時スピーキング」が可能になり、ユーザーはいつでもモデルを中断できます。モデルは即座に出力を一時停止し、新しい質問を理解して応答するため、低遅延で自然かつスムーズな対話が実現します。
-
複数の言語に対応このモデルは中国語と英語の両方をサポートしており、異なる言語を話すユーザーの対話ニーズを満たします。
-
自然音声モデリング人間の話し言葉のリズムをシミュレートするために「自然な独白」アプローチを採用し、低遅延と言語モデリング性能のバランスを取るために「デュアルトレーニング」を通じて言語と音響意味の整合性を強化している。
-
低データ効率の良いトレーニングわずか約100万時間分の音声データで学習させたこのモデルは、70億個のパラメータを持ち、騒がしい環境や頻繁に中断される状況でも、高い堅牢性と自然さを維持します。
-
高い堅牢性ノイズやユーザーによる中断に対して非常に堅牢で、現在の出力を素早く一時停止でき、新しい質問を正確に理解してリアルタイムで回答できるため、対話の流暢さと正確性を確保できます。
-
完全なオープンソースサポート論文、モデルの重み、およびコードはすべて一般公開されており、ローカルでの展開や二次開発をサポートし、研究やアプリケーションの拡張を促進します。
FLMオーディオ技術原理
-
ネイティブ全二重アーキテクチャこのモデル設計は、音声の同時入出力に対応しており、音声ストリームをリアルタイムで処理できるため、聞きながら話すことができるインタラクティブモードを実現できます。
-
自然なモノローグのトレーニング単語ごとの対応付けではなく、連続した文と間合いで構成される「自然な独白」を使用することで、人間が実際に話す方法に近づけ、音声インタラクションの自然さを向上させています。
-
デュアルトレーニング戦略トレーニング中に音声録音の最初と最後に独白を交互に配置することで、言語と音響意味の整合性が強化され、それによってモデルの音声コンテンツの理解と生成能力が向上する。
-
少量のデータを用いた効率的なトレーニング少量の音声データ(約100万時間)を用いて高パラメータモデルを学習させ、学習方法とアーキテクチャを最適化することで、低遅延と高い堅牢性を実現した。
FLM-Audioプロジェクトの住所
-
GitHubリポジトリ:https://github.com/cofe-ai/flm-audio
- ハギングフェイスモデルライブラリ:https://huggingface.co/CofeAI/FLM-Audio
- arXiv技術論文:https://arxiv.org/pdf/2509.02521
FLM-Audioの応用シナリオ
-
オンライン教育AIティーチングアシスタントは、学生の質問にリアルタイムで回答できるため、より自然で効率的な対話型学習体験を提供できます。
-
ゲームとバーチャルリアリティ(VR)NPCは、中断されない、または中断可能な自然な音声によるやり取りを行うことができ、ゲームへの没入感を高めます。
-
インテリジェントな顧客サービス低遅延の会話は、ユーザーの待ち時間を短縮し、顧客サービスの効率性を向上させ、ユーザーエクスペリエンスを高めます。
-
スマートコンパニオンこれにより、ユーザーはよりリアルな音声対話が可能になり、親近感が高まります。
-
音声アシスタントスマートホーム、スマートオフィス、その他のシナリオにおいて、より自然な音声対話体験を提供します。
-
会議サポート複数人での会議では、リアルタイムの翻訳、録音、および対話が可能になり、会議の効率が向上します。