project
Qwen3-Omni - Alibaba Tongyi がオープンソース化したネイティブのエンドツーエンドのフルモーダル大規模モデル
Qwen3-Omniは、アリババ傘下のTongyiチームが開発した業界初のネイティブエンドツーエンドマルチモーダルAIモデルで、テキスト、画像、音声、動画などのマルチモーダルデータをシームレスに処理できます。このモデルは、音声および動画ベンチマークテストで36点満点中22点を獲得しました。
Qwen3-Omniとは何ですか?
Qwen3-Omniは、アリババ傘下のTongyiチームが開発した、業界初のネイティブなエンドツーエンドのマルチモーダルAIモデルです。テキスト、画像、音声、動画など、様々な形式のデータをシームレスに処理できます。36種類の音声・動画ベンチマークテストのうち22種類で最先端(SOTA)のパフォーマンスを達成し、119言語のテキスト処理に対応、グローバル言語機能も備えています。レイテンシはわずか211ミリ秒と非常に低く、高度な制御が可能で、カスタムシステムプロンプトに対応し、強力な組み込みツール機能も搭載しています。Qwenチームは、Qwen3-Omni-30B-A3B-Instruct、Qwen3-Omni-30B-A3B-Thinking、Qwen3-Omni-30B-A3B-Captionerなど、複数のバージョンをオープンソース化し、技術開発とアプリケーション革新を推進しています。このモデルは現在、Qwen Chatモデル体験プラットフォームで利用可能です。
Qwen3-Omniの主な機能
-
ネイティブフルモダリティQwen3-Omniはネイティブなフルモーダル大規模モデルであり、フルモーダルを事前学習してもその知能は低下しません。
-
パワフルなパフォーマンスオープンソーステストで32の最先端(SOTA)スコア、36のオーディオおよびビデオベンチマークテストで22の総合SOTAスコアを達成し、Gemini-2.5-Pro、Seed-ASR、GPT-4o-Transcribeといったクローズドソースの強力なモデルを凌駕しました。また、画像およびテキスト処理性能は、同規模のモデルの中でSOTAレベルに達しました。
-
多言語対応119種類のテキストベースの対話型言語、19種類の音声認識言語、および10種類の音声生成言語をサポートしています。
-
より迅速な対応純粋モデルにおけるエンドツーエンドの音声対話遅延は最短211ms、ビデオ対話遅延は最短507msです。
-
長尺音声最大30分間の音声理解をサポートします。
-
パーソナライゼーションカスタマイズ可能なシステムプロンプトをサポートしており、ユーザーは返信スタイルやユーザーペルソナなどを変更できます。
-
ツール呼び出し関数呼び出しをサポートし、外部ツール/サービスとの効率的な統合を可能にします。
-
オープンソースの汎用音声キャプションツールオープンソースのQwen3-Omni-30B-A3B-Captionerは、錯覚が少なく非常に詳細な汎用オーディオキャプションモデルであり、オープンソースコミュニティのギャップを埋めるものです。
Qwen3-Omniの技術原理
- シンカー・トーカー・アーキテクチャ:
- Thinker主にテキスト生成タスクを担当し、テキスト入力を処理して、後続の音声生成のための基本情報を提供する高レベルの意味表現を出力する。
- Talkerこの手法は、ストリーミング音声トークンの生成に焦点を当てており、Thinkerが出力する意味表現を直接利用して自己回帰によりマルチコードブックシーケンスを予測することで、低遅延のフレームごとのストリーミング音声生成を実現します。
- MTPモジュールデコード処理において、MTPモジュールは現在のフレームの残差コードブックを出力する役割を担います。Code2Wavモジュールは、そのコードブックを対応する音声波形に合成し、効率的なストリーミング音声生成を実現します。
- 革新的な建築デザイン:
- AuTオーディオエンコーダー膨大な量の音声データ(2000万時間)で学習されたこのモデルは、強力な汎用音声表現能力を備えており、音声タスクを処理するモデルのための強固な基盤を提供する。
- 教育省建築ThinkerとTalkerはどちらもMoE(Mixture of Experts)アーキテクチャを採用しており、高い並列処理と高速な推論をサポートすることで、マルチタスク処理におけるモデルの効率とパフォーマンスを大幅に向上させています。
- マルチコードブック技術Talkerはマルチコードブック自己回帰方式を採用しており、各生成ステップでエンコード/デコードフレームを生成します。MTPモジュールは残りの残差コードブックを同期的に出力することで、音声生成の効率と品質をさらに最適化します。
- 劣化のない完全なモーダルインテリジェンステキスト事前学習フェーズでは、単一モダリティデータとクロスモダリティデータを組み合わせてモデルを学習させます。この混合学習アプローチにより、各モダリティのパフォーマンスが純粋な単一モダリティ学習のパフォーマンスと同等になり、モデルのクロスモダリティ機能が大幅に向上し、マルチモーダルタスクの処理能力が向上します。Qwen3-Omniは音声認識とコマンド追従タスクにおいて非常に優れたパフォーマンスを発揮し、Gemini-2.5-Proなどのトップモデルに匹敵する性能を実現しています。音声コマンドを正確に理解して実行し、ユーザーにスムーズな音声インタラクション体験を提供します。
- リアルタイム音声および視聴覚インタラクション(AuT音声エンコーディング、Thinkerテキスト処理、Talker音声生成、Code2wav音声合成を含む)全プロセスは完全にストリーミングされ、最初のフレームトークンを音声出力に直接ストリーミングデコードすることで、リアルタイムの音声および視聴覚インタラクションの効率性とスムーズさを保証します。
Qwen3-Omniのパフォーマンス
-
総合的な業績評価においてQwen3-Omniは、単一モードのタスクにおいては、同サイズの他のQwenシリーズの単一モードモデルと同等の性能を発揮し、特にオーディオタスクにおいては卓越した性能を示し、大きな優位性を発揮します。
-
36のオーディオおよびビデオベンチマークテストQwen3-Omniは、32のテストでオープンソース分野における最高のパフォーマンスを達成し、22のテストで業界最高レベル(SOTA)に達しました。これは、Gemini-2.5-Pro、Seed-ASR、GPT-4o-Transcribeといった強力なクローズドソースモデルを凌駕するものです。
Qwen3-Omniのプロジェクトアドレス
- プロジェクト公式サイト:https://qwen.ai/blog?id=65f766fc2dcba7905c1cb69cc4cab90e94126bf4&from=research.latest-advancements-list
- GitHubリポジトリ:https://github.com/QwenLM/Qwen3-Omni
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/Qwen/qwen3-omni-68d100a86cd0906843ceccbe
- 技術論文:https://github.com/QwenLM/Qwen3-Omni/blob/main/assets/Qwen3_Omni.pdf
Qwen3-Omniの応用シナリオ
-
コンテンツ作成このモデルは、高品質のテキスト、画像、音声、動画コンテンツを生成でき、クリエイターに豊富な創作素材を提供するとともに、創作効率を向上させます。
-
インテリジェントな顧客サービスこのモデルは多言語のテキストおよび音声による対話に対応し、ユーザーの問題を迅速かつ正確に理解して解決策を提供することで、顧客サービス体験を向上させます。
-
教育このモデルは、音声解説や画像例など、個々の生徒の学習ニーズに合わせた学習教材やインタラクティブなコンテンツを生成できる。
-
医療支援このモデルは、医用画像や音声録音などのマルチモーダルデータを処理することができ、医師の診断や治療計画の策定を支援する。
-
マルチメディアエンターテイメントこのモデルは、音楽や動画などのマルチメディアコンテンツを作成し、ユーザーにパーソナライズされたエンターテイメント体験を提供することができます。