AB
AiBoss
project

Qwen3.5-Omni - アリ・トンイーが発表したマルチモーダル大型モデル

Qwen3.5-Omniは、アリババ傘下のTongyi Labが開発したフルモーダルな大規模モデルで、テキスト、画像、音声、音声・動画入力を同時に理解できます。このモデルは、Thinker-Talker協調アーキテクチャとHybrid-MoE技術を採用し、215種類の音声を処理できます。

Qwen3.5-Omniとは何ですか?

Qwen3.5-Omniは、アリババ同義研究所が開発したマルチモーダルな大規模モデルで、テキスト、画像、音声、音声/動画入力を同時に理解できます。このモデルは、Thinker-Talker協調アーキテクチャとHybrid-MoEテクノロジーを採用し、215の音声/音声/動画タスクで最先端(SOTA)のパフォーマンスを実現し、Gemini-3.1 Proを凌駕しています。256Kの超長文コンテキスト、意味的セグメンテーション、音色クローニング、音声制御に対応しています。WebSearchと関数呼び出しをネイティブに統合し、音声/動画命令から実行可能なコードを直接生成する、自然に発生する音声/映像バイブコーディング機能を備えています。

Qwen3.5-Omniの主な機能

  • 完全なモーダル理解このモデルは、テキスト、画像、音声、動画の入力をネイティブかつシームレスに処理し、タイムスタンプ付きの詳細な説明の生成をサポートします。
  • ビデオインテリジェント分析このモデルは、動画コンテンツ、会話、カメラの切り替え、機密情報などを認識し、構造化された動画メモを生成できます。
  • Vibe Coding特別な訓練を必要とせず、音声や動画の指示に基づいて自然にコードを生成する能力を備えている。
  • 実生活での対話意味的な中断と音声制御をサポートし、環境ノイズと実際の中断を区別でき、感情的な話し方の速度をリアルタイムで調整します。
  • 音色クローニング録音データをアップロードして、独自のAI音声トーンをカスタマイズしましょう。複数の言語で自然な音声生成が可能です。
  • インテリジェントなタスク実行Web検索と関数呼び出しをネイティブに統合しているため、複雑なタスクを完了するためのツールを独自に判断して呼び出すことができます。

Qwen3.5-Omniの技術原理

  • 思想家・話し手分業建築Thinkerはマルチモーダルな理解を担当し、視覚信号と音声信号を受信し、TMRoPEを介して位置情報を符号化します。Talkerは音声生成を担当し、Thinkerの出力に基づいたRVQ符号化を使用して効率的な音声合成を実現します。この2つの機能は連携して、理解と生成を分離します。
  • Hybrid-Attention MoE:聞く、見る、理解するなどのタスクを異なるエキスパートネットワークに割り当てることで、異種モーダル干渉を回避し、テキストの視覚化機能を維持しながら、215の最先端(SOTA)パフォーマンス指標を達成します。
  • ARIAダイナミックアライメントテクノロジーこのモデルは、テキストと音声の単位比率を適応的に調整することで、従来の固定比率によって生じる単語の欠落や数字の不明瞭な発音といった問題を解決し、リアルタイムの音声制御応答をサポートします。

Qwen3.5-Omniの使い方

  • API呼び出し:アクセスアリババクラウドの100の改良公式ウェブサイトで「Qwen3.5-Omni」を検索すると、APIにアクセスできます。パフォーマンスとコストに関するさまざまなシナリオの要件を満たすために、Plus、Flash、Lightの3つのサイズが用意されています。
  • オンライン体験: 直接 Qwen Chat Qwen3.5-Omniの全機能を体験してください。デプロイ不要ですぐに使い始められます。

Qwen3.5-Omniに関する重要な情報と使用要件

  • 出版社アリババ同義研究所
  • モデルの位置特定フルモーダル大型モデル(テキスト/画像/音声/動画)
  • バージョン仕様プラス、フラッシュ、ライトの3サイズをご用意しています。
  • パフォーマンス215の最先端機能を搭載し、あらゆる面でGemini-3.1 Proを凌駕しています。
  • コンテキストの長さ256KB(音声10時間分/動画1時間分に対応)
  • 言語サポート74の音声認識言語 + 39の方言
  • コアアーキテクチャ思考型・会話型分業+ハイブリッド型教育

Qwen3.5-Omniの主な利点

  • 完全なモーダルネイティブ統合テキスト、画像、音声、動画を真にシームレスに理解します。
  • 最高のパフォーマンスSOTAの215のカテゴリーでトップの成績を収め、オーディオ/ビデオ性能はあらゆる面でGemini-3.1 Proを凌駕しています。
  • 非常に長い文脈コンテキスト長は256Kで、10時間の音声処理または1時間の動画処理をサポートします。
  • 自然な相互作用意味的な中断、音声制御、音声クローン機能をサポートしており、まるで本物の人間と会話しているかのような体験を提供します。
  • 新たな能力特別なトレーニングなしにオーディオビジュアル・バイブコーディング機能を備えており、音声と映像に基づいてコードを生成することが可能です。
  • インテリジェントな実行Web検索と関数呼び出しをネイティブでサポートし、チャットとタスクをシームレスに連携させます。
  • 多言語対応74の音声認識言語と39の方言に対応しており、言語の壁を取り払います。

Qwen3.5-Omniと類似の競合製品との比較

比較対象寸法 Qwen3.5-Omni Gemini-3.1 Pro GPT-4o
出版社 アリ・トンイ研究室 Google OpenAI
モーダルサポート テキスト/画像/音声/動画 テキスト/画像/音声/動画 テキスト/画像/音声/動画
コンテキストの長さ 256KB(音声10時間/映像1時間) 具体的な期間は明らかにされていない。 128K
音声理解SOTA 215件の主要な業績 超えた 一部は後進的
音声と映像の理解 あらゆる面でリード 全体的に変化なし 最適化されていません
音声認識言語 74種類+39種類の方言 多言語対応 多言語対応
音色クローニング サポート サポート 限定的なサポート
Vibe Coding 自然発生 特別な最適化が必要です。 特別な最適化が必要です。
意味の中断 サポート サポート サポート
音声制御 サポート(音量/雰囲気/話速) 限定 限定

Qwen3.5-Omniアプリケーションシナリオ

  • 動画制作と編集タイムスタンプ付きの構造化された説明を自動的に生成し、シーン、会話、カメラの切り替えを認識し、センシティブなコンテンツを検出し、長い動画を検索可能なメモに変換します。
  • スマートミーティングアシスタント会議の内容をリアルタイムで文字起こしし、発言者を識別し、議事録を作成し、多言語認識と翻訳をサポートすることができます。
  • コード支援開発Vibe Coding:デザイン案や口頭での要件から、フロントエンドページまたはPythonコードを直接生成します。
  • パーソナライズされた音声アシスタント独自の音声を複製してデジタルクローンを作成し、音量や気分を音声で制御できるほか、まるでコンパニオンのような対話機能を提供します。
  • 多言語リアルタイム通信このモデルは74の言語と39の方言をサポートしており、リアルタイムでの多言語対話と翻訳を可能にします。
  • インテリジェントなタスク実行これは、Web検索とツール呼び出しを組み合わせることで、天気予報の確認、ホテルの予約、情報の検索といった複雑なタスクを完了させる。