AB
AiBoss
project

Qwen2.5-Omni-3B - アリババのQwenチームが発表した軽量マルチモーダルAIモデル。

Qwen2.5-Omni-3Bは、アリババのQwenチームが開発した軽量マルチモーダルAIモデルです。Qwen2.5-Omni-7Bの簡易版で、特にコンシューマー向けハードウェア向けに設計されており、テキスト、音声、画像、動画など、さまざまな入力方法をサポートしています。

Qwen2.5-Omni-3Bとは何ですか?

Qwen2.5-Omni-3Bは、アリババのQwenチームが開発した軽量マルチモーダルAIモデルです。Qwen2.5-Omni-7Bの合理化バージョンで、特にコンシューマー向けハードウェア向けに設計されており、テキスト、音声、画像、動画など、さまざまな入力方法をサポートしています。パラメータ数を7Bから3Bに削減しながらも、マルチモーダル性能は7Bモデルの90%以上を維持し、リアルタイムのテキスト生成と自然言語出力において優れた性能を発揮します。25,000トークンの長い文脈入力を処理する場合、モデルのメモリ使用量は7Bモデルの60.2GBから28.2GBへと53%削減され、24GBのGPUを搭載したデバイスでも動作可能です。

Qwen2.5-Omni-3Bの主な機能

  • マルチモーダル入力とリアルタイム応答テキスト、音声、画像、動画など、複数の入力機能をサポートし、テキストや自然な音声による応答をリアルタイムで生成できます。
  • 音声カスタマイズユーザーは、用途や対象者に合わせて、2種類の内蔵音声(女性のチェルシーと男性のイーサン)から選択できます。
  • ビデオメモリの最適化25,000トークンという長いコンテキスト入力を処理する場合、メモリ使用量は7Bモデルの60.2GBから28.2GBに削減され、53%の削減となりました。また、24GBのGPUを搭載したデバイスでも動作可能です。
  • 建築革新Thinker-Talkerが設計し、独自に開発した位置情報埋め込み方式TMRoPEは、映像と音声の入力を同期的に理解することを保証します。
  • 最適化されたサポートFlashAttention 2とBF16精度最適化をサポートし、速度をさらに向上させ、メモリ消費量を削減します。
  • パフォーマンスマルチモーダルベンチマークテストでは、その性能は7Bモデルに近く、例えば、VideoBenchのビデオ理解テストでは68.8、Seed-tts-evalの音声生成テストでは92.1のスコアを獲得しています。

Qwen2.5-Omni-3Bの技術的原理

  • シンカー・トーカー・アーキテクチャQwen2.5-Omni-3Bは、シンカー・トーカーアーキテクチャを採用しており、モデルを「シンカー」と「トーカー」の2つの部分に分割しています。シンカーは、テキスト、音声、ビデオなどのマルチモーダル入力を処理・理解し、高レベルのセマンティック表現とテキスト出力を生成する役割を担います。トーカーは、シンカーの出力に基づいて自然な音声を生成し、テキスト生成と音声出力の同期を確保します。
  • 時間軸に沿ったマルチモーダル位置埋め込み(TMRoPE)Qwen2.5-Omni-3Bは、ビデオ入力のタイムスタンプをオーディオと同期させるために、TMRoPE(Time-aligned Multimodal RoPE)を提案しました。オーディオフレームとビデオフレームのタイムIDを交互に配置することで、マルチモーダル入力の3D位置情報(時間、高さ、幅)がモデルにエンコードされ、ビデオ入力とオーディオ入力の同期的な理解が可能になります。
  • ストリーミングとリアルタイムレスポンス本モデルはブロックベースの処理手法を採用しており、マルチモーダルデータの長いシーケンスをより小さなブロックに分解して処理することで、処理遅延を削減しています。また、スライディングウィンドウ機構を導入することで、現在のラベルのコンテキストを制限し、ストリーミング生成の効率をさらに最適化しています。これにより、本モデルはテキストと音声による応答をリアルタイムでストリーミング形式で生成することが可能になります。
  • 精度最適化このモデルはFlashAttention 2とBF16の精度最適化をサポートしており、処理速度をさらに向上させ、メモリ消費量を削減します。

Qwen2.5-Omni-3Bプロジェクトの住所

Qwen2.5-Omni-3Bの応用シナリオ

  • 動画の理解と分析Qwen2.5-Omni-3Bは、ビデオコンテンツをリアルタイムで処理・分析できます。ビデオコンテンツ分析、監視ビデオ解析、インテリジェントビデオ編集などの分野に適用でき、ユーザーがビデオから重要な情報を迅速に抽出するのに役立ちます。
  • 音声生成と対話このモデルは音声カスタマイズに対応しており、ユーザーは内蔵の2種類の音声(女性のチェルシーと男性のイーサン)から選択できます。インテリジェント音声アシスタント、音声放送システム、オーディオブック生成などのシナリオで使用でき、自然でスムーズな音声対話体験を提供します。
  • インテリジェントな顧客サービスと自動レポート生成Qwen2.5-Omni-3Bは、テキスト入力をリアルタイムで処理し、テキスト応答を生成できます。インテリジェントな顧客サービスシステムに適しており、ユーザーの質問に迅速に回答し、解決策を提供できます。
  • 教育および学習ツール教育分野において、Qwen2.5-Omni-3Bは、音声とテキストによる対話を通じて、生徒の問題解決を支援したり、学習ガイダンスを提供したりするなど、教育活動をサポートすることができます。数学の授業では、幾何学の問題を解いたり、段階的な推論ガイダンスを提供したりするために活用できます。
  • クリエイティブコンテンツの生成Qwen2.5-Omni-3Bは、画像コンテンツを分析し、テキストと画像を組み合わせたクリエイティブなコンテンツを生成できます。