AB
AiBoss
project

Stream-Omni - 中国科学院と中国科学技術大学が開発した言語視覚・音声モデル

Stream-Omniは、GPT-4oに類似した大規模な言語、画像、音声処理プラットフォームであり、中国科学院計算技術研究所のインテリジェント情報処理重点実験室、中国科学院人工知能セキュリティ重点実験室、および中国科学院大学が共同で開発したものです。

Stream-Omniとは何ですか?

Stream-Omniは、中国科学院計算技術研究所インテリジェント情報処理重点実験室、中国科学院人工知能セキュリティ重点実験室、および中国科学院大学が共同開発した、GPT-4oに類似した大規模な言語、視覚、音声モデルです。マルチモーダルな対話を同時にサポートします。このモデルは、大規模な言語モデルを基盤とし、シーケンス次元連結に基づく視覚テキストアライメントと、CTC層次元マッピングに基づく音声テキストアライメントを実現することで、テキスト機能を音声モダリティに効率的に転送します。Stream-Omniは、少量のフルモーダルデータ(例えば、23,000時間分の音声データ)で学習することで、視覚理解、音声対話、および視覚誘導型音声対話タスクにおいて非常に優れた性能を発揮します。このモデルは、音声対話中に自動音声認識(ASR)の文字起こしやモデルの応答などの中間テキスト出力を同時に提供できるため、ユーザーに豊かなマルチモーダルな対話体験を提供します。

Stream-Omniの主な機能

  • マルチモーダル入力と出力テキスト、画像、音声など、複数の入力形式に対応しており、テキストと音声による応答を同時に生成できます。
  • シームレスな「視聴」体験音声対話中、リアルタイムで中間テキスト結果(自動音声認識(ASR)の文字起こしやモデル応答など)を出力することができ、ユーザーにより豊かな対話体験を提供します。
  • 高効率トレーニングトレーニングには少量のフルモーダルデータ(例えば23,000時間分の音声データ)しか必要ないため、データ要件が低く、トレーニング効率が高い。
  • 柔軟なインタラクションモードテキスト+ビジュアル→テキスト、テキスト+ビジュアル→音声、音声+ビジュアル→テキスト、音声+ビジュアル→音声など、複数のモーダルなインタラクションの組み合わせをサポートし、さまざまなシナリオにおけるインタラクションのニーズに対応します。
  • 視覚理解と音声インタラクション視覚理解や音声対話のタスクにおいて優れた性能を発揮し、視覚コンテンツに関連するテキストや音声情報を正確に理解・生成することができる。

Stream-Omniの技術原理

  • LLMベースのバックボーンアーキテクチャ大規模言語モデル(LLM)を中核とするこのシステムは、強力な言語理解および生成能力を活用することで、マルチモーダルなインタラクションのための基本的なサポートを提供します。
  • 視覚的なテキスト配置シーケンス次元連結法に基づき、ビジュアルエンコーダによって抽出された視覚的特徴をテキスト入力と連結し、LLMに入力することで、視覚モダリティとテキストモダリティの整合を実現します。
  • 音声認識とテキスト変換の連携CTC(Connectionist Temporal Classification)に基づく階層次元マッピングを導入し、LLMの下部と上部に音声レイヤーを追加することで、音声からテキストへのマッピングとテキストから音声への生成を実現し、音声モダリティとテキストモダリティを整合させます。
  • マルチタスク学習マルチタスク学習戦略に基づき、このモデルは視覚テキスト、音声テキスト、およびフルモーダル(視覚+テキスト+音声)タスクで同時にトレーニングされるため、マルチモーダルコンテンツをより良く理解し、生成することができます。
  • リアルタイム音声生成Stream-Omniは、独自の音声レイヤー設計とレイヤー次元マッピングに基づいて、テキスト生成と同時に対応する音声出力をリアルタイムで生成し、スムーズな音声インタラクションを実現します。
  • データ駆動型学習と教師あり学習を組み合わせるこのモデルは、少量のマルチモーダルデータを用いて学習を行います。綿密に設計されたアライメント機構とマルチタスク学習に基づき、限られたデータ量でも効率的なモーダルアライメントとインタラクション機能を実現できます。

Stream-Omniプロジェクトの住所

  • GitHubリポジトリ:https://github.com/ictnlp/Stream-Omni
  • ハギングフェイスモデルライブラリ:https://huggingface.co/ICTNLP/stream-omni-8b
  • arXiv技術論文:https://arxiv.org/pdf/2506.13642

Stream-Omniの応用シナリオ

  • インテリジェント車両システムドライバーは音声コマンドを使ってルートを検索したり、交通状況を確認したりできます。このシステムは、ナビゲーションマップや交通カメラの映像などの視覚情報を組み合わせて、テキストによる指示と音声によるフィードバックをリアルタイムで表示することで、運転の安全性と操作効率を向上させます。
  • 教育補助教材教育現場では、生徒が音声で質問すると、システムは教科書の視覚コンテンツ(図表や写真など)に基づいて詳細なテキスト説明と音声による回答を提供し、生徒が知識をよりよく理解し、学習できるよう支援します。
  • スマートホームコントロールスマートホームアシスタントとして、ユーザーは音声コマンドに基づいて家電製品を操作します。このシステムは、カメラで捉えた環境情報などの視覚入力と組み合わせることで、テキストまたは音声によるフィードバックを提供し、よりスマートで便利なホームコントロールを実現します。
  • 医療補助診断医師は患者の医療記録を確認する際、音声コマンドを使って重要な情報を照会できます。このシステムは、X線写真やCT画像などの視覚的なレポートと、詳細なテキスト分析および音声による説明を組み合わせることで、医師がより正確な診断を下せるよう支援します。
  • インテリジェントな顧客サービス顧客サービス分野では、顧客サービス担当者は音声を使用して顧客とコミュニケーションを取り、システムは関連するテキスト情報や視覚的な手がかり(製品画像や操作フローチャートなど)をリアルタイムで表示することで、顧客サービス担当者が顧客のニーズを迅速に理解し、正確な回答を提供できるよう支援し、サービス品質と効率性を向上させます。