AB
AiBoss
project

NEXUS-O - 言語、音声、視覚を横断する包括的な知覚とインタラクションを可能にするマルチモーダルAIモデル。

NEXUS-Oは、HiThink Research Institute、インペリアル・カレッジ・ロンドン、浙江大学、復旦大学、マイクロソフト、Meta AIなどの機関によって開発されたマルチモーダルAIモデルです。言語、音声、視覚情報の包括的な認識と相互作用を可能にします。

NEXUS-Oとは何ですか?

NEXUS-Oは、HiThink Research Institute、インペリアル・カレッジ・ロンドン、浙江大学、復旦大学、マイクロソフト、Meta AIなどの機関によって開発されたマルチモーダルAIモデルです。言語、音声、視覚情報の包括的な認識と相互作用を可能にします。NEXUS-Oは、音声、画像、動画、テキストの入力の任意の組み合わせを処理し、音声またはテキスト形式で結果を出力できます。事前学習済みの視覚言語モデルに基づいて、NEXUS-Oは高品質の合成音声データを使用して、トリモーダルアライメント機能を向上させています。NEXUS-Oは、さまざまな現実世界のシナリオ(会議やライブストリーミングなど)を網羅する新しい音声テストプラットフォームであるNexus-O-audioを導入し、実用アプリケーションにおけるモデルの堅牢性を評価します。NEXUS-Oは、視覚理解、音声質問応答、音声認識、音声翻訳などのタスクで非常に優れたパフォーマンスを発揮し、トリモーダルアライメント分析に基づいて効率性と有効性を示しています。

NEXUS-Oの主な機能

  • 音声処理機能自動音声認識(ASR)、音声テキスト変換(S2TT)、音声合成、音声コマンドによる対話といったタスクをサポートしており、様々な音声アプリケーションのシナリオに適しています。
  • 視覚的理解と相互作用画像や動画の入力を処理し、視覚的質問応答(VQA)、画像説明生成、動画分析などのタスクを実行するほか、高度な視覚理解能力を備えています。
  • 言語インタラクションと推論自然言語による指示を理解し、対話、テキスト生成、マルチモーダル推論などのタスクを実行し、複雑な言語対話シナリオをサポートすることができます。
  • 異種感覚間の連携と理解マルチモーダルアライメント技術に基づき、音声、視覚、言語の各モダリティ間の協調的な理解を実現し、複雑なシナリオにおけるモデルの全体的なパフォーマンスを向上させます。

NEXUS-Oの技術原理

  • マルチモーダル建築
    • ビジュアルエンコーダー改良されたVision Transformer(ViT)アーキテクチャに基づいており、高解像度画像入力に対応し、ウィンドウアテンションメカニズムによって計算効率を向上させています。
    • 音声エンコーダーとデコーダー音声エンコーダは、事前学習済みのWhisper-large-v3モデルに基づいて音声の特徴を意味空間にマッピングします。音声デコーダは、自己回帰を使用して離散的な音声コードを生成し、事前学習済みのジェネレータから最終的な音声波形を合成します。
  • 言語モデルQwen2.5-VL-7Bをベースとしており、28層の因果トランスフォーマーを含み、言語モダリティの処理を担当します。
  • マルチモーダルアライメントと事前学習事前学習段階に基づき、音声、視覚、言語の各モダリティの特徴が統一された意味空間に統合され、モデルがクロスモーダル情報を理解し生成できるようになります。音声アライメント、音声指示追従(SFT)、音声出力調整を含む段階的な事前学習アプローチにより、モデルのマルチモーダルインタラクション能力が段階的に向上します。
  • データ構成とデータ拡張テキスト音声合成(TTS)技術は、テキストデータを自然な音声に変換することで、データの多様性を高めます。合成データは、長さ、非テキスト要素、パターンマッチングに基づいてフィルタリングされ、データ品質が確保されます。
  • マルチモーダルタスクの共同トレーニングNexus-Oは、事前学習段階で、自動音声認識、音声テキスト変換、音声コマンドによる対話、視覚的な質問応答など、さまざまなマルチモーダルタスクをサポートしており、共同学習によってモデルの汎化能力が向上します。
  • 空間アライメント解析カーネルアライメントなどの手法は、モデル内の表現空間における異なるモダリティのアライメントの度合いを評価し、マルチモーダル特徴融合効果を最適化するために使用されます。

NEXUS-Oプロジェクトの住所

NEXUS-Oの応用シナリオ

  • インテリジェントな音声対話音声アシスタントの中核として、多言語対話、デバイスの音声制御、リアルタイム翻訳をサポートし、スマートホーム、車載システム、インテリジェントカスタマーサービスなどで幅広く利用されている。
  • ビデオ会議とコラボレーションリアルタイム音声翻訳、インテリジェントな会議録画機能、仮想アシスタント機能などを備え、効率的なリモートワークや多言語会議を促進します。
  • 教育とコンテンツ制作言語学習、インテリジェントな個別指導、教育ゲーム開発を支援し、ビデオ字幕生成、音声コンテンツ作成、マルチモーダルコンテンツ推薦をサポートし、学習と創造の体験を向上させます。
  • インテリジェントドライビングとセキュリティ車両機能の音声制御、環境認識支援、スマートホーム制御、セキュリティ監視などに基づき、運転の安全性と生活の利便性を向上させます。
  • 公共サービスと医療本システムは、インテリジェントナビゲーション、緊急対応支援、音声診断支援、リハビリテーション訓練指導などをサポートし、公共サービスの高度化と医療分野におけるパーソナライズされたサービスに貢献する。