project
OmniVinci - NVIDIAのフルモーダル大規模言語モデル
OmniVinciは、NVIDIAが開発したマルチモーダル言語モデルで、視覚、聴覚、言語、推論を含むマルチモーダルタスクの処理に特化して設計されています。独自のOmnialignNetテクノロジー、時間的埋め込みなどにより、クロスモーダルな意味的整合性を実現します。
OmniVinciとは何ですか?
OmniVinciは、NVIDIAが開発したマルチモーダル言語モデルで、視覚、聴覚、言語、推論を含むマルチモーダルタスクの処理に特化して設計されています。独自のOmnialignNetテクノロジーにより、クロスモーダルな意味的整合性を実現し、Temporal Embedding Groupingにより時間的同期の問題を解決し、Constrained Rotary Time Embeddingにより時間認識を最適化します。Dailyomniなどのベンチマークでは、Qwen2.5などのモデルを凌駕する性能を発揮し、特に音声と映像の同期理解タスクで優れた性能を発揮します。このモデルは、トレーニングに必要なトークン数がわずか0.2兆個であるため、類似製品よりもはるかに効率的で、メディア分析やゲーム開発などのシナリオに適しています。
OmniVinciの主な機能
- マルチモーダルな理解 OmniVinciは、視覚情報(画像、動画)、音声情報、テキスト情報を同時に処理することで、複数のモダリティからの統合的な理解を可能にします。例えば、動画内の人物の動き、音声内容、背景などを正確に融合させることができます。
- 異種モダリティ間の連携 OmniAlignNetモジュールを通して、OmniVinciは共有されたフルモーダル潜在空間における視覚および音声埋め込みのアライメントを強化し、従来モデルにおけるモーダル意味の断絶の問題を解決し、マルチモーダルデータの融合効果を向上させることができます。
- 時間情報処理 OmniVinciは、時間埋め込みグループ化と制約付き回転時間埋め込み技術を導入し、映像信号と音声信号の時間軸の整合、および絶対時間情報の符号化を効果的に処理します。ビデオ監視や音声分析など、時系列分析を必要とするシナリオに適しています。
- 幅広い応用シナリオ OmniVinciは、ビデオコンテンツ分析、医療AI、ロボットナビゲーション、音声文字起こしと翻訳、産業検査など、さまざまな実用的なアプリケーションに適しており、さまざまな分野に強力なマルチモーダルソリューションを提供します。
- オープンソースとコミュニティによる共同構築 OmniVinciのコード、データ、ウェブデモはすべてオープンソースであるため、研究者や開発者が容易に利用・改良でき、フルモーダルAI研究コミュニティの発展を促進します。
OmniVinciの技術原理
- OmniAlignNetモジュール OmniVinciは、OmniAlignNetモジュールを通じて、共有されたフルモーダル潜在空間における視覚および音声埋め込みのアライメントを強化し、従来のモデルにおけるモーダル意味の断絶の問題を解決し、マルチモーダルデータの融合効果を向上させます。
- Temporal Embedding Grouping OmniVinciは、時間埋め込みグループ化技術を採用し、視覚信号と音声信号間の相対的な時間的整合性を捉えることで、マルチモーダルデータにおける時系列情報を効果的に処理し、モデルの時間的論理を理解する能力を向上させます。
- Constrained Rotary Time Embedding OmniVinciは、次元を考慮した回転符号化を用いて絶対時間情報の正確なラベリングを実現する制約付き回転時間埋め込みを導入し、モデルの時間情報処理能力をさらに向上させ、時系列分析を必要とするシナリオに適したものにしました。
- データ最適化と合成 OmniVinciは、綿密に設計されたデータ合成および最適化プロセスを通じて、2400万個の単一モダリティおよびマルチモダリティの対話サンプルを生成しました。そのうち15%は、明示的なマルチモダリティ合成データです。マルチモデル協調エラー訂正により、「モダリティ錯覚」が解消され、データ品質が向上します。
- 高効率トレーニング戦略 OmniVinciはわずか0.2Tのトレーニングトークンしか使用しないため、他のモデルが必要とする1.2Tと比較してトレーニングコストを大幅に削減できます。さらに、トレーニングプロセスを最適化することで、マルチモーダルタスクにおいて非常に優れた性能を発揮し、高いトレーニング効率を実現しています。
- 強化学習の強化 OmniVinciはGRPO強化学習フレームワーク内でトレーニングされており、視聴覚および視覚的手法を組み合わせることでモデルの収束速度とパフォーマンスを向上させ、マルチモーダルタスクにおいてより優れた性能を発揮します。
- モデルアーキテクチャの革新 OmniVinciは、OmniAlignNet、時間的埋め込みグループ化、制約付き回転時間埋め込みなどのモジュールを含む、モデルアーキテクチャにいくつかの革新的な技術を取り入れています。これらの技術革新により、マルチモーダルタスクにおけるモデルのパフォーマンスが大幅に向上します。
OmniVinciのプロジェクトアドレス
- プロジェクト公式サイト:https://nvlabs.github.io/OmniVinci/
- GitHubリポジトリ:https://github.com/NVlabs/OmniVinci
- ハギングフェイスモデルライブラリ:https://huggingface.co/nvidia/omnivinci
- arXiv技術論文:https://arxiv.org/pdf/2510.15870
OmniVinciの応用事例
- 動画コンテンツ分析 OmniVinciは、動画内の人物の動き、会話、場面の詳細などを詳細に描写できるため、動画解説、スポーツ分析、ニュース報道など、さまざまな場面に適しており、ユーザーに動画コンテンツへのより深い理解を提供します。
- 医療AI OmniVinciは、医師の口頭説明と医療画像(CTスキャンやMRIなど)を組み合わせることで、複雑な質問に正確に答えることができ、医師が診断や治療計画を立てるのを支援し、医療の効率と精度を向上させます。
- ロボットナビゲーション OmniVinciは音声コマンドでロボットの動作を制御することで、より効率的な人間とコンピュータのインタラクションを実現し、家庭用サービスロボットや産業用ロボットなどのシナリオに適しており、ロボットの知能と柔軟性を向上させます。
- 音声の文字起こしと翻訳 OmniVinciは音声文字起こしと多言語翻訳をサポートしており、リアルタイム会議、音声アシスタント、オンライン教育などのシナリオに適しており、ユーザーの理解とコミュニケーションの向上に役立ちます。
- 工業試験 工業生産において、OmniVinciは半導体デバイスの検査や生産ラインの監視などの用途で、視覚情報と音声情報を組み合わせることができ、検査の精度と効率を向上させると同時に、人件費を削減します。
- スマートセキュリティ OmniVinciは、ビデオ監視システムにおいて、映像内の視覚情報と音声情報を分析することで、異常な行動や事象をリアルタイムで検知し、セキュリティシステムのインテリジェンスレベルを向上させるために使用できます。