project
MOSS-VL-Realtime - OpenMOSS オープンソースのビジュアル言語モデル
MOSS-VL-Realtimeは、OpenMOSSが開発したオープンソースの11パラメータストリーミング視覚言語モデルで、リアルタイムビデオ理解のために特別に設計されています。このモデルは、オンザフライ応答、リアルタイム修正、アクティブミュートをサポートし、録画を見るだけのビデオ理解から、より高度なビデオ理解へと進化させます。
MOSS-VL-Realtimeとは何ですか?
MOSS-VL-Realtimeは、OpenMOSSが開発したオープンソースの11パラメータストリーミング視覚言語モデルで、リアルタイムビデオ理解のために特別に設計されています。このモデルは、オンザフライ応答、リアルタイム修正、アクティブミュートをサポートし、録画視聴からライブストリーム視聴へとビデオ理解のレベルを向上させます。デュアルチャネルクロスアテンションアーキテクチャと絶対タイムスタンプエンコーディングにより、並列知覚と生成を実現し、AIを物理世界と同期させます。複数のストリーミングベンチマークにおいて、最先端のパフォーマンスを達成しています。
MOSS-VL-Realtimeの主な機能
-
リアルタイムビデオ理解動画ストリームを継続的に受信し、動画の終了を待たずに視聴しながら回答を生成する。
-
質疑応答に即座に対応ユーザーはいつでも質問を挿入でき、モデルは現在のフレームに基づいて即座に回答します。
-
アクティブサイレンス機構情報が不十分な場合、または重要なイベントがない場合、モデルは自律的に沈黙し、待機します。
-
動的な解答修正シーンが変化すると、モデルはリアルタイムで以前の回答を調整・修正します。
-
時空間位置認識絶対タイムスタンプ符号化を用いることで、物理的な時間の流れと空間的な位置を正確に把握することができる。
-
長時間のコンテキスト処理長時間の動画ストリームにおける継続的な理解と操作をサポートします。
MOSS-VL-Realtimeの技術原理
-
デュアルチャネル相互注意アーキテクチャ視覚情報はサイドチャネルを通して入力され、テキスト生成とは切り離されているため、知覚と生成が互いに干渉することなく並行して実行される。
-
相互注意の分離動画の特徴抽出とテキスト生成における相互注意計算を分離することで、高頻度フレームのエンドツーエンド遅延を削減する。
-
絶対タイムスタンプエンコーディング各フレームに絶対時間情報を埋め込むことで、モデルが物理的な時間の流れを認識できるようになり、固定フレームレートへの依存を解消します。
-
XRoPE クロスディメンション回転位置エンコーディング: マッピングされたビデオ特徴の空間次元 (h, w) と時間次元 (t) を統合して、統一された時空間表現を構築します。
-
ストリーミングSFTトレーニングパラダイムマルチモーダルコーパスが再構築され、高密度のキャプションがリアルタイムで修正される質疑応答データに変換された。その後、モデルはいつ話すべきか、いつ沈黙すべきかを予測するように訓練された。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
MOSS-VL-Realtime の使い方
- モデルリソースを取得するデモ事例の閲覧や、オープンソースの重みとコードのダウンロードについては、OpenMOSSの公式ウェブサイト(https://openmoss.ai/MOSS-VL/)をご覧ください。
- ハードウェア環境の準備リアルタイム推論と256フレームのビデオシーケンスに対する低遅延応答をサポートするH200グラフィックカードを1枚搭載することをお勧めします。
- モデルの重みをデプロイする11Bパラメータモデルをローカル環境にロードし、依存関係のインストールと重み初期化の設定を完了します。
- ビデオストリームにアクセスフレームデータがモデルに継続的に送信されるように、リアルタイムカメラに接続するか、ビデオストリーム入力をインポートしてください。
- リアルタイムのやり取りを開始する動画再生中はいつでもテキストで質問を入力でき、モデルは現在の画面に基づいて回答を生成または修正します。
MOSS-VL-Realtimeの主な利点
-
ストリーミングオープンソースSOTA複数のストリーミングビデオ理解ベンチマークにおいて、オープンソース技術の中で最高のパフォーマンスを達成しており、そのリアルタイムインタラクティブ機能は業界をリードしています。
-
超低遅延と高スループット単一のH200カードにおける最初のトークン生成時間は約5倍に増加し、デコード処理のスループットは2.7倍に増加した。
-
オフライン機能は損なわれていないV*Bench 89.0とBLINK 78.0は、長尺動画やドキュメント図の理解に関する、依然としてトップクラスのオープンソース基準を満たしています。
-
人間のような相互作用のリズム話すタイミングを自律的に判断でき、割り込み、即時の訂正、自発的な沈黙といった自然な対話行動を自然にサポートする。
-
統合フローサイトメトリー特性評価動画フレーム、ユーザーの質問、モデルとなる回答が単一のトークンシーケンスに組み込まれており、シームレスなリアルタイムのインタラクションが可能になる。
MOSS-VL-Realtimeプロジェクトのアドレス
- プロジェクト公式サイト:https://openmoss.ai/MOSS-VL/
- ハギングフェイスモデルライブラリ:https://huggingface.co/OpenMOSS-Team/MOSS-VL-Realtime
MOSS-VL-Realtime製品と類似競合製品との比較
| 寸法 | MOSS-VL-Realtime | Qwen2.5-VL-7B |
|---|---|---|
| 建築 | クロスアテンションデュアルチャネル、知覚と生成の分離並列処理 | デコーダーのみ、視覚トークン埋め込み自己回帰シーケンス |
| インタラクションモード | リアルタイムでストリーミング配信されるため、視聴、会話、修正を即座に行うことができます。 | オフラインバッチ処理です。統一的な回答を提供する前に、ビデオをご覧ください。 |
| 最初のトークンが遅延しました | 約5倍高速で、応答時間はミリ秒単位です。 | ベースラインレベル、視覚処理によって阻害される |
| デコードスループット | 2.7倍の改善、スムーズな高フレームレート生成 | ベンチマークレベル |
| 積極的な行動 | アクティブミュート、即時修正、および任意の中断をサポートします。 | リアルタイムの行動制御機能はありません |
| 時間感覚 | 絶対タイムスタンプエンコーディング、物理時間の流れを感知する | 相対位置エンコーディングは、固定フレームレートに依存します。 |
| モデルサイズ | 11B オープンソースウェイト | 7B オープンソースウェイト |
MOSS-VL-Realtimeの応用シナリオ
- リアルタイム監視とアラーム街頭監視シーンでは、何も起こっていないときは自動的に消音状態になり、対象が倒れたり、異常な侵入が発生したりした瞬間に警報が作動する。
- イベントのライブ解説このシステムは、サッカーなどのスポーツイベント中に、パス、シュート、得点といった重要な動作をリアルタイムで捉え、同時にプロの解説を提供します。
- プレゼンテーションスライドの読み上げPowerPointのスライドをリアルタイムで追って、各スライドの内容を最初から最後まで、即興で分かりやすく説明してください。
- 実験過程記録タイムラプス撮影を通して植物の成長を観察し、重要な変化を正確に捉え、その変化が起こった具体的な日数を報告する。
- リアルタイムの授業と個別指導手書きの解答過程をご覧ください。数式の各行が書き起こされ、導出の論理が同時に説明されます。