project
MiniCPM-o 4.5 - Wallfacer Intelligence社のオープンソース全二重全モードモデル
MiniCPM-o 4.5は、Wallfacerのオープンソース9Bパラメータフルモーダルフラッグシップモデルであり、SigLip2、Whisper、CosyVoice2、Qwen3-8Bを統合したエンドツーエンドアーキテクチャを採用しています。
MiniCPM-o 4.5とは何ですか?
MiniCPM-o 4.5は、Mianbi Intelligentが開発したオープンソースの90億パラメータフルモーダルフラッグシップモデルで、SigLip2、Whisper、CosyVoice2、Qwen3-8Bを統合したエンドツーエンドアーキテクチャを採用しています。業界で初めて「リアルタイム自由対話」をサポートするモデルとして、従来のターン制「トランシーバー」モードから脱却し、ユーザーが同時に見て、聞いて、話すことができる全二重通信を実現しています。このモデルは、優れた視覚理解力、超人間的な音声生成、音声クローン機能を誇り、プロアクティブなインタラクションとリアルタイムストリーミングメディア処理をサポートします。エッジデバイス上で動作し、AscendやHygonなどの様々な国内チップと互換性があり、llama.cppやvLLMなどのフレームワークを通じて効率的な展開が可能です。
MiniCPM-o 4.5の主な機能
-
全二重リアルタイム通信このモデルは、視覚情報と音声情報を同時に処理し、音声出力を生成することで、ユーザーが同時に見て、聞いて、話すことができる並列的な知覚と表現を可能にする。
-
能動的で知的なインタラクションこのモデルは、環境の変化を1秒ごとに自律的に監視し、いつ話すべきかを事前に判断し、事前のリマインダーやリアルタイムのコメントなど、人間のような対話的な行動を可能にする。
-
超人的な音声合成豊かな感情表現と自然な音色を備えたエンドツーエンドの音声生成をサポートし、数秒の音声サンプルに基づいてカスタマイズされた音声を複製できるだけでなく、長時間の音声合成においても安定性と一貫性を維持します。
-
視覚的な理解をリードするOpenCompassベンチマークにおいて、9BパラメータでGPT-4oおよびGemini 2.0 Proを上回り、高解像度画像解析と高フレームレート動画のリアルタイム理解をサポートしました。
-
エンドツーエンドの文書解析OmniDocBenchベンチマークにおいて業界トップクラスの性能を発揮し、複雑なレイアウトを持つ構造化された英語文書の理解や抽出といったタスクを効率的に処理します。
MiniCPM-o 4.5の技術原理
- エンドツーエンドのフルモーダルアーキテクチャ設計MiniCPM-o 4.5は、密な特徴接続を用いて、SigLip2ビジュアルエンコーダ、Whisper-mediumオーディオエンコーダ、CosyVoice2音声デコーダ、およびQwen3-8B言語モデルのエンドツーエンドの共同学習を実行します。この緊密結合設計により、各モダリティからの情報がモデル内で自由に流れるため、従来のパイプラインアーキテクチャにおける情報損失やエラー蓄積を回避し、より正確なマルチモーダル理解と生成制御を実現します。
- 全二重マルチモーダルリアルタイムストリーミングメカニズムこのモデルは、オフラインモードコーデックをストリーミング入出力に対応したオンラインバージョンに変換します。音声デコーダは、テキストと音声トークンのインターリーブモデリング手法を用いて全二重生成を実現します。推論時には、時分割多重化メカニズムによって並列マルチモーダルデータストリームがミリ秒単位の時間スライス内の連続情報グループに分割され、言語モデルのバックボーンが均一にスケジューリングおよび処理されることで、単一のアーキテクチャ内でリアルタイムの音声および映像ストリームの同期的な知覚と応答を効率的に完了できます。
- 能動的かつ双方向的な意思決定メカニズム言語モデルモジュールは、入力されたビデオおよびオーディオストリームを継続的に監視し、1Hzの周波数で音声判定を自動的に実行します。この高頻度判定機能と全二重通信特性を組み合わせることで、モデルは環境の動的な変化に基づいて応答する最適なタイミングと内容を自律的に選択することができ、ユーザーの指示を待つだけの従来のモデルの限界を克服します。
- 設定可能な音声モデリング設計このモデルは、マルチモーダルなシステムキューという設計パラダイムを継承し、テキストと音声の両方のシステムキューを入力としてサポートします。音声システムキューは、目標とする音色特性を指定するために使用されます。この設計により、推論フェーズで短い参照音声サンプルのみを提供することで、音声クローニングやロールプレイングを実行できます。
MiniCPM-o 4.5 プロジェクトアドレス
- GitHubリポジトリ:https://github.com/OpenBMB/MiniCPM-o
- ハギングフェイスモデルライブラリ:https://huggingface.co/openbmb/MiniCPM-o-4_5
- オンラインでデモを体験してください:https://huggingface.co/spaces/openbmb/minicpm-omni
MiniCPM-o 4.5の適用シナリオ
- スマートアシスタントとコンパニオン総合的なAIアシスタントとして、このモデルはユーザーの環境や感情をリアルタイムで認識し、リマインダー、提案、感情的なサポートを積極的に提供し、パーソナライズされた音声クローンをサポートし、独自のインタラクティブな体験を生み出すことができます。
- リアルタイムのビデオインタラクションビデオ監視分析、生放送解説、遠隔授業や個別指導といった場面に適しています。画面の内容と音声コマンドを同時に理解し、リアルタイムで音声フィードバックを提供できます。
- インテリジェントな顧客サービスとショッピングガイド電子商取引、金融、行政などの分野で、自然で流暢な音声サービスを提供し、複数回の対話や積極的な提案をサポートすることで、ユーザーのサービス体験とビジネスコンバージョン効率を向上させます。
- 教育と訓練言語学習の練習、バーチャル教師、技能訓練などに利用され、視覚的なデモンストレーションと音声による説明を組み合わせることで、没入型のインタラクティブな教育を実現します。
- コンテンツ制作とエンターテイメントオーディオブックの生成、仮想キャラクターの音声演技、ゲーム内のNPCとのやり取りなどに対応しています。音声クローン機能を使えば、ロールプレイングゲームで特定のキャラクターの声を素早く再現できます。