AB
AiBoss
project

MiniCPM-V 4.5 - Wallfacer Intelligence社のオープンソースエッジマルチモーダルモデル

MiniCPM-V 4.5は、Facewall Intelligence社が開発したエッジサイドマルチモーダルモデルで、8ビットパラメータを特徴としています。このモデルは、画像処理、ビデオ処理、OCRなど複数の分野で優れた性能を発揮し、特に高リフレッシュレートビデオの理解において画期的な成果を上げており、高リフレッシュレートビデオの処理にも対応可能です。

MiniCPM-V 4.5とは何ですか?

MiniCPM-V 4.5は、Facewall Intelligence社が開発したエッジサイド向けマルチモーダルモデルで、80億個のパラメータを搭載しています。画像、動画、OCRなど複数の分野で優れた性能を発揮し、特に高リフレッシュレート動画の理解において画期的な成果を上げています。高リフレッシュレート動画の処理とコンテンツの高精度な認識が可能で、パフォーマンスと応答速度のバランスを取るハイブリッド推論モードをサポートしています。MiniCPM-V 4.5は、メモリ使用量が少なく推論速度が速いため、エッジサイドへの導入に適しており、車両、ロボット、その他のデバイスへの応用にも最適です。エッジAI開発の新たなベンチマークとなるでしょう。

MiniCPM-V 4.5の主な機能

  • 高リフレッシュレート動画の理解高リフレッシュレートの動画処理に対応し、画面上の急速に変化するコンテンツを正確に識別します。例えば、3秒間の紙をめくる動画において、各紙の上で急速に変化するテキストを認識することが可能です。
  • 単一画像理解画像理解能力に優れ、画像内の物体、シーン、その他の情報を正確に識別・分析し、多くの大規模なクローズドソースモデルを凌駕する性能を発揮します。
  • 複雑な文書の認識手書き文字や構造化された表の抽出など、複雑な文書内のテキストや表などの情報を効率的に認識・解析できます。
  • OCR機能強力な光学文字認識機能を備えており、画像内のテキストコンテンツを正確に認識し、さまざまなフォントやレイアウトに対応しています。
  • ハイブリッド推論モード本システムは「長期的思考」と「短期的思考」の両方のモードをサポートしており、さまざまなシナリオのニーズに対応するため、詳細な分析と迅速な対応を可能にします。

MiniCPM-V 4.5の技術原理

  • 3Dリサンプラー高密度ビデオ圧縮モデル構造は2Dリサンプラーから3Dリサンプラーに拡張され、推論オーバーヘッドを変更することなくより多くのビデオフレームを取得するために3Dビデオクリップに対して高密度圧縮が実行され、96倍の視覚的圧縮率と動的プロセスのより良い理解が実現されます。
  • 統合型OCRと知識推論学習画像内の「テキスト情報の可視性」を制御することで、OCRモードと知識学習モードをシームレスに切り替え、OCRと知識学習を効果的に統合して、モデルのテキスト認識能力と知識推論能力を向上させます。
  • 汎用ドメインハイブリッド推論強化学習RLPR技術を活用することで、汎用ドメインのマルチモーダル推論データから高品質な報酬信号が得られ、ハイブリッド推論強化学習スキームを用いて、通常思考モードと深層思考モードの両方でモデルのパフォーマンスが向上します。

MiniCPM-V 4.5 プロジェクトアドレス

  • GitHubリポジトリ:https://github.com/OpenBMB/MiniCPM-V
  • ハギングフェイスモデルライブラリ:https://huggingface.co/openbmb/MiniCPM-V-4_5
  • オンラインでデモを体験してくださいhttp://101.126.42.235:30910/

MiniCPM-V 4.5の適用シナリオ

  • インテリジェントドライビング道路標識、信号機、歩行者をリアルタイムで識別できるため、ドライバーにより正確な道路状況情報を提供し、運転の安全性と利便性を大幅に向上させる。
  • 知能ロボット家庭環境や産業環境において、ロボットが周囲の状況をリアルタイムで認識し、物体や人間の動きを認識し、より合理的な対話行動をとるのに役立つ。
  • スマートホーム家庭用セキュリティシステムで使用されるこのシステムは、家庭環境をリアルタイムで監視し、異常な行動を検知して速やかに警報を発するほか、周囲の光量や人の位置に基づいて家電製品を自動的に調整します。
  • 教育学生は写真を撮ったり画像をアップロードしたりすることで、モデルが教科書内の図表、数式、その他の情報を認識・分析し、詳細な説明やガイダンスを得ることができ、学習効率を向上させることができる。
  • 健康管理医療分野では、X線やCTスキャンなどの医用画像における異常領域を迅速に特定・分析することができ、医師がより効率的かつ正確な診断を行うのに役立つ。