AB
AiBoss
project

毎日更新される新しいFusionモデル - SenseTimeのネイティブFusionモーダルモデル

SenseTime社は、マルチモーダル大規模モデルであるSenseNovaを2025年1月10日に正式に発表しました。このモデルはネイティブな融合モダリティを実現し、深層推論とマルチモーダル情報処理能力の両方を大幅に向上させています。

RiRiXin Fusion Grand Modelとは何ですか?

SenseTimeは、マルチモーダルビッグデータモデル「SenseNova」を2025年1月10日に正式に発表しました。このモデルは、ネイティブなモダリティ融合を実現し、深層推論とマルチモーダル情報処理能力を大幅に向上させています。テキスト、画像、動画など、様々な種類の情報を処理でき、モダリティ間の制約を打ち破ります。権威あるベンチマークであるSuperCLUEとOpenCompassの両方で1位を獲得し、「ダブルチャンピオン」となりました。

Rixin Fusion Modelの主な機能

  • 画像認識と分析ぼやけた文字や複雑なシーンなど、画像内のコンテンツを正確に識別・分析できる。
  • ビデオ処理動画コンテンツを処理し、重要な情報を抽出し、動画の編集や生成を行い、動画のインタラクティブな体験を向上させることができます。
  • 音声認識と音声合成音声処理と自然言語処理の機能を組み合わせることで、音声による顧客サービスやオンライン教育といった場面におけるインタラクティブな体験が向上します。
  • テキスト処理強力なテキスト理解・生成機能を備え、表、テキスト、画像、動画などを組み合わせた複雑なリッチモーダル文書も処理できます。
  • 数学的計算と論理的推論対数関数法を用いて、2の31乗と3の21乗のどちらが大きいかを計算するなど、複雑な数学的問題を解決できます。
  • データ分析と意思決定支援データチャートの情報分析、重要な要素の抽出、結論の導出、そしてユーザーへの意思決定支援を行うことができます。

日々の融合モデルの技術的原理

  • ネイティブ融合モードこのモデルは、テキスト、画像、動画など、複数の種類の情報を同時に処理できるため、単一のテキスト入力しかサポートしない従来の大型言語モデルの限界を克服しています。
  • 融合モーダルデータ合成
    • 逆レンダリング技術逆レンダリング技術を用いることで、画像データとテキストデータが融合され、大量の合成データが生成されます。この合成データは、画像とテキストという2つのモダリティ間に多数の相互作用的な橋渡しを確立し、モデルが両モダリティ間の豊かな関係性をより確実に把握することを可能にします。
    • ハイブリッドセマンティクスに基づく画像生成ハイブリッド意味生成技術を利用することで、融合されたモダリティデータがさらに充実し、モデルのマルチモーダル情報理解能力が向上した。
  • 統合型タスク強化トレーニング多様なクロスモーダルタスクが構築され、モデル学習のための強固な基盤が構築されました。これらのタスクには、従来のテキスト処理タスクだけでなく、画像認識や動画分析といったマルチモーダルタスクも含まれており、モデルが様々なビジネスシナリオにおけるユーザーニーズに効果的に対応できるようになっています。
  • 深い推論能力
    • 芸術と科学の両方におけるバランスの取れた教育SuperCLUEの年次評価において、人文科学のスコアは81.8点で世界第1位となり、科学のスコアは金メダルを獲得した。計算能力の分野では、中国国内で78.2点を獲得し第1位となった。
    • 複雑な問題解決表、テキスト、画像、動画などを組み合わせた複雑で多機能な文書を処理でき、詳細な推論支援機能も提供します。

RiRiXin Fusion Large Modelのプロジェクトアドレス

日々の融合モデルの応用シナリオ

  • 自動運転複雑なマルチモーダル情報を処理し、意思決定能力を向上させることができる。
  • ビデオインタラクション動画コンテンツの生成、編集、分析の効率を向上させる。
  • オフィス教育複雑で多様な情報を含む文書を効率的に処理し、オフィスや教育現場の効率性を向上させます。
  • ファイナンス複数の情報源から得られる多様なデータを分析・処理し、正確なリスク評価と投資アドバイスを提供する。
  • 公園管理公園の管理効率と安全性を向上させるため。
  • 工業生産生産工程と品質管理を最適化する。