project
NEO - SenseTimeと南洋理工大学がオープンソース化した、全く新しいマルチモーダルモデルアーキテクチャ。
NEOは、SenseTimeと南洋理工大学が共同開発した革新的なマルチモーダルモデルアーキテクチャです。初のネイティブマルチモーダルアーキテクチャ(ネイティブVLM)として、NEOは基盤となるアーキテクチャの抜本的な革新により、従来のマルチモーダルモデルの限界を打ち破ります。
NEOとは何ですか?
NEOは、SenseTimeと南洋理工大学が共同開発した革新的なマルチモーダルモデルアーキテクチャです。初のネイティブマルチモーダルアーキテクチャ(Native VLM)として、NEOは基盤となるアーキテクチャの抜本的な革新により、従来のマルチモーダルモデルの限界を打破します。主な革新技術として、画像の詳細をより正確に捉えるネイティブパッチ埋め込み、画像とテキストの自然な構造に完璧に適応するネイティブ3D回転位置エンコーディング(Native-RoPE)、複雑な画像とテキストの関係性を理解するモデルの能力を高めるネイティブマルチヘッドアテンションなどが挙げられます。NEOはデータ効率、パフォーマンス、推論コスト効率に優れ、比較的少ないデータで最高レベルの視覚認識能力を実現し、複数の権威ある評価で優れた結果を達成しています。SenseTimeはNEOモデルの2Bバージョンと9Bバージョンの両方をオープンソース化し、ネイティブマルチモーダル技術の産業応用を促進し、次世代マルチモーダル技術の標準構築に貢献しています。
NEOの主な機能
-
ネイティブマルチモーダル融合NEOは、その基盤となるアーキテクチャ設計を通じて画像とテキストの高度な統合を実現し、従来のマルチモーダルモデルのモジュール的な制約を打破することで、画像とテキストが混在するコンテンツをより自然に処理することを可能にする。
-
効率的なデータ活用NEOは、わずか少量のデータ(例えば、3億9000万件の画像テキスト例)で最高レベルの視覚認識能力を実現し、データ利用効率を大幅に向上させ、トレーニングコストを削減します。
-
優れたパフォーマンスNEOは、複数の権威ある評価において優れた性能を発揮し、画像理解、テキスト生成、グラフとテキストの推論といったタスクにおいて高品質な出力を提供している。
-
高い推論コスト効率特にパラメータ数が小規模から中規模(0.6B~8Bなど)の場合、NEOはエッジでの展開と推論効率において優れた性能を発揮するため、幅広い実用的なアプリケーションシナリオに適しています。
-
オープンソースのコラボレーションと拡張SenseTimeは、開発者や研究者がこのアーキテクチャをさらに開発・応用することを奨励し、マルチモーダル技術の産業化を促進するために、NEOの2Bと9Bという2つのモデルをオープンソース化しました。
NEOの技術原理
-
ネイティブパッチ埋め込みボトムアップ型の連続マッピングを用いることで、画像ピクセルがモデルに直接埋め込まれ、従来の画像トークナイザーにおける離散化処理を回避し、画像の詳細をより正確に捉え、画像モデリング能力を向上させる。
-
ネイティブ3D回転位置エンコーディング(Native-RoPE)この技術は、画像とテキストの3次元空間時間周波数割り当てを革新的に分離し、画像には高周波コードを、テキストには低周波コードを割り当てることで、2つのモダリティの自然な構造によりよく適応し、複雑なシーンにおける空間構造の関連付けをサポートします。
-
ネイティブマルチヘッドアテンション統一されたフレームワーク内で、テキストに対する自己回帰型アテンションと画像に対する双方向型アテンションを同時に実現し、テキストと画像の関係性を理解するモデルの能力を高め、複雑なテキストと画像が混在する理解および推論タスクをサポートする。
-
基盤となるアーキテクチャの革新基盤となるアーキテクチャから出発し、単純なモジュール接続ではなく、マルチモーダルモードの深い統合を実現することで、従来のマルチモーダルモデルのパフォーマンス上のボトルネックを根本的に打破し、モデル全体の効率を向上させています。
-
効率的な訓練と推論最適化されたアーキテクチャ設計により、NEOは特に小規模から中規模のパラメータスケールにおいて、トレーニングと推論の効率が向上し、計算コストの削減と推論速度の向上を実現しているため、幅広い実用的なアプリケーションに適しています。
NEOのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/EvolvingLMMs-Lab/NEO
- arXiv技術論文:https://arxiv.org/pdf/2510.14979
NEOの応用シナリオ
-
画像とテキストの生成NEOは、テキストの説明に基づいて高品質な画像を生成したり、画像の内容に基づいて正確なテキストの説明を生成したりできるため、クリエイティブデザイン、コンテンツ制作、その他の分野に適しています。
-
インテリジェントな検索とレコメンデーションNEOは画像やテキストの深い意味を理解することで、より正確な検索結果とパーソナライズされたおすすめ情報をユーザーに提供し、ユーザーエクスペリエンスを向上させることができます。
-
マルチモーダルな質問応答NEOは、画像とテキストを組み合わせた質疑応答タスクを処理でき、画像とテキストの情報を組み合わせることでより正確な回答を提供するため、教育や顧客サービスなどのシナリオに適しています。
-
インテリジェントドライビングとロボットビジョンNEOの効率的な画像認識機能は、インテリジェントドライビングにおけるシーン認識や物体認識、さらにはロボットビジョンにおける環境認識やナビゲーションに活用できる。
-
産業検査および監視NEOは画像内の異常や欠陥を迅速かつ正確に識別できるため、工業生産における品質検査および監視システムに適している。
-
医用画像解析NEOは、医師が医用画像を分析・診断する際に役立ち、医療記録のテキスト情報を組み合わせることで、より包括的な診断提案を提供することができます。