AB
AiBoss
project

LingBot-Vision - Antminer Lingbo Technologyがオープンソース化した汎用ビジュアル基盤モデル

LingBot-Visionは、Ant Lingbo Technologyが開発したオープンソースの汎用視覚基盤モデルです。業界で初めて境界構造を事前学習のターゲットとして使用し、幾何学的モデリングを採用することで、空間認識学習パラダイムにおける画期的な進歩を実現しました。

LingBot-Visionとは何ですか?

LingBot-Visionは、Antminer Technology社が開発したオープンソースの汎用ビジョン基盤モデルです。業界で初めて境界構造を事前学習のターゲットとして使用し、幾何学的モデリングを採用することで、空間認識学習パラダイムに画期的な進歩をもたらしました。わずか1億6000万枚の画像データセットで学習されたこのモデルは、サブピクセルレベルの境界位置特定と空間構造理解能力を備えています。動画内のオブジェクト境界の連続追跡をサポートし、ViT-G、L/B、Sの4つのオープンソースバージョンが利用可能です。

LingBot-Visionの主な機能

  • 境界構造の事前学習境界構造を事前学習のターゲットとして使用したのは業界では今回が初めてであり、空間認識のパラダイムにおいて画期的な成果を達成した。
  • サブピクセルレベルの境界位置決め高精度な物体境界認識能力と空間構造理解能力を備えている。
  • ビデオ連続追跡動画内の物体境界を安定かつ継続的に追跡し、時間的な一貫性を維持することができる。
  • 多目的型深度補完をサポートするだけでなく、一般的な視覚表現機能とマルチタスク転送機能も備えています。
  • マルチ仕様のオープンソースさまざまな導入ニーズに対応できるよう、ViT-G、L/B、Sの4つのパラメータスケールを提供します。

LingBot-Visionの技術原理

  • 幾何モデリングのパラダイムにおける画期的な進歩従来の視覚基盤モデルは、主に識別型の自己教師あり事前学習を採用し、対照学習やマスク再構成によって一般的な視覚表現を学習します。空間知覚のニーズに対応するLingBot-Visionは、幾何学的モデリングパラダイムを先駆的に導入し、視覚理解の中核を意味的分類から構造分析へと移行させます。オブジェクトの境界と空間的関係をモデル化することで、物理世界に合わせた視覚表現を構築します。
  • 境界構造の事前学習ターゲット業界初の視覚基盤モデルとして、境界構造を主要な事前学習目標として確立するLingBot-Visionは、事前学習段階で、オブジェクトの輪郭の幾何学的連続性、エッジの曲率変化、および隣接するサーフェスの空間トポロジー関係をモデルに学習させます。これにより、モデルのエンコーダーはオブジェクトの境界に対して自然と高い感度を持つようになります。
  • サブピクセルレベルの境界位置決めメカニズムLingBot-Visionは、高精度な幾何学的監視信号によって、サブピクセルレベルの境界位置特定機能を実現します。このモデルは、実際の物体のエッジとテクスチャノイズを区別でき、透明な物体や反射面などの低コントラストシーンでも物体の輪郭を正確に推測できるため、従来の深度カメラでは対応できない領域の3D構造を補完できます。
  • 効率的なデータトレーニング戦略LingBot-Visionの事前学習用コーパスはわずか1億6000万枚の画像で構成されており、DINOv3よりも桁違いに少ない。構造化された幾何学的事前知識に基づいた学習を通して、視覚モデルは明確な物理的制約の下で、より少ないデータでより強力な空間認識能力を学習できることを実証している。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

LingBot-Visionの使い方

  • モデルをダウンロードHuggingFaceまたはModelScopeリポジトリにアクセスして、ViT-G/L/B/Sバージョンの重みファイルを入手してください。
  • コードの読み取り推論の例やAPIドキュメントを確認するには、GitHubのオープンソースリポジトリをクローンしてください。
  • 統合展開モデルの重みをビジュアルエンコーダーモジュールにロードし、順方向推論用の既存のバックボーンネットワークを置き換えます。
  • 微調整適応オープンソースの重み付けは、下流のタスクデータに基づいて微調整され、特定のアプリケーションシナリオに移行されます。

LingBot-Visionの主な利点

  • トレーニングデータの効率性このモデルは事前学習に1億6000万枚の画像を必要とするが、これはDINOv3よりも桁違いに少なく、データ効率が大幅に向上する。
  • 正確な境界認識主流のモデルと比較して、物体の境界や空間構造をより明確かつ安定的に識別できる。
  • 空間認識能力がネイティブレベルこれは、空間認識に特化した幾何学的モデリング手法を用いて設計されており、従来のビジュアルベーシックモデルのパラダイムを打破するものです。
  • ビデオトラッキングの安定性動画内の物体境界を継続的に追跡する能力を持ち、優れた時間的一貫性を示す。
  • オープンソースのエコシステムの改善モデルの重み付け、技術レポート、およびコードはすべて完全にオープンソースであり、複数の仕様を柔軟に選択できるようになっています。

LingBot-Visionプロジェクトのアドレス

  • プロジェクト公式サイト:https://technology.robbyant.com/lingbot-vision
  • GitHubリポジトリ:https://github.com/robbyant/lingbot-vision
  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/robbyant/lingbot-vision
  • arXiv技術論文:https://github.com/robbyant/lingbot-vision/blob/main/paper.pdf

LingBot-Visionと類似の競合製品との比較

比較対象寸法 LingBot-Vision DINOv3
事前研修の目標 業界初の「境界構造」幾何モデリング 自己教師あり識別型事前学習
トレーニングデータ量 1億6000万枚の画像 約10億枚の画像
境界位置 サブピクセルレベルの精度で、より鮮明で安定した認識を実現します。 一般的な特徴抽出は行われているが、境界の詳細は比較的ぼやけている。
ビデオ機能 オブジェクトの境界を継続的に追跡することをサポートします。 主に静止画像表現に特化
空間認識 ネイティブな空間認識最適化 空間固有のものではない、一般的な視覚表現

LingBot-Visionの応用シナリオ

  • 具現化されたインテリジェントビジョンこれはロボットに正確な空間構造認識能力と境界認識能力を提供し、ナビゲーションと操作を支援する。
  • 深層完成強化LingBot-Depth 2.0の基幹ネットワークとして、透明/反射物体の深度推定精度を向上させます。
  • 工業品質検査このモデルは、サブピクセルレベルの境界位置決めを使用して、コンポーネント内の微細な欠陥や輪郭のずれを検出します。
  • 自動運転の知覚道路境界および障害物エッジ認識の安定性を向上させ、環境認識の信頼性を高める。
  • 動画コンテンツ分析映像シーケンス内の対象物の境界を継続的に追跡し、セキュリティ監視と行動分析をサポートします。