AB
AiBoss
project

LingBot-Depth 2.0 - Antminer Lingbo Technologyが発表した空間認識モデル

LingBot-Depth 2.0は、Antminer Technologyがオープンソースの視覚基盤モデルLingBot-Visionとともに発表した、実世界のシナリオに対応した空間認識モデルです。トレーニングデータは300万件から1億5000万件に拡張され、16種類の深層学習アルゴリズムが含まれています。

LingBot-Depth 2.0とは何ですか?

Antminer Lingbo Technologyがオープンソースの視覚基盤モデルLingBot-Visionと共に発表した、実世界シナリオ向けの空間認識モデルLingBot-Depth 2.0。トレーニングデータは300万件から1億5000万件に拡張され、16の深度補完ベンチマークのうち12で1位を獲得。広範囲の深度不足屋内シーンにおけるRMSE誤差は0.132から0.062に減少。ガラスや鏡などの透明な物体があるシーンで特に優れた性能を発揮し、Orbbecの専門認証を取得。ロボットの「理解」から「正確な認識」への能力連鎖を確立した。

LingBot-Depth 2.0の主な機能

  • ディープコンプリーションRGB画像と疎な深度入力に基づいて、高精度で密な深度マップが生成される。
  • 透明な物体の知覚ガラス、鏡、蛇口などの透明/反射性物体の完全な3D構造再構築を実現します。
  • 高精度エッジ認識サブピクセルレベルの境界位置特定機能を備えており、物体の輪郭や微細な構造を正確に識別できます。
  • タイミングの安定性ビデオストリームにおける深度推定の時間的一貫性と空間的精度を維持する。
  • シナリオ横断的な一般化屋内および屋外環境、複雑な照明条件、さまざまな素材など、リアルなシーンを網羅しています。

LingBot-Depth 2.0の技術的原則

  • デュアルモデル協調アーキテクチャLingBot-Depth 2.0は単一のネットワークではなく、「ベースモデル+タスクヘッド」という2層構造の協調アーキテクチャを採用しています。下層のLingBot-VisionはRGB画像から境界と空間構造の特徴を抽出する役割を担い、上層のLingBot-Depthはこれらの特徴に基づいて、疎またはノイズの多い深度データから密な深度マップへのマッピングを完了します。この分離設計により、視覚表現と深度推定はそれぞれの強みに集中することができ、「理解」から「正確な視覚」まで、ロボットの完全な機能連携を実現します。
  • LingBot-Vision:境界構造の事前学習LingBot-Visionは、業界初の「境界構造」を明示的な事前学習目標として採用したビジュアル基盤モデルです。幾何学的モデリングを用いて、「物体の位置、エッジの分布、空間構成」といった構造的知識を学習することで、サブピクセルレベルの境界位置特定能力を実現しています。事前学習にわずか1億6000万枚の画像しか使用していないにもかかわらず、数十億枚の画像に依存する一般的なビジュアル基盤モデルに比べて、物体の輪郭、表面境界、微細構造の認識における明瞭さと安定性に優れています。
  • 深層完了メカニズムLingBot-Depth 2.0の深度補完ネットワークは、LingBot-Visionが提供する境界認識機能に基づいています。エンコーダで深度の不連続性を識別し、デコーダでマルチスケール特徴融合を実行します。オブジェクトのエッジの鮮明さを維持しながら、滑らかな領域では適切な補間を行います。重要なのは、モデルが深度伝播の制約として明示的な境界構造特徴を使用している点です。これにより、従来の深度補完でよく見られる「深度オーバーフロー」問題を効果的に防止し、前景と背景がオブジェクトの境界で正しく切り捨てられることを保証します。同時に、ビデオストリーム入力におけるフレーム間の深度の一貫性を確保するために、時間的特徴アライメント機構が導入されています。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

LingBot-Depth 2.0 の使い方

  • モデルを取得するLingBot-Visionのオープンソースの重みデータは、HuggingFaceまたはModelScopeからダウンロードしてください。
  • クローンコードコードと技術レポートは、GitHubリポジトリ(https://github.com/robbyant/lingbot-vision)から入手できます。
  • 環境設定ドキュメントに従って依存環境を設定し、RGB-D入力データを準備してください。
  • 推論の呼び出し: ディープ補完推論用のモデルをロードするか、LingBot-Vision に基づいて下流のビジョンタスクをトレーニングします。
  • エンドサイド統合Orbbec Gemini 330シリーズのカメラを使用し、SDKを介してLingBot-Depth商用版の機能を統合します。

LingBot-Depth 2.0の主な利点

  • データ規模の分野で業界をリード学習データは1億5000万件に達し、前世代の50倍となり、より幅広い現実世界のシナリオを網羅している。
  • 優れたテスト結果16項目のディープコンプリーションベンチマークテストのうち、12項目で1位を獲得した。
  • エラーが大幅に減少奥行き情報が欠落している領域が多い屋内シーンでは、RMSE誤差は前世代と比較して半減しています。
  • 透明シーンにおける画期的な進歩ガラスや鏡など、従来の深度カメラが誤作動を起こすような状況において、特に優れた性能を発揮します。
  • ハードウェア認証サポートOrbbec Deep Vision Labの専門認証に合格しており、エッジの鮮明度と堅牢性が大幅に向上しています。

LingBot-Depth 2.0のプロジェクトアドレス

  • プロジェクト公式サイト:https://technology.robbyant.com/lingbot-vision
  • GitHubリポジトリ:https://github.com/robbyant/lingbot-vision
  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/robbyant/lingbot-vision

LingBot-Depth 2.0と類似の競合製品との比較

比較対象寸法 LingBot-Depth 2.0 Depth Anything V2
テクニカルルート 境界構造と深度補完に基づいて事前学習された視覚的台座モデル DINOv2に基づく判別モデル + 合成データと擬似ラベルを用いた学習
データスケール 1億5000万件の実世界のトレーニングデータポイント 59万5000枚の合成画像 + 6200万枚の擬似注釈付き実画像
中核的な利点 透明/反射物体、高精度エッジ認識、ロボットシーン最適化 単眼深度推定、マルチスケールモデル、高速推論速度
オープンソースの状況 LingBot-Visionのバージョン4(ViT-G/L/B/S)がオープンソース化されました。 オープンソース版が4種類あります(SmallはApache 2.0、その他はCC-BY-NC-4.0ライセンスです)。
工業用地 Orbbec社との緊密な連携のもと、SDKとオールインワンカメラを発売しました。 主に学術研究および一般的なシナリオ

LingBot-Depth 2.0の応用シナリオ

  • 家庭用サービスロボットこれにより、キッチンや浴室など、ガラス、鏡、蛇口のある環境でも、正確なナビゲーションと操作が可能になります。
  • 工業品質検査透明包装材および反射性金属部品の三次元寸法測定と欠陥検出を実施する。
  • 倉庫保管および物流複雑な照明設備を備えた倉庫内で、商品や小さな物体の輪郭を識別し、ロボットアームがそれらを掴むのを支援する。
  • 自動運転道路シーンの奥行き情報を補完し、透明な障害物(ガラスカーテンウォールなど)の認識を向上させる。
  • データ収集装置Orbbec EGOなどのRGB-D取得装置に統合することで、身体を使ったインテリジェントトレーニングのための正確な実世界データを提供する。