project
GO-1 - 智源ロボティクスが発表した初の汎用ボディベースモデル
GO-1(Genie Operator-1)は、Zhiyuan Roboticsが発表した初の汎用型具現化ベースモデルです。このモデルは、Vision-Language-Latent-Action(ViLLA)アーキテクチャを採用しており、VLM(Vision-Language-Latent-Action)と...で構成されています。
GO-1とは何ですか?
GO-1(Genie Operator-1)は、Zhiyuan Roboticsが発表した初の汎用具現化ベースモデルです。このモデルは、Vision-Language-Latent-Action(ViLLA)アーキテクチャを採用しており、VLM(Multimodal Large Model)とMoE(Hybrid Expert)で構成されています。VLMは、膨大な量のインターネット画像とテキストデータを活用して、モデルに一般的なシーン認識と言語理解能力を与えます。MoEの潜在プランナーは、大量のクロスオントロジーと人間の操作ビデオデータを通じて一般的な動作理解能力を獲得し、アクションエキスパートは、数百万の実際の機械データに基づいてきめ細かな動作実行を実現します。
GO-1の主な機能
- 人間のビデオ学習人間の行動に関する大量のビデオデータを分析することで、このモデルは現実世界における動作に関する知識を学習・理解し、新しいタスクに迅速に適応することができる。
- 小さなサンプルを用いた高速な一般化GO-1は、ごくわずかなデータ、あるいはサンプルが全くない場合でも、新しいシナリオやタスクに迅速に一般化することができ、具現化された知能の応用における敷居を下げる。
- 一つの脳、複数の形態、異種オントロジー応用GO-1は様々なタイプのロボット本体に柔軟に搭載でき、多様なロボット形態に対応し、極めて高い汎用性と柔軟性を発揮します。
- 継続的な進化実用上、GO-1は継続的に学習して自身の性能を最適化することができ、データフィードバックシステムを通じて、実際の実行で遭遇する問題データから継続的に進化し、使用すればするほど賢くなります。
- 高効率なアクション実行数百万件の実機データセットで学習されたアクションエキスパートは、高度で効率的なアクション実行機能を備えています。
GO-1の計算原理
- VLM(マルチモーダル大規模モデル)VLM(ビジュアルモデリング)は、膨大な量のインターネット画像データとテキストデータを活用し、モデルに卓越した汎用的なシーン認識能力と言語理解能力を与えます。画像内の情報を正確に識別・理解すると同時に、テキストデータと効率的に融合させることで、複雑なシーンを包括的に理解することが可能です。
- MoE(ハイブリッドエキスパートシステム)MoEシステムは、モデルの理解力と動作実行能力をさらに向上させます。具体的には以下のとおりです。
- 潜在的プランナー大量の異種オントロジーおよび人間の操作に関するビデオデータを分析することにより、一般的な動作計画ロジックを習得しました。
- アクションエキスパートこれは数百万件の実際の機械データで学習されており、正確かつ効率的な動作実行能力を備えています。
GO-1プロジェクトの住所
- プロジェクト公式サイト:https://agibot-world.com/blog/go1
- GitHubリポジトリ:https://github.com/OpenDriveLab/AgiBot-World
- ハギングフェイスモデルライブラリ:https://huggingface.co/agibot-world/GO-1
- 技術論文:https://agibot-world.com/blog/agibot_go1
GO-1の応用シナリオ
- 小売サービス小売環境において、GO-1はサービスロボットとして導入され、顧客案内、商品に関する問い合わせ対応、レジでの会計補助などのサービスを提供することができる。
- 受付と相談ホテル、レストラン、オフィスビルなどの場所では、GO-1は受付ロボットとして機能し、情報提供、予約確認、道案内などのサービスを提供することができる。
- 生産ラインのサポート製造業において、GO-1は部品の取り扱いや組み立てといった、組立ラインにおける反復作業の完了を支援することができる。
- 家事手伝い家庭環境において、GO-1は掃除や片付けといった日常的な家事を手伝う家事補助役として役立つ。
- 科学探査GO-1は、極限環境下での試料採取やデータ分析など、科学研究に活用できる。