project
Seed GR-3 - ByteDanceが汎用ロボットモデルを発表
Seed GR-3は、ByteDanceのSeedチームが開発した汎用ロボットモデルで、高い汎用性、長距離タスク処理能力、柔軟な物体操作能力を備えています。
Seed GR-3とは何ですか?
Seed GR-3は、ByteDanceのSeedチームが開発した汎用ロボットモデルです。高い汎用性、長距離タスク処理能力、柔軟な物体操作能力を誇ります。Seed GR-3は、視覚、言語、動作情報を統合した「頭脳」、ロボットデータ、VR人間の軌跡データ、公開されているテキストおよび画像データの3種類のデータを組み合わせた学習方法、そしてカスタマイズされた柔軟な「ボディ」であるByteMiniを統合することで、新しい物体、新しい環境、複雑なコマンドを理解し、実行することを可能にします。GR-3は、長シーケンスタスク、両腕協調動作、柔軟な物体操作において卓越した性能を発揮し、汎用ロボットの「頭脳」実現に向けた大きな一歩となります。
種子GR-3の主な機能
- 高い汎化能力新しい物体、新しい環境、そして抽象的な概念を含む複雑な指示にも適応できる。
- 長期タスク処理食卓の掃除といった複雑な家事など、複数の手順を要する作業を効率的に完了させるのに役立ちます。
- 柔軟なオブジェクト操作吊り下げられた衣類などの柔軟な物体を精密に操作することができ、馴染みのない種類の衣類にも対応可能です。
- 素早い微調整少量の人間移動データに基づいて効率的に微調整を行い、新しいタスクにも迅速に適応できる。
- 両腕の協調動作両手を使った共同作業、例えば両手を使って複雑な動作を完了するなどの作業をサポートします。
- 全身操作能力シャーシの動きと組み合わせることで、全身を使った操作が可能になり、より多くの状況に対応できるようになります。
種子GR-3の技術的原理
- フュージョンブレインMixture-of-Transformers (MoT) ネットワークアーキテクチャは、ビジョン言語モジュールとアクション生成モジュールを組み合わせて、40億個のパラメータを持つエンドツーエンドモデルを形成します。アクション生成モジュールは、フローマッチングに基づいてアクションを生成するために、Diffusion Transformer (DiT) を使用します。
- 3つの要素を組み合わせたデータトレーニング方法:
- ロボットデータ遠隔操作に基づいて、高品質なロボットの動作軌跡が収集される。
- VR人間の軌跡データVRデバイスを用いて人間の動作軌跡を収集することで、学習効率を向上させることができる。
- 公開されている画像データとテキストデータ大規模な視覚言語データを用いて、モデルが新しい物体や抽象的な概念を理解する能力を向上させる。
- カスタムボディByteMiniロボットと組み合わせることで、22の自由度を持ち、非常に柔軟な操作が可能となり、狭い場所や繊細な作業に適しています。
Seed GR-3プロジェクトの住所
- プロジェクト公式サイト:https://seed.bytedance.com/zh/GR3
- arXiv技術論文:https://arxiv.org/pdf/2507.15493
Seed GR-3の応用事例
- ホームサービスこのモデルは、家事の手伝いや高齢者や子供の世話、安全確保などを行い、家族生活をより楽にしてくれる。
- 産業物流Seed GR-3は、倉庫管理の最適化、生産支援、品質検査、および産業効率の向上に貢献します。
- 健康管理それは患者の回復を助け、手術を支援し、物流を管理し、医療サービスを向上させる。
- 小売サービスSeed GR-3は、棚の整理、顧客対応、展示会の案内、そして小売体験の最適化を可能にします。
- 災害救援このモデルは救助活動や環境モニタリングに参加することができ、緊急対応を支援する。