project
Helix - 図は、エンドツーエンドの汎用制御モデルを紹介します。
Helixは、Figure社が開発した、ヒューマノイドロボットを制御するための汎用的な視覚・言語・動作(VLA)モデルです。Helixは、ロボットの上半身全体(手首、胴体、頭部、指を含む)の高速制御を先駆けて実現しました。
ヘリックスとは何ですか?
Helixは、Figure社が開発した、ヒューマノイドロボットを制御するための汎用的な視覚・言語・行動(VLA)モデルです。Helixは、ロボットの上半身全体(手首、胴体、頭部、指を含む)を200Hzの高速で連続的に制御する先駆的な技術であり、複数のロボットが同じニューラルネットワークの重みセットを共有してタスクを完了するマルチロボット協調をサポートしています。Helixは、自然言語コマンドに基づいてこれまで見たことのない物体を拾い上げることで、高い汎化能力を発揮します。Helixのトレーニングは完全にエンドツーエンドで行われ、タスク固有の微調整は不要で、低消費電力のGPUで動作し、商用展開の可能性を秘めています。
Helixの主な機能
- 上半身を完全にコントロールできるロボットの上半身全体(手首、胴体、頭部、指を含む)を高速(200Hz)で連続制御することで、高精度な動作協調が可能になります。
- 複数ロボットによる協働このシステムは、複数のロボットが同じニューラルネットワークの重みセットを同時に実行し、物を一緒に移動したり整理したりするなどのタスクを協調して完了することを可能にします。
- 自然言語理解と実行ロボットは、見慣れない物を拾ったり、引き出しや冷蔵庫を操作したりするなど、自然言語による指示に基づいて様々な作業を実行できる。
- 高い一般化能力形状、サイズ、材質の異なる数千ものアイテムを処理できる。
- 商用展開機能低消費電力の組み込みGPUのみで動作するため、大規模な商用アプリケーションに適しています。
Helixの技術原則
- システム2(S2)7Bパラメータに基づくオープンソースのビジュアル言語モデル(VLM)は、シーン理解と言語理解を担います。このモデルは、7~9Hzの周波数でデータを処理し、「低速思考」の高レベル目標に対応し、視覚情報と言語情報を意味表現に変換します。意味情報は連続的な潜在ベクトルにエンコードされ、システム1に渡されます。
- システム1(S1)低レベル制御には、8000万個のパラメータに基づくTransformerエンコーダ・デコーダアーキテクチャが採用されています。200Hzの周波数で処理を行い、動作の高速実行と調整を可能にします。S2から送信される潜在ベクトルと視覚的特徴を組み合わせることで、手首の姿勢、指の制御、頭部と胴体の向きといった、ロボットの正確な動作に変換します。
- エンドツーエンドのトレーニングこのアルゴリズムは、生のピクセルデータと自然言語による指示を連続的な動作出力にマッピングし、標準的な回帰損失を用いて学習されます。学習中に時間的なオフセットを導入することで、S1とS2間の推論遅延をシミュレートし、学習時と実運用時の一貫性を確保します。
- 分離型アーキテクチャS1とS2は異なる時間スケールで動作します。S2は高レベルのセマンティックプランニングを担当し、S1はリアルタイムのアクション実行を担当します。これにより、システムの汎化能力と迅速な応答の両方が確保されます。
- 推論展開を最適化するロボット上では、S1とS2はそれぞれ別のGPU上で動作する。S2は潜在ベクトルを非同期的に更新する一方、S1はリアルタイムで動作制御を実行する。
Helixのプロジェクトアドレス
- プロジェクト公式サイト:https://www.figure.ai/news/helix
Helixの技術原則
- ホームサービス物の整理、収納、家電製品の操作、その他日常的な家事。
- 複数ロボットによる協働複数のロボットが単一のニューラルネットワークを共有し、連携してハンドリングや組み立て作業を完了させる。
- アイテムグラブ自然言語によるコマンドに基づいて、これまで認識されていなかったアイテムを捕捉することができ、物流や倉庫業務に適している。
- 産業オートメーション部品の組み立てや品質検査など、人間と機械が協働する複雑な作業で使用される。
- サービス業ホテル、レストラン、その他類似施設において、案内、配達、清掃サービスを提供する。