project
SmolVLA - Hugging Faceのオープンソース軽量ロボットモデル
SmolVLAは、Hugging Face社が開発した軽量なオープンソースのビジョン・ランゲージ・アクション(VLA)モデルで、コスト効率の高いロボット工学向けに設計されています。4億5000万個のパラメータを持ち、コンパクトで、CPU上で動作するため、必要なのはコンシューマーグレードのGPU1枚のみです。
SmolVLAとは何ですか?
SmolVLAは、Hugging Face社が開発した軽量なオープンソースのビジョン・ランゲージ・アクション(VLA)モデルで、コスト効率の高いロボット工学向けに設計されています。4億5000万個のパラメータを持つこのモデルは、CPU上で動作し、単一のコンシューマーグレードGPUでトレーニングでき、MacBookにデプロイできるほど小型です。SmolVLAは、「lerobot」というラベルの付いたオープンソースデータセットのみを使用してトレーニングされています。
SmolVLAの主な機能
-
マルチモーダル入力処理SmolVLAは、複数の画像、言語コマンド、ロボットの状態情報など、さまざまな入力を処理できます。ビジュアルエンコーダーで画像の特徴を抽出し、言語コマンドをトークン化してデコーダーに入力します。検出された動作状態は、線形レイヤーを通してラベルに投影され、言語モデルのラベル次元と整合します。
-
アクションシーケンス生成このモデルには、モーションエキスパートモジュールが含まれています。これは、ビジョン言語モデル(VLM)の出力に基づいて、将来のロボット向けのアクションシーケンスブロックを生成する軽量のトランスフォーマーです。フローマッチング技術を用いてトレーニングされ、ノイズの多いサンプルを実際のデータの分布にフィードバックすることでモーション生成を学習し、高精度なリアルタイム制御を実現します。
-
効率的な推論と非同期実行SmolVLAは非同期推論スタックを導入し、動作実行と知覚・予測を分離することで、より高速かつ高感度な制御を実現します。これにより、ロボットは急速に変化する環境にも迅速に対応できるようになり、応答速度とタスク処理能力が向上します。
SmolVLAの技術原理
-
視覚言語モデル(VLM)SmolVLAは、VLMの基盤としてSmolVLM2を使用しています。このモデルは、複数の画像入力を処理するように最適化されています。SigLIPビジュアルエンコーダとSmolLM2言語デコーダが含まれています。ビジュアルエンコーダによって画像タグが抽出され、言語コマンドはトークン化された後、デコーダに直接入力されます。検出されたモーション状態は、言語モデルのタグ次元に合わせた線形レイヤーを通してタグに投影されます。デコーダレイヤーは、連結された画像、言語、および状態タグを処理し、結果として得られた特徴量がアクションエキスパートに渡されます。
-
アクションエキスパートMotion Expertは、VLMの出力に基づいて将来のロボット向けモーションシーケンスブロックを生成する軽量トランスフォーマー(パラメータ数約1億)です。Motion Expertはフローマッチング技術を用いて学習され、ノイズの多いサンプルを実際のデータ分布にフィードバックすることでモーション生成を学習し、高精度なリアルタイム制御を実現します。
-
視覚的トークン削減効率性を向上させるため、SmolVLAは1フレームあたりのビジュアルトークン数を64に制限しており、これにより処理コストが大幅に削減されます。
-
レイヤージャンプ加速推論SmolVLAはVLMのレイヤーの半分を計算から除外することで、良好なパフォーマンスを維持しながら計算コストを実質的に半減させます。
-
インターリーブされたアテンションレイヤー従来のVLAアーキテクチャとは異なり、SmolVLAはクロスアテンション(CA)層とセルフアテンション(SA)層を交互に配置します。これにより、マルチモーダル情報の統合効率が向上し、推論が高速化されます。
- 非同期推論SmolVLAは非同期推論戦略を採用しており、ロボットの「手」と「目」が独立して動作することを可能にする。この戦略により、ロボットは現在の動作を実行しながら、同時に新しい観測データを処理して次の動作を予測できるため、推論の遅延が解消され、制御頻度が向上する。
SmolVLAプロジェクトのアドレス
- ハギングフェイスモデルライブラリ:https://huggingface.co/lerobot/smolvla_base
- arXiv技術論文:https://arxiv.org/pdf/2506.01844
SmolVLAの応用シナリオ
- 物体の把持と配置SmolVLAは、ロボットアームを制御して複雑な把持および配置作業を実行できます。例えば、工業生産ラインでは、ロボットは視覚情報と音声指示に基づいて、部品を正確に把持し、指定された場所に配置する必要があります。
- 家事SmolVLAは、家庭用サービスロボットに適用することで、様々な家事を効率的にこなすのに役立ちます。例えば、ロボットは自然言語による指示に基づいて、部屋の散らかりを識別して片付けたり、指定された場所に物を置いたりすることができます。
-
貨物取り扱い物流倉庫において、SmolVLAはロボットを制御して貨物取り扱い作業を完了させることができます。ロボットは視覚情報に基づいて商品の位置と形状を認識し、音声コマンドと組み合わせることで最適な搬送経路と動作シーケンスを生成し、貨物取り扱いの効率と精度を向上させます。
- ロボット教育SmolVLAはロボット工学教育のためのツールとして活用でき、学生や研究者がロボット工学技術をより深く理解し、開発するのに役立つ。