AB
AiBoss
project

SmolVLM - Hugging Faceによる軽量ビジュアル言語モデル

SmolVLMは、Hugging Faceが開発した軽量な視覚言語モデルで、特にデバイス上での推論向けに設計されています。20億個のパラメータを持ちながら、高いメモリ効率と高速な処理速度を実現しています。SmolVLMは、さまざまなニーズに対応するために3つのバージョンを提供しています。

SmolVLMとは何ですか?

SmolVLMは、Hugging Faceが開発した軽量の視覚言語モデルで、特にデバイス上での推論向けに設計されています。20億個のパラメータを持ち、効率的なメモリ使用と高速な処理速度を実現しています。SmolVLMは、さまざまなニーズに対応するために3つのバージョンを提供しています。SmolVLM-Base:下流タスクの微調整に適しています。SmolVLM-Synthetic:合成データに基づいて微調整されています。SmolVLM-Instruct:命令に基づいて微調整されたバージョンで、インタラクティブなアプリケーションに直接適用できます。このモデルはIdefics3のコンセプトを取り入れ、SmolLM2 1.7Bを言語の基盤として使用し、ピクセルシャッフルによって視覚情報の圧縮効率を向上させています。CauldronおよびDoctmatixデータセットでトレーニングされており、画像エンコーディングとテキスト処理機能を最適化しています。

SmolVLMの主な機能

  • デバイス側推論SmolVLMはデバイス側での推論向けに設計されており、ノートパソコン、一般消費者向けGPU、モバイルデバイスなどのリソース制約のある環境でも効率的に動作します。
  • 微調整機能このモデルは、さまざまなニーズに対応するために3つのバージョンを提供しています。
    • SmolVLM-Baseは、下流タスクの微調整に使用されます。
    • SmolVLM-Syntheticは合成データに基づいて微調整されています。
    • 対話型アプリケーションに直接適用できる、SmolVLM-Instructコマンドの改良版。
  • 最適化されたアーキテクチャ設計Idefics3から着想を得たこのアプローチは、言語の基盤としてSmolLM2 1.7Bを使用し、ピクセルシャッフル戦略を採用することで視覚情報の圧縮率を向上させ、より効率的な視覚情報処理を実現します。
  • 長文テキストと複数の画像を処理するトレーニングデータセットにはCauldronとDoctrineが含まれており、SmolLM2はより長いテキストシーケンスと複数の画像を処理できるようにコンテキスト拡張されています。
  • メモリ使用量が少ないSmolVLMは384×384ピクセルの画像ブロックを81個のトークンにエンコードするのに対し、Qwen2-VLは16,000個のトークンを必要とするため、メモリ使用量を大幅に削減できます。
  • 高スループット複数のベンチマークテストにおいて、SmolVLMのプリフィル処理速度はQwen2-VLの3.3~4.5倍、生成処理速度は7.5~16倍高速であることが示された。
  • オープンソースモデルSmolVLMは完全にオープンソースであり、すべてのモデルチェックポイント、VLMデータセット、トレーニングレシピ、およびツールはApache 2.0ライセンスの下で公開されています。
  • トレーニングデータセットSmolVLMはCauldronとDoctmatixに対応しており、SmolLM2にコンテキスト拡張機能を追加することで、より長いテキストシーケンスや複数の画像を処理できるようにしています。

SmolVLMプロジェクトのアドレス

SmolVLMの応用シナリオ

  • ビデオ分析SmolVLMは、計算能力が限られた条件下での基本的なビデオ解析タスクとしての可能性を実証しました。CinePileベンチマークにおいて、SmolVLMは27.14%のスコアを達成し、ビデオ理解における競争力の高さを示しました。
  • 視覚言語処理SmolVLMは、高価なハードウェアを必要とせずに、開発者や研究者に強力な視覚言語処理ツールを提供します。
  • ローカル展開小型モデルはブラウザやエッジデバイス上でのローカル展開をサポートし、推論コストを削減し、ユーザーによるカスタマイズを可能にする。
  • AIの普及SmolVLMの開発により、視覚言語モデルの利用が拡大し、複雑なAIシステムへのアクセスと普及が促進され、より幅広い層に強力な機械学習機能が提供されることが期待される。