project
VeOmni - ByteDanceのオープンソースのフルモーダルPyTorchネイティブトレーニングフレームワーク
VeOmniは、ByteDanceのSeedチームが開発した、PyTorchをベースとしたオープンソースのフルモーダル分散トレーニングフレームワークです。VeOmniはモデル中心の設計で、分散並列ロジックをモデル計算から分離し、さまざまな並列処理の柔軟な組み合わせをサポートしています。
VeOmniとは何ですか?
VeOmniは、ByteDanceのSeedチームがPyTorchをベースに開発したオープンソースのマルチモーダル分散トレーニングフレームワークです。VeOmniはモデル中心の設計で、分散並列ロジックとモデル計算を分離しています。FSDP、SP、EPなどの様々な並列戦略を柔軟に組み合わせることができ、超長尺シーケンスや大規模なMoEモデルにも効率的に対応できます。VeOmniは軽量なマルチモーダルインターフェースを提供し、マルチモーダルエンコーダとデコーダの統合を簡素化します。また、動的バッチ処理や効率的な演算子などの最適化手法を統合することで、トレーニングの効率と安定性を大幅に向上させています。VeOmniは数々の最先端プロジェクトで活用され、大規模マルチモーダルモデルの研究開発に貢献しています。
VeOmniの主な機能
- フルモーダルモデルのトレーニングをサポートしますVeOmniは、テキスト、画像、音声、動画など、あらゆるモダリティでのモデル学習をサポートしており、単一モダリティからマルチモダリティまで、さまざまなタスクに適しています。
- 高効率分散トレーニングFSDP、SP、EPなど、さまざまな並列処理戦略を柔軟に組み合わせることができ、大規模なGPUクラスタにも効率的に拡張可能です。
- 非常に長いシーケンスのサポート最大192Kの超長尺シーケンスの学習をサポートしているため、高解像度画像や長尺動画などの複雑なモダリティデータの処理に適しています。
- 軽量なインターフェースと使いやすさマルチモーダルコーデックの迅速な統合をサポートし、モデル開発プロセスを簡素化します。
- システムレベルの最適化動的バッチ処理、高効率演算子、再計算とメモリ最適化、バイトチェックポイントなどの技術を統合することで、トレーニングの効率と安定性を向上させています。
- トレーニングの安定性複雑なマルチモーダルタスクにおいて優れた性能を発揮し、安定した収束をサポートし、実用的なアプリケーションにおける様々なシナリオに適しています。
- 柔軟なモデル拡張複数のモデルアーキテクチャ(MoE、Transformerなど)をサポートし、ユーザーがさまざまな研究開発ニーズに合わせてモデルコンポーネントをカスタマイズできる。
VeOmniの技術原則
- モデルとシステムの分離VeOmniは、モデル定義と分散トレーニングロジックを分離し、モデルコードと並列戦略を完全に切り離します。ユーザーは、モデルコードを変更することなく、高レベルAPIを通じて並列戦略を設定できます。
- 分散並列戦略このアプローチは、モデルパラメータ、勾配、およびオプティマイザの状態を複数のデバイスに分散することで、単一GPUのメモリ要件を大幅に削減します。また、活性化テンソルを分割し、通信を最適化することで、超長シーケンスのトレーニングをサポートします。さらに、エキスパートを複数のデバイスに分散することで、MoEモデルのトレーニング効率を向上させます。最後に、DeviceMeshに基づいてparallel_stateを設計することで、n次元並列戦略の管理を簡素化し、さまざまな並列戦略を柔軟に組み合わせることを可能にします。
- 軽量なフルモーダルインターフェースHuggingFaceインターフェース仕様を使用することで、ユーザーは統一されたインターフェース関数(lm_encode、lm_generateなど)を実装することにより、マルチモーダルコーデックを迅速に統合できます。
- システムレベルの最適化動的バッチ処理、高効率演算子、再計算、メモリ最適化、バイトチェックポイントなど、複数の最適化技術を統合することで、トレーニングの効率と安定性を総合的に向上させます。
VeOmniのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/ByteDance-Seed/VeOmni
- arXiv技術論文:https://arxiv.org/pdf/2508.02317
VeOmniアプリケーションシナリオ
- マルチモーダルコンテンツ生成テキストの説明に基づいて画像や動画を生成したり、画像や動画の説明文を生成したりすることができ、クリエイティブデザインやコンテンツ制作において幅広く利用されている。
- マルチモーダルな理解と質問応答画像とテキストを組み合わせることで、視覚的な質問に答えたり、複数のモダリティを含む複雑な質問応答タスクを処理したりすることができ、それによってインテリジェントなインタラクティブ体験を向上させます。
- マルチモーダルなインテリジェントエージェントこれは、音声、テキスト、視覚情報を通してユーザーと対話し、タスクを実行できる仮想アシスタントやマルチモーダルロボットの開発を支援するものです。
- コンテンツの作成と編集テキストの説明に基づいて創造的なデザイン要素を生成し、コンテンツのレビューを支援するとともに、コンテンツの作成と編集の効率を向上させます。
- 教育と訓練教育・研修の双方向性と効果を高めるための仮想トレーニングを提供する。