project
MT-MegatronLM - Moore's Threads オープンソースハイブリッド並列トレーニングフレームワーク
MT-MegatronLMは、Moore's Threadsが開発したオープンソースのハイブリッド並列トレーニングフレームワークで、フル機能のGPU向けに開発され、主に大規模言語モデルの効率的なトレーニングに使用されます。密なモデル、マルチモーダルモデル、MoE(ハイブリッドエキスパート)をサポートしています。
MT-MegatronLMとは何ですか?
MT-MegatronLMは、Moore's Threadsが開発したオープンソースのハイブリッド並列トレーニングフレームワークで、フル機能GPU向けに設計されており、主に大規模言語モデルの効率的なトレーニングに使用されます。密なモデル、マルチモーダルモデル、およびMoE(Mixed Experts)モデルのトレーニングをサポートしています。フル機能GPUをベースとしたこのフレームワークは、FP8混合精度戦略、高性能演算子ライブラリ、およびアンサンブル通信ライブラリをサポートし、GPUクラスタの計算利用率を大幅に向上させます。モデル並列処理、データ並列処理、およびパイプライン並列処理を通じて、効率的な分散トレーニングを実現し、混合精度トレーニングをサポートすることで、メモリ使用量を削減し、計算を高速化します。
MT-MegatronLMの主な機能
- 複数のモデルアーキテクチャをサポートします
- 高密度モデルGPTやBERTといった従来のTransformerアーキテクチャをサポートしています。
- マルチモーダルモデルテキストや画像など、複数の種類のデータを含むモデルを扱うことができます。
- ハイブリッドエキスパートモデル(MoEモデル)疎な活性化関数を用いたハイブリッドエキスパートアーキテクチャをサポートし、モデルの柔軟性と効率性を向上させます。
- 高効率ハイブリッド並列トレーニング
- モデル並列処理単一GPUのメモリ制限を克服するために、モデルパラメータを複数のGPUに分散させる。
- データ並列処理複数のGPUにデータを分散させることで、トレーニングプロセスを高速化します。
- パイプラインの並列処理このモデルは複数の段階に分かれており、パイプライン方式によってスループットが向上している。
- 高性能最適化FP8混合精度戦略をサポートし、メモリ使用量を削減し、計算を高速化します。高性能演算子ライブラリ(muDNNなど)を統合し、計算効率を向上させます。最適化されたアンサンブル通信ライブラリ(MCCLなど)を使用し、通信オーバーヘッドを削減します。
- 柔軟な拡張性小規模から大規模まで、さまざまなハードウェア構成に対応したトレーニングモデルをサポートします。マルチGPUクラスタでの並列トレーニングに最適化されており、クラスタの利用効率を向上させます。
MT-MegatronLMの技術原理
- ハイブリッド並行戦略: 次元ごとにモデルパラメータを分割し、複数のGPUに分散させることで、単一カードのメモリ使用量を削減します。モデルを複数のステージに分割し、マイクロバッチ配信を使用して異なるGPUに分散させることで、スループットを向上させます。データセットを異なるGPUに分割し、同じモデルを実行して、All-Reduceを使用して勾配を集約します。
- 複合精密訓練AMPやBF16などの手法を用いることで、順伝播と逆伝播では低精度計算が用いられ、数値安定性を維持するためにクリティカルパスでは高精度計算が用いられる。
- 高効率最適化手法と勾配集約これは、ZeROや1ビットAdamなどの技術を組み合わせた融合型Adamオプティマイザを提供し、通信オーバーヘッドを削減し、GPUメモリを節約します。また、All-Reduceなどの操作を使用して勾配を集約し、グローバルな勾配の一貫性を確保します。
- 高性能演算子ライブラリ例えば、計算効率を向上させるためにGPU向けに最適化されたmuDNNなどが挙げられる。
- 集団コミュニケーションライブラリ例えば、MCCLはGPU間の通信を最適化し、通信オーバーヘッドを削減します。
MT-MegatronLMのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/MooreThreads/MT-MegatronLM
MT-MegatronLMの応用事例
- 大規模言語モデルの事前学習GPT-3、BERT、T5などの超大規模言語モデルを再現および学習させる。
- マルチモーダルモデルのトレーニング画像やテキストなど、複数のデータタイプの同時学習をサポートしており、生成型AIモデルの開発に適しています。
- 特注の超大型モデルユーザーは、自身のニーズやデータセットに基づいて、カスタム言語モデルを設計およびトレーニングできます。
- エンタープライズグレードのAIプラットフォームNVIDIA NeMoなどのフレームワークと統合することで、エンドツーエンドのクラウドネイティブソリューションを提供します。
- 科学研究と学術的探求: さまざまな並列戦略、並列通信方式、および深層モデル構造が大規模トレーニングの効率に与える影響を比較するために使用されます。