AB
AiBoss
project

MT-TransformerEngine - Moore's Threadsがオープンソース化した、高効率なトレーニングおよび推論最適化フレームワーク。

MT-TransformerEngineは、Moore's Threadsがオープンソース化した、Transformerモデル向けに特別に設計された高効率なトレーニングおよび推論最適化フレームワークです。このフレームワークは、演算子融合、並列処理による高速化、その他の技術を通じて、Moore's Threadsのフル機能GPを最大限に活用します。

MT-TransformerEngineとは何ですか?

MT-TransformerEngineは、Moore's Threadsが開発したオープンソースの高効率トレーニングおよび推論最適化フレームワークで、Transformerモデル向けに特別に設計されています。このフレームワークは、演算子融合と並列アクセラレーション技術を活用し、Moore's Threadsのフル機能GPUの計算能力を最大限に引き出し、トレーニング効率を大幅に向上させます。また、FP8混合精度トレーニングをサポートし、GPUのネイティブFP8演算能力を活用することで、パフォーマンスと安定性をさらに最適化します。MT-TransformerEngineはMT-MegatronLMと連携して動作し、BERTやGPTなどの大規模モデルに適した効率的なハイブリッド並列トレーニングを実現します。

MT-TransformerEngineの主な機能

  • 高効率トレーニング加速複数の計算負荷の高い処理を統合することで、メモリへのアクセスと計算オーバーヘッドを削減し、トレーニング効率を大幅に向上させます。データ並列処理、モデル並列処理、パイプライン並列処理をサポートし、GPUクラスタの計算リソースを最大限に活用します。
  • 推論最適化Transformerモデルの推論フェーズを最適化し、レイテンシを削減してスループットを向上させます。メモリ管理を最適化することで、推論時のメモリ使用量を削減します。
  • 生態学的ツールとの連携
    • MT-MegatronLMとの相乗効果MT-MegatronLMフレームワークとの統合をサポートしており、より効率的なハイブリッド並列トレーニングを実現します。
    • MT-DualPipeとの統合MT-DualPipeと組み合わせることで、コンピューティングリソースの利用効率をさらに最適化します。
    • Torch-MUSAがサポートされていますこれはTorch-MUSAディープラーニングフレームワークとMUSAソフトウェアスタックに基づいており、さまざまなアルゴリズムと互換性があります。
  • マルチモーダルモデルのサポートマルチモーダルなTransformerモデルのトレーニングをサポートしているため、テキストや画像など、複数のモダリティを含む複雑なタスクに適しています。
  • コミュニケーションの最適化通信戦略を最適化することで、GPU間の通信遅延が低減され、全体的なトレーニング効率が向上します。

MTトランスフォーマーエンジンの技術原理

  • 演算子融合MT-TransformerEngineは、Transformerモデルの特性に合わせて調整された様々な演算子融合最適化機能を組み込んでいます。正規化層とQKV水平融合、自己注意機構による計算融合、残差接続と全結合層を統合することで、計算中のメモリアクセスとCUDAカーネルの起動時間を削減し、モデル推論のパフォーマンスを向上させます。
  • 並列加速戦略
    • ハイブリッド並列トレーニングデータ並列処理、テンソル並列処理、パイプライン並列処理など、複数の並列処理戦略をサポートしています。テンソル並列処理は、アテンション層と多層パーセプトロンの行列演算次元を分割することで、複数のGPUに分散したコンピューティングを実現します。パイプライン並列処理は、モデルを複数のステージに分割し、マイクロバッチ処理によってスループットを向上させます。
    • バブルレートを下げるMT-DualPipeやDeepEPといった技術と統合することで、「パイプラインバブル」を大幅に削減し、並列トレーニングの効率をさらに向上させます。
  • FP8 混合精密訓練これは、MooreのThreads GPUがネイティブにサポートするFP8混合精度トレーニング戦略を深く統合したものです。トレーニング中、FP8に基づく低精度計算は、特定の技術によって数値安定性を維持しながらトレーニングを高速化し、メモリ使用量を削減し、トレーニング効率を大幅に向上させます。
  • 高性能演算子ライブラリ高性能演算子ライブラリであるmuDNNを統合しており、計算効率を向上させるためにGPU向けに高度に最適化されています。

MT-TransformerEngineのプロジェクトアドレス

MT-TransformerEngineの応用シナリオ

  • 大規模言語モデルトレーニングMT-TransformerEngineは、GPT、BERT、T5などの大規模言語モデルの学習に適しています。効率的な並列化技術とFP8混合精度学習戦略により、数十億、あるいは数百億ものパラメータを持つモデルを大規模GPUクラスタ上で効率的に学習できます。
  • マルチモーダルモデルのトレーニングこのフレームワークは、マルチモーダルなTransformerモデルのトレーニングをサポートしており、テキスト、画像、動画など、複数のモダリティを含むデータを処理できます。例えば、Meta-Transformerは、重みを固定したエンコーダーを使用することで、ペアになったマルチモーダルなトレーニングデータがなくても、マルチモーダル認識を実行できます。
  • リアルタイム推論低遅延が求められるリアルタイム推論シナリオにおいて、MT-TransformerEngineは最適化された推論エンジンとFP8精度によって推論速度を大幅に向上させることができ、自然言語処理や画像認識などのタスクに適しています。