AB
AiBoss
project

プロファイリングデータ - DeepSeekオープンソースのトレーニングおよび推論フレームワークからのパフォーマンス分析データ

プロファイリングデータは、DeepSeekのオープンソースのトレーニングおよび推論フレームワークから得られるパフォーマンス分析データです。PyTorch Profilerによってプログラム実行中に取得された詳細な情報に基づいており、ソフトウェアのパフォーマンス分析と最適化に使用されます。

プロファイリングデータとは何ですか?

プロファイリングデータは、DeepSeekのオープンソースのトレーニングおよび推論フレームワークから得られるパフォーマンス分析データです。PyTorch Profilerによってプログラム実行中に取得された詳細な情報に基づいて、ソフトウェアのパフォーマンス分析と最適化に使用されます。ダウンロード後、ChromeまたはEdgeブラウザで直接使用できます。 chrome://tracing または edge://tracing 可視化分析のドキュメントを開いてください。プロファイリングデータには、プログラム実行時間、リソース使用率、通信パターンなどの主要な指標が記録されます。ディープラーニングフレームワークでは、プロファイリングデータは、モデルのトレーニングと推論における計算と通信のオーバーラップ戦略、さまざまなハードウェアリソースの使用状況、潜在的なパフォーマンスボトルネックを開発者が理解するのに役立ちます。データ分析に基づいて、開発者はコードの実装を最適化し、並列化戦略を調整し、システム全体の効率を向上させることができます。

プロファイリングデータの主な機能

  • パフォーマンスのボトルネックの特定プログラム実行中の時間消費量とリソース使用量を記録することで、開発者はどの関数やモジュールが時間やリソースを過剰に消費しているかなど、パフォーマンスのボトルネックを迅速に特定できます。
  • 資源利用分析CPU、GPU、メモリなどのハードウェアリソースの使用状況を分析し、リソース割り当ての最適化とリソースの無駄の回避を支援します。
  • 通信モード分析分散システムにおいては、ノード間の通信パターンと遅延を分析し、通信戦略を最適化して通信オーバーヘッドを削減します。
  • 最適化ガイドこれはコード最適化のためのデータサポートを提供し、開発者が並列化やキャッシュ最適化などの適切な最適化戦略を選択できるよう支援します。

プロファイリングデータの推論プロセス

  • 事前充填EP32およびTP1(DeepSeek V3/R1の実際のオンライン展開に準拠)に基づき、ヒント長は4K、GPUあたりのバッチサイズは16Kトークンです。2つのマイクロバッチを使用して、重複計算と完全接続通信を行い、2つのマイクロバッチ間のアテンション計算負荷のバランスを確保します。
  • デコードEP128とTP1に基づき、ヒント長は4K、GPUあたりのバッチサイズは128リクエストです。プリパディングと同様に、デコードもオーバーラップ計算と完全接続通信のために2つのマイクロバッチを使用します。プリパディングとは異なり、デコードフェーズ中の完全接続通信はGPU SM(ストリーミングマルチプロセッサ)を占有しません。RDMA(リモートダイレクトメモリアクセス)メッセージが発行されると、すべてのGPU SMが解放され、システムは計算後の完全接続通信の完了を待ちます。

プロファイリングデータのプロジェクトアドレス

プロファイリングデータの応用シナリオ

  • パフォーマンスのボトルネックを特定するプログラムの中で最も時間やリソースを消費する部分を迅速に特定する。
  • パフォーマンス最適化ガイドデータに基づいて戦略を調整し、コンピューティングと通信の効率を向上させる。
  • 資源利用状況の分析ハードウェアリソース(CPU、GPU、メモリなど)の使用状況を評価し、無駄をなくす。
  • システムアーキテクチャを最適化する実行時データに基づいて、分散システムの構成と通信戦略を調整する。
  • 検出性能の回帰異なるバージョンのパフォーマンスデータを比較して、最適化が効果的であり、パフォーマンスの低下を招かないことを確認します。