AB
AiBoss
project

ForgeStencil - Wallfacerのステンシル完全自動化研究展開システム

ForgeStencilは、Wallfacer IntelligenceとOpenBMBオープンソースコミュニティが共同開発した、自動化されたステンシル研究と展開をサポートする世界初のAI最適化システムです。カーネルエージェントとアプリケーションエージェントからなるデュアルエージェント閉ループアーキテクチャに基づいています。

ForgeStencilとは何ですか?

WallfacerがOpenBMBオープンソースコミュニティと共同開発したForgeStencilは、自動化されたステンシル研究と展開をサポートする世界初のAI最適化システムです。カーネルエージェントとアプリケーションエージェントからなるクローズドループのデュアルエージェントアーキテクチャに基づき、最適化戦略の発見から実際の運用ソフトウェアへの統合まで、プロセス全体を通して人間の介入を一切排除します。このシステムは、わずか1週間で100を超える産業用および科学用コンピューティングソフトウェアアプリケーションのエンドツーエンド最適化を完了し、平均1.41倍の高速化を実現しました。対象分野は、石油・ガス探査、電磁シミュレーション、医用画像処理など8つの主要産業分野と、5つの主要科学分野に及びます。

ForgeStencilの主な機能

  • デュアルエージェント閉ループ最適化カーネルエージェントは独自に高性能なCUDAカーネルを研究・合成し、一方、アプリケーションエージェントはホットスポットの位置特定、演算子生成、正当性検証、およびアプリケーション統合を実行します。
  • 自動ポリシー検出エージェントは、固定された空間内で探索するのではなく、セグメンテーション、融合、レイアウト、占有、ホスト再構築などの最適化戦略を自律的に探索する。
  • 実際のアプリケーション展開:簡略化されたベンチマークではなく、アプリケーション自身のGPUコードをエンドツーエンド検証のベースラインとして使用し、本番環境レベルのソフトウェア向けに直接最適化されています。
  • 監査可能な測定プロトコル単一の環境スイッチを使用して元のパスと最適化されたパスを切り替え、組み込みのチェック機能とタイマーを使用することで、速度向上率が現実的かつ信頼できるものとなるようにしています。
  • 世代を超えたGPUの適応A100/H100/B200ランタイムアーキテクチャの配布をサポートし、同一コードベース内でアーキテクチャに応じて最適なカーネルパスを自動的に選択します。

ForgeStencilの技術原理

  • デュアルエージェント協調アーキテクチャこのシステムは、カーネルエージェントとアプリケーションエージェントからなる閉ループで構成されています。カーネルエージェントは、理論的な発見を担当し、プラン→コード→プロファイルのループを通じて、ハードウェアの物理的限界を近似するステンシル演算子を自律的に調査・合成します。アプリケーションエージェントは、エンジニアリング実装を担当し、アプリケーションのパフォーマンス上のホットスポットを特定し、GPUのベースラインを確立し、カーネルエージェントによって構築された演算子マトリックス知識ベースを呼び出してアプリケーション固有の最適化を行い、正当性の検証と元のアプリケーションとの統合を完了します。
  • 演算子行列と知識ベースの進化最適化プロセスにおいて、カーネルエージェントは知識ベースとして専用の演算子マトリックスを継続的に構築し、これをアプリケーションエージェントが再利用できるようにします。複数の並列エージェントがこの知識ベースを共有することで、リアルタイムでの経験共有と集団的な同期進化が可能になり、人間の専門家の経験をスケーラブルに伝達する際の困難さというボトルネックを克服します。
  • 監査可能なエンドツーエンドプロトコル測定では、アプリケーション独自のプロダクショングレードのGPU実装を唯一の基準として使用します。元のパスと最適化されたパスは、単一の方法でのみ比較されます。 USE_OURS スイッチは区別され、元のパスは上流のバイトと一致しています。プログラムは、組み込みの正当性チェックとタイマーを使用して、複数回のインターリーブ操作後の中央値を取得し、最終的にすべての標準的な使用例の幾何平均の高速化を報告することで、システムレベルでの不正行為の余地を排除します。
  • ソースコードが一切含まれていないパッチモードサードパーティのソースコードは一切同梱されていません。各アプリケーションは、アップストリームのソースレコード、スクリプトの取得、および統合パッチのみを提供します。 vendor.sh 指定されたバージョンのアップストリームコードを自動的に取得し、クリーンなライセンスと再現可能な結果を保証します。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

ForgeStencilの使い方

  • 環境準備リポジトリをクローンし、NVIDIA GPU(A100で検証済み)、CUDA 12.x、C++17コンパイラ、およびPython 3.9以降の環境がインストールされていることを確認してください。
  • オペレーターをすぐに体験してください:走る python tools/run.py --stencil star_1 --shape 256 --gpu 0 1人のオペレーターのパフォーマンスは、1分以内に測定し、Halideの基準値と比較することができる。
  • エンドツーエンド再生: 対象アプリケーションのディレクトリに入り、実行します ./vendor.sh 上流のソースコードを取得し、統合パッチを適用して実行します。 python ../../harness/run_e2e.py --app <name> --gpu auto 実世界でのアプリケーション検証を徹底的に実施する。
  • ドライバーを仕事場へ:参照 agents/README.md カーネルエージェントとアプリケーションエージェントの自律最適化ループを設定して開始します。
  • レジストリ検索結果:合格 results/integration_registry.json 検証済みのアプリケーション100件の監査速度向上データを表示します。

ForgeStencilの主な利点

  • 人的介入なしアプリケーションの分析やホットスポットの特定から、カーネルの生成や統合検証に至るまで、プロセス全体が自動化されており、HPCの専門家が意思決定に参加する必要はない。
  • 現実世界のシナリオ指向生産グレードの産業用ソフトウェアを直接最適化します。ソフトウェアの42%は実際の産業生産ソフトウェアであり、ベースラインはアプリケーション自身のGPUコードです。
  • 研究開発効率の飛躍的向上単一アプリケーションの最適化にかかる時間は数ヶ月から1日以内に短縮され、1週間で100以上のアプリケーションを完了できるようになった。これは、約20~30人年の研究開発投資の節約に相当する。
  • 優れたパフォーマンスエンドツーエンドの平均速度向上率は1.41倍、アプリケーションの43%は1.5倍以上、オペレーターレベルの幾何平均は2.16倍で、最高のオープンソースベースラインを上回ります。
  • クロスアーキテクチャの持続可能性複数の世代のNVIDIA GPU向けランタイム配信をサポートし、アーキテクチャがアップグレードされた際にカーネルを自動的に再構築して新しいハードウェア機能を取り込むことができます。

ForgeStencilのプロジェクトアドレス

  • GitHubリポジトリ:https://github.com/OpenBMB/ForgeStencil

ForgeStencilと類似製品との比較

寸法 ForgeStencil Halide
最適化戦略の情報源 エージェントは、固定空間ではない探索を行い、自律的に新しい戦略を発見する。 人間はDSL(ドメイン固有言語)やスケジューリング戦略を設計するが、自動化はあらかじめ設定されたルールによって制限される。
展開範囲 実世界のアプリケーションのエンドツーエンドの統合と検証をサポートします。 主に単一オペレーター/画像処理パイプライン向けに設計されており、アプリケーションレベルの自動展開機能は備えていない。
ベースライン比較 アプリケーション独自のGPUコードに基づく 通常は、簡略化されたリファレンス実装またはCPUバージョンに基づいています。
正確性の検証 プログラムに組み込まれたチェック機能と、交互に行われる測定により、信頼性が確保されます。 これはフレームワークに組み込まれたテストに依存しており、システムレベルの不正防止プロトコルを欠いている。
知識の蓄積 複数のエージェントがオペレーターマトリックスの知識ベースを共有することで、経験の再利用が可能になる。 最適化に関する経験は様々な専門家に分散しているため、大規模に普及させるのは難しい。

ForgeStencilの応用事例

  • 石油・ガス地震探査石油探査データ処理ワークフローを高速化するために、RTM逆時間移行やTotalミニアプリなどのコアアルゴリズムを最適化する。
  • 電磁シミュレーション設計gprMax/FDTDなどのYeeメッシュを使用してマクスウェル方程式を解く効率を向上させ、レーダーやチップの電磁気解析に役立てる。
  • 医用画像再構成非直交座標系MRI再構成やデジタル乳房断層撮影逆投影など、医用画像処理における計算処理負荷を高速化する。
  • 気候と天体物理学大気力学や宇宙論シミュレーションなど、ステンシルを多用する科学計算アプリケーションを最適化する。
  • 定量的財務計算QuantLibなどの金融機関の価格設定ライブラリ向けに、ステンシルホットスポットの自動最適化機能を提供し、トランザクション計算の遅延を削減します。