project
ForgeTrain - Wallfacer Intelligenceと清華大学が共同開発した、大規模モデル事前学習フレームワーク。
ForgeTrainは、Facewall Intelligence、清華大学、およびOpenBMBオープンソースコミュニティが共同でリリースした、世界初のプロダクショングレードの大規模モデル事前学習フレームワークであり、人間のコード介入を一切含まず、完全にAIによって記述されています。
ForgeTrainとは何ですか?
ForgeTrainは、Facewall Intelligence、清華大学、およびOpenBMBオープンソースコミュニティが共同でリリースした、世界初のプロダクショングレードの大規模モデル事前学習フレームワークです。AIによって完全に記述されており、人間のコード介入は一切ありません。このフレームワークは、Forge Engineeringの3段階手法(標準設定→ビット単位のアライメント→パフォーマンスの追い越し)を採用し、NVIDIA H100上でMegatronよりも10%高速な学習速度を実現しています。Huawei Ascendチップ上での事前学習プロセスを正常に完了し、MiniCPM5-1Bモデルの学習に成功しました。
ForgeTrainの主な機能
- 実運用レベルの大規模モデルの事前学習数百から数千のGPUを使用した分散型協調トレーニングをサポートし、本番環境での使用に直接展開可能です。
- ハードウェアプラットフォーム間の適応NVIDIA H100シリーズとHuawei Ascendシリーズの両方のチップをサポートしており、Ascendの事前トレーニングプロセスを完了しています。
- 人間の能力を超えるパフォーマンスH100でのトレーニング速度はNVIDIA Megatronよりも10%速く、同じタスクを実行する際の計算コストも10%削減できます。
- ビット単位の一貫性検証AIが生成したフレームワークは、同じ入力に対して参照実装(Megatron)と完全に一致する数値結果を生成できるため、正確性が保証されます。
- 自動評価ハーネスこのシステムには、自動テストおよび性能評価システムが内蔵されており、正しく動作し、高速に動作するための基準を、機械が自動的に判断できる標準値に変換します。
ForgeTrainの技術原則
-
鍛造工学の3段階手法:
-
基準の設定(活用)Megatronから主要な運用データを収集し、自動化されたハーネスベンチマークを構築し、正確性とパフォーマンスのベースラインを定義する。
-
ビット単位の複製AIはハーネスの制約の下でメガトロンとビット単位で整合性のあるバージョンを構築し、複雑なシステムを正確に再現するAIの能力を検証する。
-
制約のない高架橋バイナリ整合性の制約を取り除き、パフォーマンス重視のHarnessに切り替えることで、AIがより広い探索空間で自律的に反復処理を行い、最終的に速度面での飛躍的な進歩を実現できる。
-
-
コードは高度にカスタマイズされた製品ですコードを長期的に維持管理すべき「資産」として扱う従来のソフトウェアとは異なり、Forge Engineeringはコードを高度にカスタマイズされた製品へと分離し、オンデマンドで生成できるようにします。つまり、同じハーネスを異なるハードウェア上で完全に異なる、カスタム最適化された実装へと生成できるのです。
-
抽象的な損失ゼロハーネス仕様では汎用性が維持され、すべての鍛造品において高い性能が維持されているため、汎用性とカスタマイズ性の間の従来のトレードオフが解消されています。
ForgeTrainの使い方
-
オープンソースの取得コードは完全にオープンソースです。GitHubアドレス:https://github.com/OpenBMB/ForgeTrain
-
コンテンツForgeTrainフレームワークコード(H100およびAscendバージョンを含む)+Agent Harnessの完全なツールチェーン(評価基準、テスト仕様、エージェントオーケストレーションスキーム)。
-
再現経路どのチームでもAgent Harnessを使用して、ビット単位の調整からパフォーマンスの追い越しまで、プロセス全体を再現できます。
-
実際の検証WallfacerはForgeTrainを使用してHuawei Ascendチップ上でMiniCPM5-1Bの事前学習を完了し、閉ループ動作の実現可能性を実証しました。
ForgeTrainの主な利点
-
製造業におけるAI:初の生産レベルでの検証NVIDIA VibeTensor(「非製品向け」と明記されている)、Anthropic Cコンパイラ、OpenAI Harnessとは異なり、ForgeTrainは、製品レベルの使いやすさ、優れたパフォーマンス、そして完全なオープンソースを同時に実現した唯一のAI生成フレームワークです。
-
研究開発効率が100倍に向上した。大規模モデルのトレーニングフレームワークの開発は、人間主導からAI主導へと移行するだろう。
-
国内コンピューティング能力エコシステムのボトルネックを打破するCUDAを新たに開発するために10年も費やす必要はありません。AIは各チップ専用のソフトウェアスタックを瞬時に構築できるため、「ソフトウェアはチップのリリース速度に合わせて進化し続ける」ことが可能になります。
-
コスト削減これにより、同じタスクを実行する際の計算能力コストを直接的に10%削減できます。
-
レベル4 AI製造AI「AIがAIを生み出す」という5段階の進化経路において、レベル4に到達する。つまり、AIが自身のインフラストラクチャを変革し、再帰が複合的に始まり始める。
ForgeTrainプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/OpenBMB/ForgeTrain
ForgeTrainと類似製品の比較
| 寸法 | ForgeTrain(壁面認識型知能) | VibeTensor (NVIDIA) |
|---|---|---|
| 生産グレードが入手可能 | はい | 「生産用ではありません」と明記されています。 |
| 分野 | 大規模モデルの事前学習フレームワーク | ディープラーニングランタイム |
| パフォーマンス | メガトロンより10%速い | PyTorch 1.7~6.2倍より遅い |
| マルチハードウェア対応 | H100 + Huawei Ascend | Nvidiaのみ |
| 完全オープンソース | はい | はい |
| AIが書いたレベル | 人的介入ゼロ | 一部 |
| 方法論 | 鍛造技術(標準規格 → 調整 → 追い越し) | 直接的な行動の一致 |
| 実際の検証 | MiniCPM5-1B(AAランキングで2Bに次ぐ1位)のトレーニングが完了しました。 | 本番環境での検証は行われていません。 |
ForgeTrainの応用シナリオ
-
大規模モデルの事前学習これは、大規模な実用レベルのモデルをトレーニングするための、Megatronなどの人間が作成したトレーニングフレームワークを直接置き換えるものです。
-
国内におけるコンピューティング能力の適応これにより、ファーウェイのAscendなどの国産チップ向けに特化した高性能トレーニングフレームワークを迅速に開発することが可能になり、CUDAエコシステムの独占状態を打破できる。
-
AI研究が加速大規模モデルの研究開発コストを削減し、大規模モデルの年間能力成長率を「人的資源規模関数」から「計算能力規模関数」へと移行させる。
-
ソフトウェアエンジニアリングのパラダイムシフトForge Engineeringの最初の事例として、これは他の複雑なシステム(コンパイラ、データベース、オペレーティングシステムなど)におけるAIの自動生成のための方法論的な参考となる。
-
エンドサイドモデルのトレーニングWallfacerは、この手法を用いてMiniCPM5-1Bを訓練しました。MiniCPM5-1Bは、2B以下のモデルを対象としたAAリーダーボードで世界第1位にランクされており、効率的なエッジサイドモデルの開発に適しています。