project
Instella-MoE - AMDのオープンソースハイブリッドエキスパート言語モデルシリーズ
Instella-MoEは、AMDが開発したオープンソースのハイブリッドエキスパート言語モデルシリーズで、合計160億のパラメータ、28億のアクティベーションパラメータ、27層のデコーダアーキテクチャを備えています。このモデルは、AMD Instinct MI300X/MI325X GPUとR...に基づいています。
Instella-MoEとは何ですか?
Instella-MoEは、AMDが提供するオープンソースのハイブリッドエキスパート言語モデルシリーズで、合計160億個のパラメータと28億個のアクティベーションパラメータを持ち、27層のデコーダアーキテクチャを採用しています。このモデルは、AMD Instinct MI300X/MI325X GPUとROCmソフトウェアスタック上でゼロからトレーニングされており、事前学習済み、ロングコンテキストベース、SFT、DPO、RL最適化の6つの完全オープンソースバージョンを提供し、AMDハードウェア上でのトレーニングと推論の効率的な連携を実現しています。
Instella-MoEの主な機能
-
多段階モデルシリーズ本システムは、事前学習、中間学習、長期コンテキストベース、SFT、DPO、RL最適化の6つのバージョンを提供し、ベースから対話に至るまでのニーズの連鎖全体を網羅しています。
-
高効率なMoE推論2.8Bパラメータのみを有効にするだけで推論を完了でき、計算オーバーヘッドを小さく抑えながら、より大規模な密なモデルに近いパフォーマンスを実現できます。
-
長文コンテキストのサポート基本バージョンは64Kのコンテキスト長をサポートしており、長文の文書の理解や推論タスクを処理できます。
-
指示遵守と思考連鎖SFT版は命令追跡と連鎖推論を実装している一方、Think版は強化学習によって応答品質をさらに向上させている。
-
AMDネイティブ最適化ROCmエコシステムとSGLang推論フレームワークに基づき、ディープ最適化によってAMDハードウェア上での効率的な学習と推論を実現します。
Instella-MoE の技術原則
- MoEアーキテクチャとアテンションメカニズム本モデルはハイブリッドエキスパートアーキテクチャを採用し、合計160億個のパラメータのうち、各順伝播で28億個のパラメータのみをアクティブ化します。ゲート付きルーティングメカニズムにより、トークンが異なるエキスパートネットワークに動的に割り当てられ、高容量と低推論コストの分離が実現されます。さらに、ゲート付きマルチヘッド潜在アテンションが導入され、潜在アテンション空間にゲート制御が加わることで、長系列モデリング機能が向上し、キーバリューキャッシュのオーバーヘッドが削減されます。
- AMDネイティブトレーニングシステムトレーニングは完全にAMD ROCm™ソフトウェアスタックに基づいており、Primusトレーニングフレームワークと最下層でMiles RLフレームワークを使用しています。事前トレーニング段階では、FarSkip-Collectiveテクノロジーを利用してエキスパート並列処理下で通信と計算のオーバーラップを実現し、事前トレーニング速度を12.7%向上させています。モデルはAMD Instinct MI300X/MI325X GPU上でゼロからトレーニングされ、AMDハードウェアの相互接続帯域幅の利点を最大限に活用しています。
- トレーニング後学習と強化学習トレーニング後の処理では、SFT → DPO → 2段階の強化学習という4段階のパイプラインを使用します。強化学習段階は、次の2つに分かれています。第1段階では、指示への準拠に特化した強化学習を実行します。第2段階では、MOPDを使用します。MOPDは、トークンレベルの逆KLダイバージェンスを使用して生徒モデルのポリシー更新を制約し、IFプロンプトをIF-RL教師に、その他のプロンプトをドメインルーターを介してDPO教師にルーティングすることで、一般的な機能を維持しながら指示への準拠と推論品質を向上させます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Instella-MoEの使い方
- モデルの重みを取得するハグフェイスモデルコレクションへのアクセス(
amd/instella-moeGitHubリポジトリまたはGitHubリポジトリから必要なバージョン(Base / SFT / DPO / Think)をダウンロードしてください。 - 環境準備AMD ROCmドライバーとROCm用のPyTorchをインストールするか、ROCmをサポートするDockerイメージを使用してください。
- モデルTransformersライブラリまたはSGLang推論フレームワークを使用して、モデルの重みを読み込みます。SGLangは、AMDハードウェアの推論高速化機能を最大限に活用できます。
- 実行理由タスクの種類に応じて適切なバージョンを選択してください。Baseはテキストの継続と埋め込みに使用され、SFT / DPO / Thinkは対話と指示タスクに使用されます。
- 微調整と展開ベースモデルに基づいて独自のデータを使用してトレーニングを継続するか、vLLM/SGLangを介してAPIサービスとしてデプロイします。
Instella-MoE の主な利点
-
フルチェーンのオープンソースで透明性が高い事前学習から強化学習まで、モデル全体がオープンソースであり、学習データとコードは透明性をもって公開されています。
-
ネイティブなAMDエコシステムとの互換性ROCmと独自開発のGPUトレーニングに基づき、AMD Instinctシリーズのハードウェア上で最適な推論効率を実現し、TTFTを最大39.2%削減しました。
-
活性化パラメータは非常に効率的です合計160億個のパラメータのうち、実際にアクティブ化されるのはわずか28億個であるため、同等の性能を持つより密度の高いモデルと比較して、推論コストが大幅に低減される。
-
高度な研修後技術MOPDマルチティーチャー蒸留とトークンレベルの逆KLを組み合わせると、指示遵守と数学的推論において非常に優れた性能を発揮する。
-
通信計算の深い重複FarSkip-CollectiveとSGLangのエキスパートが並行して動作することで通信の隠蔽を実現し、優れた学習効率と推論効率をもたらします。
Instella-MoEプロジェクトの住所
- プロジェクト公式サイト:https://rocm.blogs.amd.com/artificial-intelligence/instella-moe/README.html
- GitHubリポジトリ:https://github.com/AMD-AGI/Instella-MoE
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/amd/instella-moe
Instella-MoEと類似製品との比較
| 寸法 | Instella-MoE-16B-A3B | Qwen3.5-4B-Base |
|---|---|---|
| ランチャー | AMD(2026.07) | アリババの一般知識に関する1000問 |
| パラメータの総数 | 16B | 4B |
| 活性化パラメータ量 | 2.8B | 4B(高密度、完全活性化) |
| 建築タイプ | MoE(ハイブリッド専門家) | 高密度トランスフォーマー |
| オープンソースレベル | 6段階の重み付けと完全なオープンソースコード | 重み付けオープンソース |
| コンテキストの長さ | 64K | 128K |
| 基本平均パフォーマンス | 76.7% | 79.5% |
Instella-MoEの応用事例
-
企業民営化の展開データコンプライアンス要件を満たすため、AMD ROCmエコシステムに基づいたローカルGPUクラスタ上に対話サービスと推論サービスをデプロイします。
-
長文文書分析64Kの長文コンテキストに対応できるため、法律契約書、科学研究論文、財務諸表などの長文テキストの理解や要約タスクを処理できます。
-
コード生成支援SFT/Thinkバージョンはプログラミング命令の追従をサポートしており、IDEプラグインやコードレビューツールと併用できます。
-
科学研究と教育完全オープンソースのパイプラインは、MoEアーキテクチャに関する学術研究、トレーニング方法の再現、大規模モデルコースの教育に適しています。
-
エッジおよびハイブリッドクラウド推論活性化パラメータの数が少ないことは、リソースが限られた環境での効率的な推論や、ハイブリッドクラウドAIサービスの基本モデルとして適しています。