project
MoE++ - 崑崙科技大学と北京大学が共同で立ち上げたハイブリッドエキスパートアーキテクチャ
MoE++は、崑崙科技2050研究所と北京大学の袁力氏のチームが共同開発した、斬新なエキスパート混合アーキテクチャです。これは、計算コストがゼロのエキスパート、すなわちゼロエキスパート、レプリケーションエキスパート、および定数コストエキスパートの導入に基づいています。
MoE++とは何ですか?
MoE++は、崑崙科技2050研究所と北京大学の袁力氏率いるチームが共同開発した、新しいエキスパート混合アーキテクチャです。計算コストゼロのエキスパート、エキスパートゼロ、複製エキスパート、定数エキスパートを導入することで、計算コストを削減し、モデルのパフォーマンスを向上させます。MoE++では、各トークンが異なる数のフィードフォワードネットワークエキスパートと動的に相互作用し、特定のレイヤーをスキップして計算リソースの割り当てを最適化できます。MoE++は、ゲート付き残差を使用して、トークンがエキスパートを選択する際に前のレイヤーのルーティングパスを考慮できるようにし、より安定したルーティングを実現します。実験結果によると、MoE++は同じモデルサイズで従来のMoEモデルを上回り、エキスパートのスループットを1.1~2.1倍向上させ、導入も容易です。
MoE++の主な機能
- コンピューティングコストを削減するMoE++はゼロ計算エキスパートを導入し、モデル内の各トークンが異なる数のフィードフォワードネットワーク(FFN)エキスパートと動的に相互作用したり、特定のレイヤーをスキップしたりすることで、不要な計算を削減します。
- モデルのパフォーマンスを向上させるMoE++は、単純なトークンの処理に必要なFFNエキスパートの数を減らすことで、より多くのエキスパートリソースを複雑なトークンの処理に集中させることができ、モデル全体のパフォーマンスを向上させます。
- リソース割り当てを最適化するMoE++は、柔軟な計算リソース割り当てによって、より必要とされるトークンに計算リソースを集中させることで、計算効率を向上させます。
- 安定したルーティングMoE++は、ゲート残差メカニズムを使用して、トークンがエキスパートを選択する際に前のレイヤーのルーティングパスを参照できるようにすることで、より安定したエキスパート選択を実現します。
- 導入が簡単ゼロ計算エキスパートのパラメータは非常に小さいため、MoE++はそのようなエキスパートをすべて同じGPU上に配置することで、分散FFNエキスパート配置によって引き起こされる通信オーバーヘッドや負荷の不均一といった問題を回避します。
MoE++の技術的原則
- 計算処理ゼロの専門家MoE++は、ゼロエキスパート(空のベクトルを出力する)、コピーエキスパート(入力をそのまま出力として使用する)、定数エキスパート(入力を学習可能なベクトルに置き換える)の3種類の計算コストゼロのエキスパートを導入しています。
- 動的な専門家選定従来のMoE方式とは異なり、MoE++は、トークンの複雑さに基づいて、各トークンを処理するFFNエキスパートの数を動的に選択することをサポートしています。
- ゲーティング残差MoE++は、専門家選択プロセスにゲーティング残差を組み込むことで、トークンが現在のレイヤーの専門家を選択する際に、前のレイヤーのルーティングパスを考慮できるようにし、モデルの異なるレイヤー間の情報フローを強化します。
- 多様な専門家構成MoE++の専門家構造は異質であり、異なるタイプの専門家(FFN専門家とゼロ計算専門家)が同じモデル内で協力して作業することで、モデルの適応性と柔軟性を向上させている。
- ロードバランシングMoE++は、負荷分散損失とエキスパート容量割り当て戦略の導入に基づいており、モデル学習プロセス中にエキスパートの負荷がバランスよく分散されるようにすることで、一部のエキスパートが過負荷状態になり、他のエキスパートがアイドル状態になるという問題を回避します。
MoE++プロジェクトの住所
- GitHubリポジトリ:https://github.com/SkyworkAI/MoE-plus-plus
- ハギングフェイスモデルライブラリ:https://huggingface.co/Chat-UniVi/MoE-Plus-Plus-7B
- arXiv技術論文:https://arxiv.org/pdf/2410.07348
MoE++の応用シナリオ
- 自然言語処理(NLP)研究者研究者たちは、言語理解、テキスト生成、機械翻訳、質問応答システムなどの分野における研究を行うために、より効率的な大規模言語モデルを構築・訓練している。
- エンタープライズ開発者企業開発者は、インテリジェントな顧客サービス、コンテンツ推薦システム、自動要約、感情分析などの高性能な自然言語処理(NLP)アプリケーションを作成することで、製品のインテリジェンスレベルを向上させることができます。
- クラウドコンピューティングおよびAIサービスプロバイダープロバイダーはMoE++アーキテクチャを統合することで、特に大量の言語データを処理する必要があるシナリオにおいて、より効率的で低コストなAIサービスを顧客に提供します。
- 学術機関学術機関は、さまざまな自然言語処理タスクに関する教育と研究を行い、学生や研究者が高度な深層学習モデルやアルゴリズムを理解できるよう支援している。