project
MARS - ByteDanceが大規模モデルの学習効率を最適化するためのフレームワークを発表。
MARS(Make vAriance Reduction Shine)は、大規模モデルのトレーニング効率を向上させるためにByteDanceが開発した革新的な最適化フレームワークです。MARSは、スケーリングされた確率的再帰に基づく分散低減技術と前処理勾配法を統合しています。
火星とは何ですか?
MARS(Make vAriance Reduction Shine)は、大規模モデルの学習効率を向上させるためにByteDanceが開発した革新的な最適化フレームワークです。MARSは、前処理勾配法と分散低減技術を統合し、スケーリング確率再帰モーメンタムに基づいて勾配推定を最適化します。MARSフレームワークは柔軟性が高く、フルマトリックスまたは対角ヘッセ行列の近似をサポートし、AdamW、Lion、Shampooに基づいた3つの最適化アルゴリズムの例を示しています。実験結果によると、GPT-2モデルの学習において、MARSは従来のAdamWオプティマイザと比較して優れた性能を発揮します。
火星の主な機能
- トレーニング効率を向上させるMARSは、前処理勾配法と分散低減技術を組み合わせることで、大規模モデル、特に深層ニューラルネットワークや大規模言語モデルの学習効率を向上させます。
- 統一最適化フレームワークこれは、フルマトリックス近似や対角行列近似など、さまざまなヘッセ行列近似法に対応できる統一的なフレームワークを提供する。
- アルゴリズムのインスタンス化MARSフレームワーク内では、MARS-AdamW、MARS-Lion、MARS-Shampooという3つの具体的な最適化アルゴリズム例が実装されており、それぞれ異なる事前条件付き勾配更新戦略に基づいています。
- 分散の削減スケーリングされた確率的再帰的モーメンタムを導入することで、トレーニング中の勾配の分散を効果的に低減し、モデルの収束を加速させることができます。
MARSの技術原理
- 前条件付き勾配法学習率は前処理勾配法に基づいて調整されるため、各パラメータまたはパラメータ群は、その局所的な曲率に適応するようにカスタマイズされた学習率を持つ。
- 分散低減手法STORM(Stochastic Recursive Momentum)などの分散低減手法を導入することで、確率的勾配の分散を低減し、最適化プロセスを加速させることができます。
- ランダムな再帰的運動量のスケーリングSTORMに基づいて、分散低減の強度を調整するためのスケーリングパラメータが導入され、新しい勾配推定器が定義される。
- 勾配クリッピングと指数移動平均トレーニングの安定性を最適化するために、MARSは勾配推定器に勾配クリッピングを適用し、指数移動平均(EMA)を使用して再帰的モーメンタムを計算します。
MARSプロジェクトの住所
- arXiv技術論文:https://arxiv.org/pdf/2411.10438
MARSの応用シナリオ
- 深層学習モデルのトレーニング深層ニューラルネットワーク、特に多数のパラメータを持つ複雑なモデルのトレーニング。
- 大規模言語モデルGPTシリーズモデルなどの大規模言語モデルの学習プロセスを最適化し、学習効率とモデル性能を向上させる。
- コンピュータビジョンタスク画像分類や物体検出といったコンピュータビジョン分野では、モデルの学習を加速し、モデルの汎化能力を向上させる。
- 強化学習アルゴリズム強化学習では、特に勾配の分散が大きい場合、方策ネットワークまたは価値関数のパラメータが最適化されます。
- レコメンデーションシステムモデル推薦システムを構築する際には、大規模なユーザーやアイテムの特性をより適切に処理できるよう、モデルのパラメータを最適化する必要があります。