project
ELF - 何開明氏のチームが立ち上げた初の普及型言語モデル
ELF(Embedded Language Flows)は、Kaiming He氏のチームが発表した初の拡散型言語モデルであり、従来の自己回帰型アプローチに代わる連続拡散パラダイムを採用しています。このモデルは、プロセス全体を通して連続的な埋め込み空間内でノイズ除去を行うことでテキストを生成します。
ELFとは何ですか?
ELF(Embedded Language Flows)は、Kaiming He氏のチームが発表した最初の言語フローライブラリです。拡散この言語モデルは、従来の自己回帰アプローチではなく、連続拡散パラダイムを採用しています。モデルは、処理全体を通して連続埋め込み空間内でノイズ除去を行い、最終段階でトークンに離散化することでテキストを生成します。10⁵M個のパラメータ、45B個のトレーニングトークン、32回のサンプリングステップを使用することで、OpenWebTextにおいて生成パープレキシティ24を達成し、主流の離散拡散モデルを約10分の1のトレーニングデータで凌駕する性能を発揮します。無条件生成、翻訳、要約などのタスクにおいて優れたパフォーマンスを示します。
ELFの主な機能
-
連続的な空間テキスト生成ノイズ除去のための処理全体は、連続的な埋め込み空間で行われます。最終ステップ(t=1)では、連続的な表現が非埋め込み層を通して離散的なトークンに投影されます。
-
無条件言語生成純粋なガウスノイズから出発して、32回の反復処理を経て、自然で低パープレキシティの人間らしいテキストが生成される。
-
条件付きテキストタスク本モデルは、機械翻訳(WMT14)やテキスト要約(XSum)などの条件付き生成タスクをサポートしており、その性能は既存の拡散言語モデルや一部の自己回帰ベースラインを凌駕しています。
-
トレーニングと推論を統合したアーキテクチャノイズ除去ネットワークと最終的なデコードネットワークは同じパラメータセットを共有し、バイナリモードトークンを使用してノイズ除去/デコードモードを切り替えるため、独立したデコーダをトレーニングする必要がなくなります。
ELFの技術原理
-
連続埋め込みエンコーディング個々のトークンは、まずT5事前学習済みエンコーダによって双方向のコンテキスト埋め込みにマッピングされます。これらの埋め込みは学習フェーズでのみ使用され、推論時には追加のモジュールは追加されません。
-
Flow Matching + x-prediction連続空間において、ノイズからクリーンなデータへの修正された流れの軌跡を定義します。ネットワークは速度場ではないクリーンな埋め込み(x予測)を直接予測し、トレーニングの目的はMSE損失であり、これは高次元表現においてより安定しています。
-
Final-step Discretization最終段階では、学習可能な逆埋め込み行列を用いて、連続埋め込みをトークンロジットに投影します。タスクが単純化しすぎないように、学習中にトークンレベルの破損が加えられ、損失関数は交差エントロピーです。
-
Self-conditioning CFG画像生成から分類器不要のガイダンス概念を導入し、学習時のCFGを条件信号として使用することで、推論のオーバーヘッドを排除する。
ELFの使い方
-
アクセスコードリポジトリクローンしたプロジェクトのコードはGitHubで入手できます。
-
環境を整える依存関係(PyTorchなど)をインストールし、GPU環境を設定します。
-
データ前処理テキストデータは、T5エンコーダを使用して連続埋め込み形式に変換されます。
-
モデルトレーニングフローマッチング+x予測目的関数を使用してノイズ除去ネットワークをトレーニングし、MSEまたはCE損失をサポートします。
-
テキスト生成ガウスノイズから開始し、ELFノイズ除去ネットワークを32回呼び出し、最終ステップでデコードモードに切り替えてトークンを出力します。
-
下流タスクの微調整WMT14やXSumなどのデータセットにおける条件付き生成の微調整。
ELFの主な利点
-
極めて高いデータ効率450億トークンで学習されており、これはMDLM、Duo、FLMなどの競合他社の5000億トークン以上と比べて桁違いに少ない。
-
サンプリングステップはごくわずかです競合他社の1024ステップ生成品質を、わずか32ステップで達成、あるいは凌駕することも可能だ。
-
より高品質OpenWebTextは、パープレキシティが24という低いテキストを生成するため、より自然なテキストとなり、AIによるアーティファクトが減少します。
-
シンプルで統一感のある建築ノイズ除去とデコーディングは単一のネットワークを共有するため、追加のデコーダーモジュールが不要になり、潜在拡散におけるデコーダーのトレーニングに伴うオーバーヘッドやエラーの蓄積を回避できます。
ELFのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/lillian039/ELF
- arXiv技術論文:https://arxiv.org/pdf/2605.10938
ELFの類似競合製品の比較
| 比較対象寸法 | ELF | MDLM | LLaDA |
|---|---|---|---|
| テクニカルルート | 連続拡散(埋め込み空間全体でノイズ除去を行い、最終段階で離散化を行う) | 離散拡散(トークン空間内で直接操作を行い、各ステップで離散的な状態を維持する) | 離散拡散(BERTアーキテクチャに基づくマスク拡散言語モデル) |
| パラメータサイズ | 105M | 350M / 1.3B | 8B |
| トレーニングデータ | 45B token(1桁小さい) | 500B+ token | 数兆個のトークン |
| サンプリングステップ数 | 32ステップ | 1024ステップ(標準)/64ステップ(蒸留が必要) | ステップ64~128 |
| 困惑を生み出す | 24(OpenWebText、32段階非蒸留法) | 約35ステップ(1024ステップ)/約60ステップ(蒸留なしの場合32ステップ) | 約30(128ステップ) |
| 建築設計 | ノイズ除去とデコードは同じネットワークを共有しており、追加のモジュールは不要です。 | 各ステップは、語彙空間内における個別の状態遷移を伴う。 | マスク予測に基づくトランスフォーマーは、各ステップでマスクされたトークンを予測します。 |
| 中核的な利点 | 極めて高いデータ効率、極めて高速なサンプリング、そして最小限のアーキテクチャ | それは言語の離散的な性質と自然に合致し、理論的にも直感的である。 | 大規模なパラメータを用いることで、高い表現力と優れた拡張性を実現できる。 |
| 主な欠点 | 事前学習済みのエンコーダーを利用して埋め込みを提供する | 学習には大量のデータが必要であり、多くのサンプリング手順を経る必要があり、生成品質は手順の数に左右される。 | 推論はコストがかかり、大量の訓練データが必要であり、さらにかなりの数の推論ステップを伴う。 |
ELFの応用シナリオ
-
低リソースで高効率なテキスト生成高品質なモデルは450億トークンで学習できるため、データ予算が限られている企業や研究者が、自然言語生成機能を迅速に導入するのに適しています。
-
機械翻訳これは、WMT14などの翻訳タスクにおいて、既存の拡散モデルや一部の自己回帰ベースラインを凌駕する性能を発揮し、非自己回帰型翻訳システムのコアエンジンとして機能することができる。
-
テキストの要約とコンテンツの書き換えXSumなどの要約タスクにおいて安定した性能を発揮し、ニュース要約や文書抽出など、重要な情報を保持する必要があるシナリオに適しています。
-
クリエイティブライティングと対話生成パープレキシティが24と低く、テキストの自然さが高く、AIの痕跡がほとんど見られないため、長編小説やマーケティングコピーなど、人間らしいコンテンツの作成に適しています。
-
拡散言語モデル研究の基礎本研究は、テキスト生成における「最後まで連続する」経路の実現可能性を検証した最初の研究であり、大規模モデルアーキテクチャのその後の探求のための重要な参考資料および基本フレームワークを提供するものである。