project
LLaDA 2.0 - Ant Groupによるオープンソースの離散拡散大規模言語モデル
LLaDA 2.0 は、Ant Group によるオープンソースの離散拡散大規模言語モデル (dLLM) で、16B (mini) 版と 100B (flash) 版があります。拡散モデルのスケーラビリティのボトルネックを打破し、パラメータスケールを初めて拡張しました。
LLaDA 2.0とは何ですか?
LLaDA 2.0は、Ant Groupが開発したオープンソースの離散拡散型大規模言語モデル(dLLM)で、16B(mini)版と100B(flash)版が用意されています。拡散モデルのスケーラビリティのボトルネックを打破し、パラメータサイズを初めて100Bレベルまで拡張しました。革新的なWarmup-Stable-Decay(WSD)連続事前学習戦略により、自己回帰(AR)モデルから拡散モデルへのスムーズな移行を実現し、ARモデルの知識を継承しつつ、ゼロから学習する高コストを回避します。
LLaDA 2.0の主な特徴
-
大規模パラメータ展開LLaDA 2.0は16Bと100Bの2つのバージョンを提供しており、現在最大の拡散言語モデルであり、拡散モデルが大規模に拡張するのが難しいという制約を克服しています。
-
高効率な推論処理の高速化並列デコード機構の助けを借りて、LLaDA 2.0は最大535トークン/秒の推論速度を実現し、これは同レベルの自己回帰モデルよりも2.1倍高速であり、生成効率を大幅に向上させています。
-
円滑な移行と知識の継承ウォームアップ・安定減衰(WSD)戦略を採用することで、自己回帰モデルから拡散モデルへのスムーズな移行を実現し、ARモデルの知識を継承しつつ、ゼロからトレーニングするコストを回避します。
-
優れたパフォーマンスコード生成、数学的推論、エージェントタスクなどの構造化生成タスクにおいて大きな優位性を示しつつ、他の分野ではオープンソースのARモデルと同等の性能を維持している。
-
完全オープンソースで共有されていますLLaDA 2.0のモデル重み(16B/100B)および関連するトレーニングコードは、Hugging Face上で完全にオープンソース化されており、開発者が利用したり、さらなる研究を行ったりするのに便利です。
LLaDA 2.0の技術的原理
-
拡散モデルアーキテクチャLLaDA 2.0は拡散モデルに基づいており、段階的なノイズ除去によってテキストを生成します。従来の自己回帰生成手法とは異なり、複数のタグを並列にデコードできるため、生成速度が向上します。
-
ハイブリッドエキスパートアーキテクチャ(MoE)MoEアーキテクチャを組み合わせることで、各推論においてパラメータのごく一部(約14億4000万個)のみが有効になり、高いパフォーマンスを維持しながら計算コストを大幅に削減できます。
-
ウォームアップ・安定・減衰(WSD)戦略3段階の事前学習(ブロックサイズの段階的な増加、全シーケンスの学習、ブロックサイズの減少)を通じて、自己回帰モデルから拡散モデルへのスムーズな移行が実現され、既存の知識が継承され、推論効率が最適化される。
-
自信度を考慮した並行トレーニング(CAP)並列デコード中、補助的な損失関数を用いて「正しく予測され、かつ確信度の高い」ラベルに報酬を与えることで、デコード効率を向上させ、高速推論を可能にする。
-
拡散モデルバージョンDPO条件付き確率を近似するために証拠下限(ELBO)を使用することで、選好学習(DPO)を拡散モデルに適用し、モデルの出力を人間の選好に適合するように最適化します。
-
文書レベルの注意マスク複数文書の連結学習において、文書レベルのアテンションマスクは、無関係な文書間の誤った接続を回避し、長文テキストの意味的な一貫性を確保するために設計されています。
LLaDA 2.0プロジェクトのアドレス
- ハグ顔モデルライブラリ:https://huggingface.co/collections/inclusionAI/llada-20
- 技術報告書:https://github.com/inclusionAI/LLaDA2.0/blob/main/tech_report.pdf
LLaDA 2.0の応用シナリオ
-
コード生成LLaDA 2.0はコード生成タスクにおいて非常に優れた性能を発揮し、開発者が機能を迅速に実装するのに役立つ高品質のコードスニペットを生成します。
-
数学的推論このモデルは、数学的な問題解決や複雑な推論タスクにおいて強力な能力を発揮し、教育や科学研究などの分野で活用できる。
-
インテリジェントエージェントタスク複雑なエージェント呼び出しや長文処理をサポートしているため、複数ステップの推論やツール呼び出しを必要とするシナリオに適しています。
-
テキスト生成高品質なテキストコンテンツを生成でき、創作活動、コンテンツ制作、その他様々な場面に適しています。
-
知識に関するQ&A知識理解や質問応答タスクにおいて優れた性能を発揮し、インテリジェントな顧客サービスやナレッジグラフなどの分野で活用できる。