project
LLaDA2.2-flash - InclusionAI オープンソース拡散言語モデル
LLaDA2.2-flashは、InclusionAIが開発したオープンソースの拡散言語モデル(dLLM)で、約100バイトのパラメータと128Kコンテキストのネイティブサポートを備えたMoEアーキテクチャを採用しています。このモデルは、マルチラウンド並列ノイズ除去によって回答を適合させ、Levinsteinアルゴリズムを組み込んでいます。
LLaDA2.2-flashとは何ですか?
LLaDA2.2-flashは、InclusionAIが開発したオープンソースの拡散言語モデル(dLLM)で、約100バイトのパラメータと128Kコンテキストのネイティブサポートを備えたMoEアーキテクチャを採用しています。このモデルは、マルチラウンド並列ノイズ除去によって回答を適合させ、シーケンスの追加、削除、変更を可能にするためにレーベンシュタイン編集を組み込んでいます。このモデルは、7つのエージェントベンチマークで平均スコア53.83を達成し、同様のサイズの自己回帰モデルLing-2.6-flashのスコア55.74に迫るとともに、デコードスループットで1.64倍の優位性を維持しています。
LLaDA2.2-flashの主な機能
-
拡散ベースの並列生成ブロック並列デコードによって複数のトークン位置を同時に処理することで、高スループットのテキスト生成が実現されます。
-
レヴィンシュタイン編集者ノイズ低減処理中、KEEP、SUBSTITUTE、DELETE、INSERTの4つの編集操作をサポートし、固定長置換の制限を打破します。
-
長時間のコンテキスト処理ネイティブで128Kのコンテキストウィンドウをサポートしており、長期的なソフトウェアエンジニアリングやツール呼び出しの軌跡といった複雑なシナリオにも対応できます。
-
エージェントタスクの実行コードの修復、APIとのやり取り、複数回のツール呼び出しなど、継続的なエラー修正を必要とする環境フィードバックタスクをサポートします。
-
MoEの高効率推論ハイブリッドエキスパートアーキテクチャを採用し、ブロックルーティングメカニズムを通じて、長いコンテキストにおける推論コストを制御します。
LLaDA2.2-flashの技術的原理
-
拡散言語モデルパラダイム左から右へトークンを一つずつ生成する自己回帰モデルとは異なり、LLaDA2.2はまず埋めるべきノイズ位置のバッチを特定し、その後、複数回のノイズ除去処理を通して徐々に完全なシーケンスに適合させていきます。複数の位置を協調的に進めることで、繰り返し改良を重ねることが可能です。
-
レヴィンシュタイン編集メカニズム生成されたドラフトは、最長共通部分列(LCS)を使用してターゲット配列と整列され、KEEP、SUBSTITUTE、DELETE、INSERTの4種類の編集命令が構築されます。DELETEは冗長なトークンを削除し、後続のシーケンスを左にシフトします。一方、INSERTは現在の位置の前に[MASK]を作成し、後で埋めることで、モデルが長さの異なるシーケンスを修正できるようにします。
-
L-EBPO強化学習本論文では、レーベンシュタインの編集エビデンスの下限に基づくブロックレベルのポリシー最適化アルゴリズムを提案する。外側の層は、複数ラウンドにわたるエージェント間の相互作用における軌跡レベルの意思決定を最適化し、内側の層は、単一世代におけるブロック内の挿入と削除を担当する。編集軌跡を復元することで、勾配は構造的な意思決定をカバーする。環境報酬は、ツール呼び出しの正確性、出力フォーマットの妥当性、およびタスク完了度合いから得られる。
-
ブロックルーティングMoEにおける長期コンテキストブロック拡散時のエキスパート連合のインフレ問題に対処するため、トークンレースを用いてブロックレベルの承認スコアを取得します。256人のルーティングエキスパートから上位48人のエキスパートを選出し、候補プールを形成します。次に、プール内の各トークンに対して上位k個のルーティングを実行することで、エキスパートワーキングセットが予測可能なO(C)の上限値を持つようにします。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
LLaDA2.2-flash の使い方
- ハードウェアの準備LLaDA2.2-flashをローカルに展開するには、BF16フル精度ロードをサポートするA100-80GBまたは同等のGPUが少なくとも4基必要です。FP8量子化を使用する場合、または128K長のコンテキストシーンを処理する場合は、それに応じてより多くのビデオメモリリソースを確保する必要があります。
- モデルのダウンロードModelScope SDK を介してモデルをダウンロードする場合は、以下を実行してください。
from modelscope import snapshot_download; model_dir = snapshot_download("inclusionAI/LLaDA2.2-flash")約206GBのモデルファイルを自動的にダウンロードできます。 - GitクローンGit LFS を使用してモデルを取得した場合は、以下を実行します。
git lfs install大容量ファイルサポートを初期化して実行します。git clone https://modelscope.cn/models/inclusionAI/LLaDA2.2-flash.gitモデルリポジトリ全体を取得します。 - モデル読み込みTransformers を使用してモデルをロードする場合、
AutoModelForCausalLM.from_pretrained(model_path, trust_remote_code=True, device_map="auto")そして必ず設定してくださいtrust_remote_code=Trueカスタム拡散復号ロジックを有効にする。 - 精密設定モデルがロードされたら、実行します。
model = model.to(torch.bfloat16)BF16精度に変換してから、model.eval()モデルを評価推論モードに切り替えます。 - トークナイザーの読み込み対応する単語分割器を同期的にロードする
AutoTokenizer.from_pretrained(model_path, trust_remote_code=True)これにより、単語分割ルールがモデル構成と完全に一致することが保証されます。 - 入力構築ユーザープロンプトを作成した後、
tokenizer.apply_chat_template([{"role": "user", "content": prompt}], add_generation_prompt=True, tokenize=True, return_tensors="pt")対話をモデルが必要とする入力テンソル形式に整形する。 - パラメータ設定: 電話
model.generate()鍵拡散復号パラメータをその時点で設定します。block_length=32各ステップにおける並列ノイズ除去のためのトークン数を制御する。threshold=0.5ノイズ除去の信頼度閾値を設定します。editing_threshold=0.0アクティブな編集をオフにします。temperature=0.0貪欲デコードを有効にする。gen_length=512最大生成長を設定します。 - 結果のデコード生成後、使用
tokenizer.decode(generated_tokens[0], skip_special_tokens=True)トークンシーケンスを読みやすいテキストにデコードし、最終結果を出力する。
LLaDA2.2フラッシュの主な利点
-
高スループットデコードBF16の平均復号スループットは、同規模のLing-2.6フラッシュ自己回帰モデルの1.64倍であり、FP8量子化後にはさらに18.6%向上させることができる。
-
構造化された自己修正レヴィンシュタインによる編集により、モデルはデータの追加、削除、変更が可能になり、SWE-bench検証済みソリューション率が35.8%から44.4%に向上し、絶対値で8.6パーセントポイントの増加となった。
-
元の生育状況エージェントの長期的なインタラクションニーズに適応するため、外挿を行わずに継続的な事前学習によって8Kから128Kまでスケールアップします。
-
オープンソースで再現可能本ソフトウェアはApache-2.0ライセンスの下で提供されており、モデルとトレーニングの詳細は公開されているため、完全なローカル環境での再現が可能です。
-
MoE推論効率ブロックルーティングメカニズムは、各ブロックのエキスパートワーキングセットを固定容量内に維持することで、HBMトラフィックと通信コストを大幅に削減します。
LLaDA2.2-flashプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/inclusionAI/LLaDA2.X
- ModelScopeアドレス:https://modelscope.cn/models/inclusionAI/LLaDA2.2-flash
LLaDA2.2-flashと類似の競合製品との比較
| 比較対象寸法 | LLaDA2.2-flash | Ling-2.6-flash |
|---|---|---|
| 建築パラダイム | 拡散言語モデル(dLLM)とMoEアーキテクチャを組み合わせることで、複数回の並列ノイズ除去処理を通してシーケンスを生成する。 | テキストは、自己回帰(AR)アプローチとMoEアーキテクチャを組み合わせて、左から右へトークンごとに順次生成されます。 |
| シーケンス編集機能 | Levinstein編集をネイティブにサポートしており、追加、削除、変更の4種類の操作(KEEP、SUBSTITUTE、DELETE、INSERT)を備えています。 | ネイティブなシーケンス編集機能がないため、生成後の修正には外部でのリサンプリングまたは後処理が必要となる。 |
| 強化学習戦略 | L-EBPOアルゴリズムは、環境フィードバックを考慮しながら、軌道レベルの決定とブロック内の編集アクションを同時に最適化するために使用されます。 | アライメントと最適化は、標準的なRLHFまたは従来型の強化学習フレームワークを使用して実行されます。 |
| エージェントベンチマーク平均 | 7つのエージェントベンチマークテストにおける平均スコアは53.83でした。 | 同じ7つのエージェントベンチマークテストにおける平均スコアは55.74で、1.91ポイント高かった。 |
| デコードスループット | BF16の平均復号スループットはLing-2.6-flashの1.64倍であり、FP8量子化後にはさらに18.6%向上する。 | 自己回帰ベースラインモデルとして、デコードスループットはトークン生成方法によって制限される。 |
| コンテキストウィンドウ | 位置情報の推定を行わずに、継続的な事前学習によって128Kコンテキストをネイティブにサポートします。 | 状況判断能力に関する具体的な訓練方法は、公開されている技術報告書には詳細に記載されていなかった。 |
LLaDA2.2-flashの応用シナリオ
- ソフトウェアエンジニアリングエージェントこのモデルは、テキストの追加、削除、変更といったLevinsteinの編集機能をネイティブにサポートしているため、コードの修正、バグの特定、関数の補完など、長さの異なるテキストの編集を必要とする複雑なプログラミングタスクを処理することが可能です。
- 複数ラウンドのツール呼び出しAPIとのやり取りやMCPプロトコルの実行において、モデルはパラメータを動的に修正したり、フィールドを追加または削除したりすることで、継続的なエラー修正を必要とする複雑なエージェントのワークフローに適応できます。
- 長文文書処理ネイティブの128Kコンテキストウィンドウを使用することで、このモデルは位置外挿に頼ることなく、長文テキストの分析、レポート生成、知識抽出を効率的に実行できます。
- 科学研究および実験的再現オープンソースのMoE拡散言語モデルであるLLaDA2.2-flashは、学術コミュニティに対し、再現可能な研究基盤と、自己回帰的な手法にとどまらない代替的な技術的道筋を提供する。