AB
AiBoss
project

Nemotron-Labs-Diffusion - NVIDIAのオープンソース3モード言語モデル

Nemotron-Labs-Diffusionは、NVIDIAが開発した3モード言語モデルで、自己回帰、拡散、自己推論デコーディングを単一のアーキテクチャに統合しています。AR-拡散ターゲットの共同トレーニングにより、このモデルは様々な同時実行シナリオで動作可能です。

Nemotron-Labs-Diffusionとは何ですか?

Nemotron-Labs-Diffusionは、NVIDIAが開発した3モード言語モデルで、自己回帰、拡散、自己推論のデコーディングを単一のアーキテクチャに統合しています。ARと拡散を統合したターゲットトレーニングにより、モデルはモードを切り替えて、さまざまな同時実行シナリオ下でも高いスループットを維持できます。このシリーズには、3B、8B、14Bのパラメータベース、命令、およびビジュアル言語モデルが含まれており、既存のオープンソースARおよび拡散言語モデルを精度と速度の両面で凌駕しています。

Nemotron-Labs-Diffusionの主な機能

  • 3モード復号切り替え本システムは、AR、拡散、自己推論の3つのデコードモードをサポートしています。アテンションモードを変更することで、単一モデル内でこれらのモードをシームレスに切り替えることができます。
  • ブロックレベル拡散並列生成ブロックレベルの拡散式は、シーケンスをブロックに分割し、各ブロック内で双方向に並列にデコードすることで、1回の順方向パスで複数のトークンを生成するために使用されます。
  • 自己控除ドラフトの確認このアルゴリズムは複数のトークンドラフトを並行して生成し、ARは同じモデル内で検証され、キーバリューキャッシュを共有し、補助的な予測ヘッドを必要としません。
  • 視覚言語理解これは、画像理解とテキストと画像の推論をサポートする視覚言語モデルのバリエーションを提供し、マルチモーダルアプリケーションの可能性を広げます。
  • 効率的な推論展開FP8低精度フォーマットをサポートし、SGLangフレームワークと組み合わせることで、GB200 GPU上で高スループットサービスを実現します。

ネモトロン・ラボ拡散の技術原理

  • AR拡散標的合同トレーニングこのモデルは、自己回帰型次トークン損失とブロックレベルの拡散ノイズ除去損失を同時に最適化し、両者を重み付けした組み合わせ(α=0.3)でバランスさせます。AR目的関数は拡散のための左から右への言語的事前情報を提供し、拡散学習が任意のトークン順列に容量を浪費するのを防ぎます。また、拡散目的関数はモデルの先読み計画能力を向上させます。
  • 2段階トレーニング戦略第1段階では、ARターゲットの事前学習のみを使用して、左から右への強い言語的帰納的バイアスを確立します。第2段階では、共同学習を可能にすることで拡散勾配を補完し、2つのターゲットの調和のとれた融合を実現します。
  • 構造化注意モデルトレーニング中は、デュアルストリーム入力が使用されます。ノイズストリームでは、トークンはブロック内で双方向アテンション、ブロック間で因果アテンションを受けますが、クリーンストリームでは生成された接頭辞にアテンションがかけられます。クリーンストリームは厳密な因果マスクを維持するため、ARターゲットと拡散ターゲットを同じ順方向・逆方向伝播で同時に計算できます。
  • 世界平均損失拡散ターゲット内の異なるサンプルにおけるノイズトークンの数の変動によって引き起こされる勾配の分散問題に対処するため、グローバルなトークンレベルの損失平均化手法が採用されています。この手法では、バッチ内のすべてのトークンに均等な重み付けを行い、少数の重みの高いノイズサンプルによってバッチ勾配に不均衡な影響が生じることを回避します。
  • 最適サンプリングとLoRA強化拡散モードは、サンプリング軌跡に基づいて最適化されたサンプラーと組み合わせることで並列性を向上させます。自己予測モードは、LoRAドラフトアダプタを搭載することで、ドラフト品質の向上、受入率の向上、および実際のデバイス効率の向上を実現できます。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

Nemotron-Labs-Diffusion の使い方

  • 依存関係をインストールします:埋め込む pip install "transformers>=5.0" torch peft `--` などのコマンドは、Python および GPU 環境を準備します。
  • モデルを取得するHuggingFaceから引用 nvidia/Nemotron-Labs-Diffusion-8B 等しいモデル重みと、それに対応する単語分割器。
  • モードを選択並行処理レベルに応じて、ARモード(高並行処理)、拡散モード(最大並列処理)、または自己予測モード(低遅延)を選択してください。
  • スクリプトを実行する:使用 chat_ar.pychat_dlm.py または chat_linear_spec.py 公式スクリプトが単回または複数回の対話推論を実行するまでお待ちください。
  • サービス展開SGLangフレームワークに基づく推論サービスを開始し、線形自己推測とFP8精度を設定し、本番環境に接続します。

Nemotron-Labs-Diffusionの主な利点

  • 3モード統合アーキテクチャ単一のモデルでAR言語の事前知識と拡散並列プランニング機能を同時に習得できるため、複数のモデルやパイプラインを維持する必要がなくなります。
  • スループットが大幅に向上8Bモデルは、Qwen3-8Bと比較して、フォワードパスあたり6倍多くのトークンをデコードし、GB200上でのSPEED-Benchのスループットは4倍に向上します。
  • 自己予測はMTPよりも優れている自己予測モデルは、承認率と実際のデバイス効率の両方において、マルチトークン予測(MTP)方式よりも優れた性能を発揮する。
  • 二重目標の調和的トレーニンググローバル損失平均化と2段階戦略は、2つの目標の勾配を効果的にバランスさせ、モード間の容量競合を回避する。
  • シーン適応型切り替えアテンションモードを切り替えることで、アーキテクチャの変更を必要とせずに、高並行性のクラウド側シナリオと低並行性のエッジ側シナリオの両方に対応できます。

ネモトロン・ラボ拡散プロジェクトの住所

  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/nvidia/nemotron-labs-diffusion
  • arXiv技術論文:https://arxiv.org/pdf/2607.05722

Nemotron-Labs-Diffusionと類似製品との比較

  • リアルタイム会話アシスタント同時実行数が少ないシナリオでは、低遅延の対話型AI対話を実現し、ユーザーエクスペリエンスを向上させるために、自己予測モードが使用されます。
  • クラウド推論サービスARモードは、高並列バッチリクエストに対応し、GPUコンピューティング密度を最大限に活用することで、クラウド展開コストを削減します。
  • コードと数学的推論拡散モデルは、将来計画を強化し、多段階の論理的推論を必要とするプログラミング支援型および数学的問題解決タスクに適している。
  • エンドサイドローカル推論8Bモデルは個人用デバイスで動作し、さまざまなワークロードに対応し、データプライバシーを確保するための3つのモードを備えています。
  • 視覚言語アプリケーション視覚言語モデルのバリアントは、画像理解と画像とテキストによる質問応答をサポートしており、インテリジェントな文書分析やマルチモーダルなインタラクションに適しています。

Nemotron-Labs-Diffusionの応用事例

  • リアルタイム会話アシスタント同時実行数が少ないシナリオでは、自己予測モードを使用して、低遅延の対話型AI対話を実現し、ユーザーエクスペリエンスを向上させます。
  • クラウド推論サービスARモードは、高並列バッチリクエストに対応し、GPUコンピューティング密度を最大限に活用することで、クラウド展開コストを削減します。
  • コードと数学的推論拡散モデルは、将来計画を強化し、多段階の論理的推論を必要とするプログラミング支援型および数学的問題解決タスクに適している。
  • エンドサイドローカル推論8Bモデルは個人用デバイスで動作し、さまざまなワークロードに対応し、データプライバシーを確保するための3つのモードを備えています。
  • 視覚言語アプリケーション視覚言語モデルのバリアントは、画像理解と画像とテキストによる質問応答をサポートしており、インテリジェントな文書分析やマルチモーダルなインタラクションに適しています。