project
Nemotron-Labs-TwoTower - NVIDIAのオープンソースデュアルタワーアーキテクチャ普及言語モデル
NVIDIA Nemotron-Labs-TwoTowerは、NVIDIAが開発したオープンソースのデュアルタワーアーキテクチャ拡散言語モデルで、合計約60バイトのパラメータと3バイトのアクティブパラメータを備えています。このモデルは、コンテキスト理解とノイズ除去生成を2つの独立したタワーに分離し、ARコンテキストを固定します。
Nemotron-Labs-TwoTowerとは何ですか?
NVIDIA Nemotron-Labs-TwoTower は、NVIDIA が提供するオープンソースのデュアルタワー拡散言語モデルで、総パラメータは約 60 バイト、アクティブパラメータは 3 バイトです。このモデルは、コンテキスト理解とノイズ除去生成を 2 つの独立したタワーに分離しています。固定された AR コンテキスト タワーがトークンをクリーンアップし、トレーニング可能な拡散ノイズ除去タワーがクロス アテンションによってノイズ ブロックを洗練します。Nemotron-3-Nano-30B-A3B をベースに構築されたこのモデルは、約 2.1TB のトークンでトレーニングされ、自己回帰ベースラインの品質の 98.7% を維持し、生成スループットを 2.42 倍向上させています。マスク拡散、モック AR、および AR のみの推論モードをサポートしています。
Nemotron-Labs-TwoTowerの主な機能
-
ツインタワーの分離理由コンテキストエンコーディングとノイズ除去生成を2つの独立したモジュールに分解することで、単一のネットワークが「両方のタスクを実行する」ことによるパフォーマンスのボトルネックを回避します。
-
3つの推論モードを切り替える単一のチェックポイントで、マスク拡散、モックAR、ARのみをサポートし、さまざまなシナリオ要件に柔軟に対応します。
-
高品質なテキスト生成自己回帰ベースラインの集約ベースラインの品質の98.7%を維持しながら、並列反復生成を実現します。
-
高スループット生成アクセラレーション2×H100環境では、スループットが2.42倍に向上し、推論遅延と計算コストが大幅に削減されます。
-
商用グレードのオープンソース展開本製品は、オープンソースとしてNVIDIA Nemotronオープンモデルライセンスを採用しており、企業での商用利用および二次開発をサポートしています。
Nemotron-Labs-TwoTowerの技術原理
- 中心となる考え方従来の拡散言語モデルでは、「文脈理解」と「反復的なノイズ除去」の両方を単一のネットワークで処理するため、これら2つの機能が互いに阻害し合っていました。TwoTowerは、これら2つの役割を分離し、デュアルタワーアーキテクチャを採用しています。
-
コンテキストタワー凍結されたNemotron-3-Nano-30B-A3Bは、因果的注意機構を用いてクリーンなトークンを処理し、高品質なコンテキスト表現のエンコーディングを担当します。
-
騒音低減タワー双方向ブロックアテンションを使用してノイズの多いトークンブロックを処理し、クロスアテンションを通じてコンテキストタワーから意味的なガイダンスを取得してトークンを徐々に洗練し、ノイズを除去する学習可能なモジュール。
-
- トレーニング方法30BのハイブリッドMamba-Transformer MoEバックボーンをベースとし、約2.1Tトークンで学習され、MoEスパース活性化を使用して効率的な計算を実現しています。
- 推論の優位性拡散モデルの並列反復的な性質は、当然ながら高速な復号化を可能にします。2つのタワーが分離された後、ノイズ除去タワーはコンテキストを繰り返しエンコードする必要がなくなり、品質を維持しながら実時間スループットが大幅に向上します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Nemotron-Labs-TwoTowerの使い方
-
HuggingFaceのモデルページをご覧くださいNemotron-Labs-TwoTower-30B-A3B-Base-BF16の公式リポジトリページを開きます。
-
モデルカードとライセンスの読み方NVIDIA Nemotronオープンモデルライセンスの商用条件を確認し、モデルのアーキテクチャとハードウェア要件を理解してください。
-
クローン作成/ダウンロード重量:使用
git lfsまたはハグフェイスtransformersライブラリからモデルの重みファイルと設定ファイルをダウンロードしてください。 -
ランタイム環境を構成する少なくとも2つのH100 GPUを備えた環境を準備し、PyTorchとその依存関係をインストールしてください(リポジトリを参照してください)。
requirements.txt)。 -
モデルとトークナイザーの読み込み:合格
AutoModelForCausalLMそしてAutoTokenizerモデルを読み込み、マスク拡散/モックAR/ARのみの推論モードを選択します。 -
実行推論の生成モデル生成インターフェースを呼び出すための入力プロンプトが表示され、デュアルタワーアーキテクチャを使用して効率的な並列ノイズ除去生成が完了します。
-
微調整適応学習可能なノイズ除去タワーは、我々自身のデータに基づいてさらに微調整される一方、固定コンテキストタワーは変更されない。
Nemotron-Labs-TwoTowerの主な利点
- 2つのタワーは分離されており、それぞれが独自の機能を果たしている。コンテキストエンコーディングとノイズ除去生成を2つの独立したタワーに分離することで、単一のネットワーク役割における競合によって引き起こされるパフォーマンスのボトルネックを回避します。
- 品質はほとんど損なわれていない。集計ベースラインの品質は自己回帰ベースラインの98.7%に維持され、拡散生成によって出力品質が犠牲になることはなくなりました。
- 推論速度が2倍になった2×H100環境において、実時間生成スループットを2.42倍に向上させ、レイテンシとコンピューティング電力コストを大幅に削減します。
- 1つのモデル、3つのモード単一のチェックポイントは、マスク拡散、モックAR、ARのみの3つの推論方法をサポートし、さまざまなレイテンシと品質要件に柔軟に対応します。
- オープンソースで商用利用可能NVIDIA Nemotronオープンモデルライセンスを使用して重みを公開し、企業による無償展開および商用二次開発をサポートします。
Nemotron-Labs-TwoTowerプロジェクトの住所
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/nvidia/nemotron-labs-twotower
- arXiv技術論文:https://arxiv.org/pdf/2606.26493
Nemotron-Labs-TwoTower競合製品比較
| 比較対象寸法 | Nemotron-Labs-TwoTower | LLaDA |
|---|---|---|
| 発行機関 | NVIDIA | MIT |
| 建築設計 | ツインタワーが分離: 凍結ARコンテキストタワー + 学習可能な拡散ノイズ除去タワー(クロスアテンション接続) | シングルタワー統合単一のTransformerが、コンテキストエンコーディングとマスクノイズ除去の両方を実行します。 |
| パラメータの総数 | 約600億(アクティブ30億、MoEは疎) | 8B(高密度) |
| 基本モデル | Nemotron-3-Nano-30B-A3B(Mamba-Transformer MoE) | 自社開発トランスフォーマー |
| トレーニングデータ | ~2.1T tokens | ~2T tokens |
| ベースライン品質の維持 | 98.7%(自己回帰ベースラインとの比較) | 約95%(同サイズのARモデルとの比較) |
| スループットの向上 | 2.42×(2×H100,wall-clock) | 約1.5倍(標準GPU環境) |
| 推論パターン | 3種類:Mask Diffusion / Mock-AR / AR-only | シングルマスク拡散(ランダム/半自己回帰サンプリング) |
| 注意機構 | コンテキストタワー:因果的アテンション;ノイズ除去タワー:双方向ブロックアテンション+クロスアテンション | 統合型双方向アテンション+位置符号化処理 |
| コアイノベーション | 役割の分離単一のネットワークが「2つの役割を担う」ことによるパフォーマンスのボトルネックを回避しましょう。 | シンプルで拡張性が高い拡散モデルが8Bまで拡張可能であり、GPT-4の質量を近似できることを証明してください。 |
Nemotron-Labs-TwoTowerの応用事例
-
高同時接続オンラインサービススループットが2.42倍向上したことで、検索エンジンやインテリジェントな顧客サービスなど、低遅延と高同時処理能力が求められるリアルタイムのテキスト生成シナリオに適したものとなった。
-
長文ドキュメントの生成拡散モデルの並列反復的な性質は、長文の継続、レポート生成、コード補完など、複数の改良ステップを必要とするタスクに適している。
-
複数のモードでの柔軟な展開3つの推論モードを切り替える機能により、企業はコストと品質のトレードオフを検討し、エッジではARのみを使用し、クラウドではマスク拡散を使用するといったことが可能になります。
-
商用製品開発このモデルの商用ライセンスにより、企業はライティングアシスタント、マーケティングコピー生成ツール、コード支援ツールなどの商用製品にこのモデルを組み込むことができる。
-
科学研究と二次的イノベーションオープンソースの重み付けデータと論文の詳細情報は、研究者が拡散言語モデルのアーキテクチャ、トレーニング戦略、およびクロスモーダルな拡張方向を探求する上で役立ちます。