project
Nemotron 3.5 Lightning - NVIDIAのオープンソースMoEモデル
Nemotron 3.5 Lightningは、NVIDIAが提供する30個のパラメータを持つオープンソースのMoEモデルで、マルチエージェントシステム向けに最適化されています。類似モデルと比較して、出力速度が4倍速く、エージェントのタスク完了速度が30%向上しています。
Nemotron 3.5 Lightningとは何ですか?
Nemotron 3.5 Lightningは、NVIDIAが提供するオープンソースの30パラメータMoEモデルで、マルチエージェントシステム向けに最適化されています。類似モデルと比較して、出力速度が4倍、エージェントタスクの完了速度が30%向上しており、精度と速度の優れたバランスを実現しています。このモデルは、RTX PCやJetsonからデータセンターまで、あらゆるシナリオでの展開をサポートしており、Hugging FaceやNVIDIA Buildなどのプラットフォームでオープンソースとして公開されているため、より効率的なエージェントアプリケーションの開発を容易にします。
Nemotron 3.5 Lightningの主な機能
- マルチエージェントタスク実行このモデルは、大規模なマルチエージェントシステムにおける特定のタスク向けに特別に設計されており、開発者がよりスマートで効率的なエージェントアプリケーションを構築するのに役立ちます。
- 高速推論出力類似モデルと比較して、Nemotron 3.5 Lightningは最大4倍の出力速度を実現し、エージェントタスクの全体的な完了速度を30%向上させます。
- あらゆるシナリオに対応した柔軟な展開このモデルは、ローカルのAIシステム(NVIDIA RTX PC、DGX Spark、Jetsonなど)上で直接実行できるだけでなく、エッジデバイス、ワークステーション、データセンター、クラウド環境にもシームレスに拡張できます。
Nemotron 3.5 Lightningの技術原理
- MoEハイブリッドエキスパートアーキテクチャNemotron 3.5 Lightningは、合計300億個のパラメータを持つ30BパラメータMoE(ハイブリッドエキスパート)アーキテクチャを採用しています。各推論では、約30億個のパラメータを持つサブネットワークのみがアクティブ化されます。疎なアクティブ化メカニズムにより、大規模モデルの機能を維持しながら計算オーバーヘッドを大幅に削減し、効率的な推論を実現します。
- NVFP4量子化圧縮このモデルは、NVIDIAが独自開発した4ビット浮動小数点精度ソリューションであるNVFP4量子化フォーマットをサポートしています。これにより、モデルのサイズとメモリ使用量を大幅に削減できるため、RTX PCやJetsonなどのコンシューマー向けデバイスやエッジデバイスでスムーズに動作します。
- インテリジェントエージェントのシナリオ固有の最適化このモデルは、マルチエージェント連携シナリオ向けに特別に訓練および最適化されており、複雑なエージェントワークフローをより適切にサポートするために、長鎖推論、ツール呼び出し、タスク分解といった主要な側面における安定性と精度の向上に重点を置いています。
- 速度と精度の同時最適化アーキテクチャ設計とトレーニング戦略において、Nemotron 3.5 Lightningは精度と推論速度の同時最適化を実現しています。PinchBenchベンチマークテストにおいて、類似モデルと比較して優れた総合性能を発揮し、タスク完了の品質を確保するとともに、エージェントの全体的な実行速度を30%向上させています。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Nemotron 3.5 Lightning の使い方
- ハグ顔のダウンロードHugging Faceの公式リポジトリにアクセスしてモデルの重みをダウンロードし、Nemotron 3.5 Lightningを使用してローカルでロードおよび実行できます。
- NVIDIAビルドプラットフォームモデルの紹介、技術文書、導入ガイドラインについては、NVIDIA BuildのWebサイトをご覧ください。
- ローカルデバイスの展開NVIDIA RTX PC、DGX Spark、DGX Station、Jetsonなどのローカルデバイスにモデルを直接デプロイします。
- 企業レベルの拡張RTX PROワークステーション、データセンター、クラウド環境へとシームレスに拡張し、エンタープライズレベルのアプリケーションニーズに対応します。
Nemotron 3.5 Lightningの主な利点
- MoEスパース活性化アーキテクチャこのモデルは、合計300億個のパラメータと約30億個の活性化パラメータを持つMoEアーキテクチャを採用しており、大規模モデルの能力を維持しながら計算オーバーヘッドを大幅に削減します。
- 極めて高速な推論性能類似モデルと比較して、出力速度が4倍になり、エージェントタスクの全体的な完了速度を30%向上させることができます。
- NVFP4量子化サポートNVIDIAが独自開発した4ビット浮動小数点量子化フォーマットを活用することで、ビデオメモリの使用量を大幅に圧縮し、RTX搭載PCからデータセンターまで、あらゆるシナリオでの展開を可能にします。
- インテリジェントエージェント固有の最適化これは、長時間実行されるマルチエージェントタスク向けに特別に訓練されており、精度と推論速度の優れたバランスを実現しています。
Nemotron 3.5 Lightningプロジェクトのアドレス
- プロジェクト公式サイト:https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/
- ハギングフェイスモデルライブラリ:https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
ネモトロン3.5ライトニング vs. 競合製品
| 比較対象寸法 | Nemotron 3.5 Lightning | Qwen3.6-35B-A3B |
|---|---|---|
| 出版社 | NVIDIA | アリ・トンイの1000の質問 |
| パラメータの総数 | 30B | 35B |
| 活性化パラメータ量 | 約3B(30B~A3B) | 3B |
| 建築 | MoE(ハイブリッド専門家) | MoE(ハイブリッド専門家) |
| コンテキストの長さ | 明示的に言及されていない | 200K |
| オープンソースライセンス | 完全オープンソース | Apache 2.0(商用利用可能) |
| 推論速度 | 出力速度が4倍になり、タスク完了速度が30%向上した。 | 効率的な推論能力、具体的な数値は非公開。 |
| プログラミングスキル | 具体的なベンチマークは指定されなかった。 | SWE-bench Verified 73.4,Terminal-Bench 2.0 51.5 |
| マルチモーダルサポート | 不明 | ネイティブサポートに対応しており、視覚的な機能はClaude Sonnet 4.5と同等です。 |
| 推論パターン | 不明 | 思考モードと非思考モードの柔軟な切り替えをサポートします。 |
Nemotron 3.5 Lightningの応用事例
- マルチエージェント協調システム専用のタスクモデルとして、複雑なエージェントワークフローを推進し、ツール呼び出し、タスク分解、および長鎖推論を効率的に完了します。
- ローカルエッジAI推論NVFP4の量子化とスパース活性化メカニズムを活用することで、RTX PCおよびJetsonデバイス上で低遅延かつ低消費電力のローカル推論を実現します。
- エンタープライズレベルのインテリジェントエージェントプラットフォームデータセンターやクラウドへシームレスに拡張し、高頻度かつ長期的なエンタープライズレベルのインテリジェントエージェントサービスと自動化プロセスをサポートします。
- コード開発とDevOpsの自動化これにより、コードの迅速な生成、レビュー、デバッグが可能になり、ソフトウェア開発および継続的インテグレーションにおけるエージェントタスクの実行が加速されます。
- リアルタイムデータ分析と意思決定支援迅速な対応が求められるビジネスシーンにおいて、高速かつ正確な推論結果を提供し、リアルタイムの意思決定を支援します。