project
Nanbeige4.2-3B - Nanbeige Labsがリリースした汎用エージェントミニモデル
Nanbeige4.2-3Bは、BOSS ZhipinのNanbeige Labが開発した汎用エージェントモデルです。パラメータ数はわずか30億個ながら、コードベースのインテリジェントエージェント、オフィスワークフロー、複雑なツール呼び出しといったエージェントタスクにおいて、Qwen3.5-9BやGemma4-12Bを凌駕する性能を発揮します。
Nanbeige4.2-3Bとは何ですか?
Nanbeige4.2-3Bは、BOSS ZhipinのNanbeige Labが開発した汎用エージェントモデルです。パラメータ数はわずか30億個ながら、コードインテリジェンス、オフィスワークフロー、複雑なツール呼び出しといったエージェントタスクにおいて、Qwen3.5-9BやGemma4-12Bといった大規模モデルを凌駕する性能を発揮します。このモデルは、ループ型トランスフォーマーアーキテクチャを採用することで実効容量を向上させ、コード、ツール、オフィスデータの3種類のエージェントデータに対して閉ループ合成パイプラインを構築しています。3段階のSFTトレーニングと多段階のRLトレーニングにより、推論コストを削減しながらも高いエージェント能力を維持します。オープンソースであり、様々な推論エンジンとの互換性があります。
Nanbeige4.2-3Bの主な機能
-
コードベースのインテリジェントエージェント実際のコードリポジトリにおける閲覧、問題点の特定、修正、検証の実行をサポートし、ソフトウェアエンジニアリングプロセス全体を網羅しています。
-
オフィスインテリジェントエージェントこのモデルは、文書、表、スライド、PDFなどの様々な形式のファイルを処理でき、複数のファイル間の依存関係や、長時間のオフィスワークフローにも対応しています。
-
複雑なツール呼び出しMCPオンラインサービス、ローカルPythonツール、および仮想ツールにおける、連鎖呼び出しとパラメータ推論をサポートします。
-
一般的な推論数学、プログラミング、科学的推論を網羅し、GPQA DiamondやHMMTなどのベンチマークにおいて最高レベルの結果を達成しています。
-
現地パーソナルアシスタント複数ラウンドの計画立案、文書処理、エラー回復機能を備えており、導入障壁の低いローカルエージェントアシスタントとして展開可能です。
Nanbeige4.2-3Bの技術原理
-
ループ型トランスフォーマーアーキテクチャモデルの隠れ状態は、すべてのTransformer層を通過した後、同じ層群にフィードバックされ、2回目の計算が行われます。これにより、パラメータ数を増やすことなく、実効的な計算深度が増加します。2回のループがパフォーマンスと安定性の最適なバランスであることが検証されており、KVキャッシュは共有されないため、パフォーマンスが優先されます。
-
事前学習データのアップサンプリングコーパスは23Tトークンから28Tトークンに拡張され、数学、コード、合成QAデータに対して積極的なアップサンプリングが適用された結果、この小型モデルは推論と知識評価において、同規模のベースを総合的に凌駕する性能を発揮することができた。
-
エージェントデータ閉ループ合成コードベースのインテリジェントエージェントについては、「トレーニング-失敗分析-データ補完」というフライホイールを構築します。ツール呼び出しについては、モデルの能力に合わせて難易度が変化する、実環境MCP、ローカルPython、仮想ツールの3種類の環境を設計します。オフィスベースのインテリジェントエージェントについては、マテリアルクラスタリング、タスク生成、出力リサイクルの閉ループフィードバックシステムを構築します。
-
3段階コースSFTエージェントデータの割合は、64Kから128K、そして256Kへと段階的に増加します。エラーラウンドには、エラーコンテキストを保持しつつエラーアクションを学習しないように、損失マスクを設定します。これにより、モデルは実際のエラー履歴に基づいてタスクを修正することを学習できます。
-
多段階RLレシピまず、生成データの品質を安定させるために、2段階の思考型/非思考型RLHFプロセスが用いられます。次に、単純な問題における無効なトークンを削減するために、長さ制御付き推論型強化学習が実行されます。最後に、結果報酬と行動中心型ルーブリックを組み合わせたエージェント型強化学習が実行されます。安定性を向上させるため、学習経路が短く、成功率の高いタスクがトレーニング対象として選択されます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Nanbeige 4.2-3B の使い方
- モデルの重みを取得するHugging Faceから、エージェントモデル(Nanbeige4.2-3B)またはベースモデル(Nanbeige4.2-3B-Base)のウェイトファイルをダウンロードしてください。
- 推論エンジンを選択Transformers、SGLang、vLLM、llama.cpp、Ollamなどの適応型エンジンを使用してモデルをロードします。3Bパラメータはハードウェア要件が低く、ローカルPCやエッジデバイスへの展開に適しています。
- 推論モードを切り替えるこのシステムでは、タスクの複雑さに応じて、深い思考を行うための思考モード(Think)と、迅速な対応のための非思考モード(Non-Think)を選択できます。2つのモードは柔軟に切り替えることが可能です。
- アクセスエージェントフレームワークモデルをOpenClawなどのエージェントフレームワークに接続し、外部ツールやScaffoldを設定することで、複数ステップのコード作成、オフィス業務、または研究タスクを実行できます。
Nanbeige4.2-3Bの主な利点
-
小さなパラメータで、大きな可能性を秘める3Bパラメータは、エージェントタスクにおいて9B/12Bレベルのモデルを常に上回り、高頻度呼び出しシナリオにおける推論コストを大幅に削減します。
-
建築革新ループ型トランスフォーマーを使用して固定パラメータ下で実効容量を最大化することで、標準トランスフォーマーと比較してトークン効率が約75%向上します。
-
データフライホイールこれら3種類のエージェントデータはすべて、閉ループフィードバックと難易度進化のメカニズムを構築し、トレーニングデータは停滞するのではなく、モデルの能力と同期して向上する。
-
トレーニング精度SFTエラーマスクはエラーのコンテキストを保持するが、エラーアクションは学習しない。一方、RLマルチステージレシピは、精度向上と出力長の短縮のバランスを取る。
-
導入障壁が低い主流の推論エンジンとの互換性があり、Think/Non-Thinkのデュアルモードをサポートしているため、ローカル展開やコスト重視のシナリオに適しています。
ナンベイゲ4.2-3Bのプロジェクト住所
- ハギングフェイスモデルライブラリ:
- https://huggingface.co/Nanbeige/Nanbeige4.2-3B
- https://huggingface.co/Nanbeige/Nanbeige4.2-3B-Base
- 技術論文:https://huggingface.co/Nanbeige/Nanbeige4.2-3B/blob/main/Nanbeige42_report.pdf
Nanbeige4.2-3Bと類似競合製品との比較
| 比較対象寸法 | Nanbeige4.2-3B | Qwen3.5-4B |
|---|---|---|
| 非埋め込みパラメータ数 | 3B | 4B |
| General Agent(PinchBench-V2) | 74.7 | 63.9 |
| Code Agent(SWE-Bench Verified) | 63.6 | 38.8 |
| オフィス業務(GDP値) | 68.8 | 37.0 |
| 推論能力(GPQA) | 53.3 | 43.1 |
| 建築上の特徴 | Looped Transformer | 標準トランス |
| 展開しきい値 | 低価格、複数のエンジンに対応 | 標準展開 |
Nanbeige4.2-3Bの応用事例
-
ローカルコード開発開発者のローカル環境において、コードリポジトリの閲覧、バグの修正、パッチの検証といったソフトウェアエンジニアリング業務を実行する。
-
オフィスワークフローの自動化異なる形式の文書、表、スライドを自動的に処理し、データの整理、レポートの生成、形式変換を完了します。
-
インテリジェントツールオーケストレーションサービスこれはMCPプロトコルを使用してオンラインサービスやローカルツールを呼び出し、情報検索、データ分析、および複数ステップのタスクオーケストレーションを実現します。
-
エッジデバイスパーソナルアシスタントPCやNASなどのローカルデバイスに展開することで、低遅延でプライバシーが保護された汎用エージェントアシスタントとして機能します。
-
高周波エージェントシステムコアエンジンこれは、数十回から数百回のモデル呼び出しを必要とする複雑なエージェントシステムにおける大規模モデルを置き換えることができ、運用コストを大幅に削減します。