project
ZCube - Zhipu AIと清華大学が共同で立ち上げた次世代大規模モデル推論ネットワークアーキテクチャ
ZCubeは、Zhipu AI、Yuhun Networks、および清華大学が共同開発した次世代大規模モデル推論ネットワークアーキテクチャです。特に、個別のPD(電力供給)展開における構造的なネットワーク輻輳を解決するために設計されています。このアーキテクチャは、従来のスパイン層スイッチを排除し、完全にフラットなネットワーク構造を採用しています。
ZCubeとは何ですか?
ZCubeは、Zhipu AI、Yuhun Networks、および清華大学が共同開発した次世代大規模モデル推論ネットワークアーキテクチャです。特に、個別のPD展開における構造的なネットワーク輻輳を解決するために設計されています。このアーキテクチャは、従来のSpineレイヤスイッチを排除し、ネットワーク全体にフラットなトポロジーとシングル/マルチトラックのハイブリッドアクセスメカニズムを採用することで、グローバルなトラフィック分離と離散ルーティングを実現します。GLM-5.1コーディングを用いた実稼働環境でのテストでは、ZCubeは同じGPUとソフトウェアスタックを維持しながら、スイッチと光モジュールの設備投資を33%削減し、平均GPU推論スループットを15%向上させ、TTFT P99を40.6%短縮しました。
ZCubeの主な機能
-
スパイン層を除去したフラットネットワークClosアーキテクチャの従来の階層的なスタッキング方式から脱却し、リーフスイッチ層を維持し、完全な二部グラフを介して相互接続することで、ネットワークの直径を3ホップから2ホップに圧縮しています。
-
シングル/マルチトラックハイブリッドアクセス機構一方のリーフスイッチ群は、連続するラベルを持つGPUをシングルトラック方式で接続し、もう一方のリーフスイッチ群は同じラベルを持つGPUをマルチトラック方式で接続することで、PD分離によって発生する動的な非対称トラフィックを自然に離散化します。
-
グローバルロードバランシングルーティングZCubeルーティング戦略は、任意の2つのGPUペア間に最適なパスが1つだけ存在することを保証し、マルチパスルーティングによって引き起こされるトラフィックの競合を回避し、トレーニングと推論の両方のシナリオにおいてネットワーク全体で理想的な負荷分散を実現します。
-
構造的混雑の解消アーキテクチャ層を革新することで、KVキャッシュのノード間伝送トラフィックはグローバルに分離され、離散化され、ローカルホットスポットリンクとPFCバックプレッシャーが根本的に排除されます。
ZCubeの技術原則
-
完全な二部グラフトポロジーリーフスイッチは、パリティに基づいて2つのグループに分けられます。同一グループ内のスイッチは相互に接続されていませんが、インターグループ内の各スイッチは、他のグループのすべてのスイッチと完全に接続され、フラットなネットワークを形成します。
-
デュアルポート差別化アクセス各GPUネットワークカードには、それぞれシングルトラック(奇数番号のスイッチに接続)とマルチトラック(偶数番号のスイッチに接続)の方式で接続された2つのポートがあり、数学的なマッピング式を使用して決定論的なルーティングを実現しています。
-
決定論的最短経路ルーティングモジュール式の動作とGPU IDとスイッチ ID間の切り上げマッピングに基づいて、2つのリーフスイッチを経由する任意の2つのGPU間の最適なパスが1つだけ存在することが保証されます。
-
交通パターンの適応PD分離によって引き起こされる送信元と宛先の非対称性および動的に変化するKVキャッシュ伝送特性に対処するため、トポロジー構造自体が、適応ルーティングやパケットスプレーなどのトランスポート層メカニズムに頼ることなく、自然なトラフィック分散を実現します。
ZCubeの使い方
- 建築計画リーフスイッチはパリティ番号に応じて2つのグループに分けられ、従来のスパイン層を排除した完全な二部構成の相互接続トポロジーが設計されている。
- ポートアクセス設定各GPUネットワークカードのデュアルポートに対して、シングルトラックおよびマルチトラックのハイブリッドアクセスポリシーを設定し、それぞれを対応する奇数/偶数スイッチに接続します。
- 自動展開ZCubeコントローラ、データセンターレイアウト設計ツール、および接続正当性検出プログラムを使用することで、構成が自動的に生成され、バッチ処理で配布されます。
- 生産検証推論サービスが稼働する前に、帯域幅、遅延、およびPFCイベントが監視され、構造的な輻輳ホットスポットがないことを確認した後、正式にフローが切り替えられます。
ZCubeの主な利点
-
コストが大幅に削減されましたClos/ROFTと比較すると、Wankaスマートコンピューティングクラスターは、同規模のスイッチと光モジュールへの投資を約33%削減し、ネットワークハードウェアへの投資を約2億1000万元から6億4000万元節約できる。
-
推論性能の向上GLM-5.1コーディングを用いた実運用テストでは、GPU推論スループットの平均値が15%以上向上し、TTFTのP99パーセンタイル値が40.6%低下しました。
-
優れた拡張性既存の51.2Tスイッチをベースに、16,384枚の400Gbpsネットワークカードを接続するフラットネットワークを構築でき、マルチプレーンパーティショニングにより、数万から数十万のGPU相互接続をサポートできます。
-
侵入を伴わないアップグレードGPUのハードウェア、ソフトウェアスタック、またはアプリケーションロジックを変更することなく、ネットワークアーキテクチャ層を最適化するだけで、既存のハードウェアの潜在能力を引き出すことができる。
ZCubeのプロジェクトアドレス
- プロジェクト公式サイト:https://z.ai/blog/zcube
ZCubeの競合製品比較
| 比較対象寸法 | ZCube | ROFT(Rail-Optimized Fat-Tree) |
|---|---|---|
| ネットワークアーキテクチャ | 二部グラフを平坦化し、Spine層を削除します。 | 背表紙層を残したまま、ファットツリーを2層重ねる |
| ネットワーク直径 | 2回のジャンプ | 3回のジャンプ |
| ロードバランシング | グローバルな理想均衡、衝突のない単一の道 | 静的なレールマッピングは、推論シナリオにおいて不均衡が生じやすい。 |
| 交通渋滞対策 | 建築レベルでの構造的な混雑を解消する | 局所的なホットスポットやPFCの逆圧が発生しやすい。 |
| ハードウェアコスト | スイッチと光モジュールを33%削減する | 標準閉鎖コスト |
| 推論スループット | 15%増加 | ベンチマーク |
| TTFT P99 | 40.6%削減 | ベンチマーク |
| スケーリング | 数万から数十万個のGPU | 脊椎層の容量によって制限される |
ZCubeアプリケーションシナリオ
-
超大規模LLM推論クラスタこれは、PDを別々に展開する1,000~10,000枚のカードからなる推論クラスタに適しており、KVキャッシュのノード間伝送によって引き起こされるネットワークボトルネックを解消します。
-
長文コンテキスト推論サービスこのアーキテクチャは、長いシーケンスのシナリオにおいて、最初のトークンの遅延と全体のスループットに対するネットワーク帯域幅の制約を効果的に緩和することができる。
-
高密度インテリジェントコンピューティングセンターこれは、トレーニングと推論の混合ワークロードに対応する、非常にバランスの取れた、低遅延で、高帯域幅利用率のネットワーク基盤を提供する。
-
MaaSクラウドサービスプラットフォームこのアーキテクチャは、推論サービスの全体的なコストを削減し、マルチテナントの高同時実行シナリオにおけるテールレイテンシの安定性を向上させることができます。