AB
AiBoss
project

Pangu大型モデル5.5 - ファーウェイの新世代AI大型モデル

Pangu Model 5.5は、ファーウェイの最新世代の大規模人工知能モデルであり、同社の開発者会議(HDC 2025)で発表されました。このモデルは「詩作ではなく、行動する」ことを重視し、現実世界の産業課題の解決と、様々な産業のインテリジェント化の推進に焦点を当てています。

Pangu Large Model 5.5とは何ですか?

Pangu Big Model 5.5は、ファーウェイの最新世代の大規模人工知能モデルであり、同社の開発者会議(HDC 2025)で発表されました。このモデルは「詩作ではなく、行動する」ことを重視し、現実世界の産業課題の解決と、様々な産業のインテリジェント化の推進に焦点を当てています。Pangu Big Model 5.5は、自然言語処理(NLP)、マルチモーダルコンピューティング、予測、科学計算、コンピュータビジョン(CV)の分野をそれぞれ対象とする5つの基本モデルで構成されています。

Pangu Ultra MoEは、Ascendのフルスタックハードウェアおよびソフトウェアプラットフォーム上に構築された、7180億パラメータの深層思考モデルであり、効率的な長系列処理、低錯覚、深層研究などのコア機能を備えています。Pangu Pro MoEは、エージェントタスクで非常に優れたパフォーマンスを発揮する720億パラメータのA16Bモデルであり、6710億パラメータのDeepSeek-R1に匹敵します。Pangu Large Model 5.5は、適応型高速思考と低速思考の融合技術を導入して推論効率を向上させ、マルチモーダルワールドモデルを通じて自律走行や具現化されたインテリジェントロボットのトレーニングをサポートします。

Pangu大型モデル5.5の主な特徴

  • 自然言語処理(NLP)
    • 高効率長系列処理Adaptive SWAおよびESA技術により、100万トークンの長さのコンテキストも容易に処理できます。
    • 軽度の幻覚モデル推論の精度を向上させるために、知識境界の決定や構造化思考の検証といった革新的なアプローチが採用されている。
    • 速い思考と遅い思考の融合適応型高速思考・低速思考技術は、問題の難易度に応じて思考モードを自動的に切り替え、簡単な問題には迅速な回答を、複雑な問題には深い思考を提供することで、推論効率を8倍向上させます。
    • 詳細な調査能力Pangu DeepDiverは、長連鎖パズル合成と段階的報酬メカニズムにより、ウェブ検索や常識的な質疑応答などのアプリケーションで優れた性能を発揮します。5分以内に10ホップ以上の複雑な質疑応答を完了し、1万語を超える専門的な調査レポートを生成することができます。
  • マルチモーダル
    • ワールドモデルこの技術は、インテリジェントドライビングや有人インテリジェントロボットのトレーニングのためのデジタル・フィジカル空間を構築し、継続的な最適化と反復を可能にします。例えば、インテリジェントドライビングの分野では、高額な道路調査に頼ることなく、大量のトレーニングデータを生成できます。
  • 予測する
    • トリプレットトランスフォーマーアーキテクチャこの手法は、異なる業界のデータに対してトリプルエンコーディングと事前学習を統合することで、業界やシナリオを超えた予測精度と汎化性能を向上させる。
  • 科学計算
    • AIアンサンブル予測例えば、深圳市気象局の「智集」ビッグモデルは、盤古ビッグモデルを改良したもので、初めてAIアンサンブル予測を実現し、気象システムの進化の可能性をより直感的に反映できるようになった。
  • コンピュータビジョン(CV)
    • 300億パラメータのビジュアル大規模モデルこれは、多次元的な汎用視覚認識、分析、意思決定をサポートし、産業シナリオでは不足している汎用視覚障害サンプルライブラリを構築し、ビジネスシナリオの識別可能なタイプと精度を向上させます。

Pangu大型モデル5.5モデルの紹介

  • Pangu Ultra MoE
    • 超大規模かつ疎な活性化7180億個のパラメータを持ち、256個のルーティングエキスパートを使用し、トークンごとに8個のエキスパートをアクティブ化し、39億個のアクティブボリュームを持ち、超大規模かつ高スパース性を特徴としています。
    • 高度な建築設計本システムは、推論フェーズにおけるKVキャッシュ空間の効率的な圧縮とメモリ帯域幅のボトルネック緩和のために、MLA(マルチヘッド潜在注意)メカニズムを導入しています。同時に、MTP(マルチトークン並列処理)マルチヘッド拡張を採用し、シングルヘッドMTPトレーニングからマルチヘッド構造へと拡張することで、マルチトークンの投機的推論を実現し、推論プロセス全体を高速化しています。
    • 安定したトレーニング方法我々は、深度スケーリングサンドイッチノルム(DSSN)安定アーキテクチャとTinyInit小規模初期化手法を提案し、超大規模MoEモデルのトレーニングプロセスにおける安定性の問題を解決し、18TBを超えるデータに対して長期にわたる安定したトレーニングを実現した。
    • 高効率負荷最適化EPグループ損失負荷最適化手法を採用することで、専門家間の負荷バランスを良好に保ちつつ、各専門家の専門分野における能力を向上させる。
    • トレーニング戦略の最適化ドロップレス学習戦略は、ドロップ学習とパッド学習および推論間の不整合を回避するために用いられ、学習データの効率性を向上させます。さらに、GRPOアルゴリズムを参考に、反復的なハードサンプルマイニングと多能力バランス報酬関数を採用することで、モデルの学習効率と最終的な推論性能を向上させています。
  • Pangu Pro MoE
    • グループ化されたハイブリッドエキスパートアーキテクチャ革新的なMoGE(Modulated Grouped Expert Model)モデルを提案する。専門家は専門家選定段階でグループ化され、トークンは各グループ内で同数の専門家をアクティブ化するように制約される。これにより、専門家の負荷分散が実現され、Ascendプラットフォーム上でのモデルの展開効率が大幅に向上する。
    • 高性能推論Ascend 300I Duoプラットフォームでは、シングルカードのスループットは201トークン/秒に達し、MTPデコードとマルチトークン最適化を導入することで321トークン/秒まで向上させることができます。Ascend 800I A2プラットフォームでは、低同時接続シナリオでミリ秒レベルの応答を実現でき、高同時接続条件下ではシングルカードのスループットが1148トークン/秒に達し、最適化後には1528トークン/秒まで向上させることができ、同規模の高密度モデルを大幅に上回ります。
    • 優れた推論能力本モデルは、言語間および複数領域にわたるベンチマークテストにおいて優れた性能を発揮し、一般的な英語の推論、読解、常識的な推論、コード生成、論理的推論における二言語(中国語と英語)の数学問題、さらに中国語における知識ベースの質問応答および読解を網羅しており、複雑な認知タスクにおけるモデルの汎用性と領域適応性を包括的に検証しています。
    • ハードウェア親和性最適化システム最適化は、Ascend 300I Duoおよび800I A2プラットフォーム上で実行され、Ascendハードウェアアクセラレーションアーキテクチャの並列コンピューティング特性とオペレータレベルのコンパイル最適化技術を深く統合することで、アルゴリズム設計からシステム展開まで、フルスタックのイノベーションを実現します。
  • Pangu埋め込み
    • 速い思考と遅い思考の融合本システムは、デュアルシステム認知アーキテクチャを採用し、「高速思考」と「低速思考」という2つの推論モードを統合しています。2段階のトレーニングフレームワークを通して、第1段階では反復蒸留とマルチソース動的報酬システム(MARS)によって基本的な推論エンジンを構築し、第2段階では高速思考と低速思考の能力をモデルに付与し、タスクの難易度に応じてモードを自動的に切り替えることで、推論効率と深度の間の動的なバランスを実現します。
    • 高効率トレーニング戦略本稿では、モデル認識型反復蒸留に基づくSFTスキームを提案する。このスキームは、トレーニングのためにモデルの現在の能力に合致するデータサンプルを動的に選択し、トレーニングプロセス中にモデル統合戦略を通じて初期の知識を保持することで、パフォーマンスを継続的に向上させる。
    • 業界における垂直統合能力の拡大特定の分野における長期的な思考データを取り入れてさらに学習させることで、モデルの専門的なタスクにおける能力を大幅に向上させることができます。例えば、法律分野では、法律コーパスを用いた学習後、LawBenchベンチマークテストにおける平均精度は54.59%に達しました。
    • 適応型モード切り替えこのモデルは、タスクの複雑さに基づいて推論深度を自動的に調整できます。簡単な質問には迅速に回答を出力し、複雑な質問には詳細な分析を実行して出力の精度を確保します。
  • パング・ディープダイバー
    • 複雑なタスク処理科学アシスタント、個別教育、複雑な業界レポート調査といった詳細な調査シナリオにおいては、10回以上の複雑な質疑応答セッションを完了し、1万語を超える専門的な調査レポートを作成することができます。
    • 効率的な情報収集大量の合成インタラクティブデータを構築し、強化学習トレーニングに段階的な報酬戦略を用いることで、オープン領域における情報収集において優れた性能を発揮し、複雑なタスクを完了させ、質の高い研究レポートを5分以内に生成することができる。
    • 高度な能力の向上これにより、Panguビッグモデルの自律的な計画、探索、反省といった高次の能力が大幅に向上し、複雑なタスクの処理能力が向上します。
  • Pangu予測モデル本システムは、業界初のトリプレット変換統合事前学習アーキテクチャを採用しており、異なる業界のデータを統一的な方法でトリプレットにエンコードし、同一のフレームワーク内で効率的に処理および事前学習を行うことで、大規模予測モデルの精度と、業界やシナリオを超えた汎化性能を向上させます。
  • Pangu科学計算モデルファーウェイクラウドは、Pangu科学計算ビッグデータモデルとより多くの科学応用分野との統合を継続的に拡大しています。例えば、深圳市気象局はPanguをベースとした「Zhiji」ビッグデータモデルをさらにアップグレードし、AIアンサンブル予測を初めて実現しました。これにより、気象システムの進化の可能性をより直感的に反映し、単一予測モデルの誤差を低減することが可能になります。
  • Panguコンピュータビジョン(CV)大規模モデルファーウェイクラウドは、300億個のパラメータを持つ新しいMoEアーキテクチャベースのビジュアルモデルを発表しました。これは現在、業界最大規模のビジュアルモデルです。画像、赤外線、レーザー点群、スペクトル、レーダーデータなど、多次元かつ汎用的な視覚認識、分析、意思決定を完全にサポートします。次元を横断するモデルを生成することで、石油・ガス、輸送、石炭採掘などの産業シナリオ向けに、他に類を見ない汎用的なビジュアル障害サンプルライブラリを構築し、ビジネスシナリオにおける障害の種類と精度を向上させます。
  • Panguマルチモーダル大型モデルPanguマルチモーダルモデルに基づいた全く新しい世界モデルが発表されました。このモデルは、インテリジェントドライビングや具現化されたインテリジェントロボットのトレーニングに必要なデジタル物理空間を構築し、継続的な最適化と反復を実現できます。

Pangu Large Model 5.5 のプロジェクトアドレス

  • Pangu Ultra MoE技術論文:https://arxiv.org/pdf/2505.04519
    Pangu Pro MoEプロジェクトのアドレス:https://gitcode.com/ascend-tribe/pangu-pro-moe
    Pangu埋め込みに関する技術論文:https://arxiv.org/pdf/2505.22375
    Pangu DeepDiver 技術文書: https://arxiv.org/pdf/2505.24332

Pangu大型モデル5.5の応用事例

  • インテリジェントドライビングPanguのマルチモーダル大規模モデルは、高額な道路調査に頼ることなく、インテリジェントドライビングのための大量のトレーニングデータを生成できる。
  • エンボス加工されたインテリジェントロボットPanguの世界モデルは、具現化された知能ロボットの訓練に必要なデジタル物理空間を構築することができ、継続的な最適化と反復を可能にする。
  • 天気予報深セン気象局の「智集」ビッグモデルは、盤古科学計算ビッグモデルを改良したもので、初めてAIアンサンブル予測を実現し、気象システムの変化をより直感的に反映し、単一予測モデルの誤差を低減できるようになった。
  • 工業風景Pangu CVの大規模モデルは、複数の次元にわたるモデルを生成し、石油・ガス、輸送、石炭採掘などの産業シナリオ向けに、他に類を見ない汎用的な視覚的障害サンプルライブラリを構築します。これにより、ビジネスシナリオの識別可能なタイプと精度が大幅に向上します。