AB
AiBoss
project

ステップ3 - Leap Starの最新マルチモーダル推論モデル

Step 3は、StepStarがリリースした最新世代の基盤となる大規模モデルであり、推論時代向けに特別に設計され、高いパフォーマンスと極めて高いコスト効率を両立させています。MoEアーキテクチャを採用し、合計321Bのパラメータと38Bの活性化パラメータを誇り、初の…

ステップ3とは何ですか?

Step 3は、StepStarの最新世代の基盤となる大規模モデルであり、推論時代向けに特別に設計され、高いパフォーマンスと極めて高いコスト効率を両立させています。MoEアーキテクチャを採用し、総パラメータ数321B、活性化パラメータ数38Bを誇る、初のフルサイズネイティブマルチモーダル推論モデルです。強力な視覚認識能力と複雑な推論能力を備え、複数のドメインにわたる効率的なアプリケーションを実現します。AFD分散推論システムとMFAアテンションメカニズムにより、推論効率が大幅に向上しています。国産チップでは、類似モデルの3倍の推論効率を実現し、NVIDIA Hopperアーキテクチャチップでは、スループットが70%以上向上し、推論コストを大幅に削減します。Step 3は7月31日に正式にオープンソース化され、世界中の開発者や企業に最も強力なマルチモーダル推論モデルを提供します。

ステップ3の主な機能

  • 視覚ステップ3では、画像や動画内の複雑な情報を正確に識別・分析することができ、例えば、強い光の反射がある状況でもメニュー認識においてコンテンツを正確に再構築することが可能です。
  • 複雑な推論これは、分野横断的な複雑な知識の理解や、数学的情報と視覚的情報の相互分析をサポートします。例えば、WeChatグループチャットの記録と買い物レシートを組み合わせることで、割り勘費用の負担額を自動的に計算することができます。
  • マルチモーダルタスク処理Step 3はネイティブなマルチモーダルモデルとして、言語や視覚など複数のモダリティのタスクを処理でき、多様なアプリケーションシナリオのニーズに対応します。
  • 効率的な推論Step 3は、システムアーキテクチャの革新により、卓越した推論効率を実現しています。国産チップ上では、DeepSeek-R1と同等の推論効率を達成しています。 300%NVIDIA Hopperアーキテクチャチップでスループットが[パーセント欠落]以上向上 70%
  • ハードウェアに優しいステップ3:主流チップや国産チップを含む複数のハードウェアプラットフォームに対応し、推論コストを大幅に削減し、リソース利用率を向上させることができます。

ステップ3の技術的原理

  • 教育省建築ステップ3では、モデル並列化のための非常に効率的な手法であるMoE(Mixture of Experts)アーキテクチャを採用しています。MoEアーキテクチャは、モデルを複数の「エキスパート」モジュールに分解し、入力に基づいて計算に適したエキスパートを動的に選択することで、高いパフォーマンスを維持しながら計算リソースの無駄を大幅に削減できます。
  • AFD分散推論システムモデル内のアテンション機構とフィードフォワードネットワーク(FFN)の計算タスクを最適なハードウェアに分散させることで、全体的な効率を向上させる。
    • 注意計算大量のメモリ帯域幅を消費するタスクは、メモリ帯域幅の高いGPUクラスタに割り当てるべきである。
    • FFN計算極めて高い計算能力を必要とするタスクは、高性能GPUクラスタに割り当てられる。
  • MFAの注意メカニズム演算能力を最適化し、主流および国内チップの性能特性に適応させ、ハードウェアプラットフォーム間で効率的な推論を実現する。

ステップ3 プロジェクトアドレス

  • GitHubリポジトリ:https://github.com/stepfun-ai/Step3

ステップ3の適用シナリオ

  • スマートターミナルエージェントステップ3は、スマートホーム機器やスマートウェアラブル機器など、さまざまなIoTデバイスに適用でき、インテリジェントな音声アシスタント機能や画像認識機能を提供します。
  • 金融と経済ステップ3は、金融リスク評価、インテリジェントな顧客サービス、市場分析などのシナリオで使用できます。マルチモーダルデータ処理により、モデルは市場動向とユーザーニーズをより正確に分析できます。
  • コンテンツ作成ステップ3は、コンテンツ制作者がクリエイティブなコピー、画像、動画コンテンツを作成する際に役立ちます。例えば、視覚情報とテキスト情報を組み合わせて、高品質な広告コピーや動画スクリプトを作成することができます。
  • 視覚認識ステップ3では、反射型メニューの認識、画像分類、物体検出といった複雑な視覚タスクを処理できます。
  • 複雑な推論ステップ3では、WeChatグループチャットの記録と買い物レシートを組み合わせることで、分割払いの費用分担額を自動的に計算するなど、さまざまな分野にわたる複雑な知識の理解をサポートします。
  • 自然言語処理ステップ3:自然言語処理タスクにおいて優れた性能を発揮し、高品質なテキストコンテンツを理解および生成できる。