project
Step 3.5 Flash - Step Star社による最新のオープンソースベースモデル。
Step 3.5 Flashは、StepStarが提供する最新のオープンソース基盤モデルであり、エージェントシナリオ向けに特別に設計されています。このモデルは、合計1960億個のパラメータを持つ疎なMoEアーキテクチャを採用しており、各トークンがアクティブ化するパラメータはわずか110億個であるため、パフォーマンスと効率のバランスが取れています。
ステップ3.5 Flashとは何ですか?
Step 3.5 Flashは、StepStarの最新のオープンソース基盤モデルであり、エージェントシナリオ向けに特別に設計されています。このモデルは、合計1960億個のパラメータを持つ疎なMoEアーキテクチャを採用し、トークンごとに110億個のパラメータのみをアクティブ化することで、パフォーマンスと効率のバランスを取っています。Step 3.5 Flashは、最大350 TPSの推論速度を誇り、256Kの長いコンテキストをサポートし、数学的推論、コード生成(SWE-bench 74.4%)、およびエージェントタスクにおいて、トップレベルのクローズドソースモデルに匹敵します。Step 3.5 Flashはオープンソースであり、vLLM、SGLang、llama.cppなどのフレームワークをサポートしているため、Mac Studio M4 MaxやNVIDIA DGX Sparkなどのコンシューマーグレードのハードウェア上でローカル展開が可能になり、データプライバシーと高性能のバランスを実現しています。
ステップ3.5 フラッシュの主な機能
-
高速推論このモデルはMTP-3技術により最大350 TPSの生成速度を実現し、複雑な多段階推論に対するリアルタイム応答をサポートします。
-
エージェントの機能このモデルはエージェントタスク専用に設計されており、SWE-bench Verifiedで74.4%の精度を達成し、一連の操作が長い複雑なタスクにも対応できます。
-
高効率長文テキスト256Kのコンテキストウィンドウをサポートし、ハイブリッドアテンションメカニズムを採用することで、長文テキストの計算負荷を軽減します。
-
ローカル展開コンシューマー向けハードウェアのサポートに最適化されており、Mac Studio M4 MaxやNVIDIA DGX Sparkなどのデバイスでスムーズに動作します。
-
コード生成このモデルは強力なプログラミング機能を備えており、ツールの自動呼び出しや構造化推論の出力に対応しています。
ステップ3.5 Flashの技術的原理
- スパースMoEアーキテクチャこのモデルは45層のTransformerバックボーンネットワークを採用しており、各層は288個のきめ細かいルーティングエキスパートと1個の共有エキスパートで構成されています。推論時には上位8個のエキスパートのみがアクティブ化され、トークンあたり約110億個のパラメータが実際に計算されます。これにより、モデルの総パラメータ数1960億個と小規模モデルの推論コストとのバランスが実現されます。
- MTP-3 マルチトークン予測スライディングウィンドウアテンション機構と密なフィードフォワードネットワークで構成された専用の予測ヘッドを採用することで、1回の順伝播中に4つのトークンが並列に生成されます。これにより、一般的なシナリオにおける生成速度は100~300トークン/秒に向上し、ピーク時には350トークン/秒に達し、デコード遅延が大幅に短縮されます。
- ハイブリッド注意機構このアーキテクチャは、3:1の比率で交互に動作するスライディングウィンドウ型アテンション層とグローバルアテンション層を採用しています。スライディングウィンドウ層はローカルなコンテキストに焦点を当て、グローバル層は長距離の依存関係を捉えることで、計算の複雑さを効果的に制御し、256Kの長文テキストを扱うシナリオにおいて効率性とパフォーマンスのバランスを取ります。
- 推論最適化戦略このモデルは、エキスパート並列処理(EP8)とテンソル並列処理(TP8)を組み合わせた展開をサポートしており、FP8量子化によってメモリ帯域幅の負荷を軽減します。投機的デコードとMTP連携により、Hopper GPU上で効率的なサービス指向の展開を実現します。
ステップ3.5 フラッシュプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/stepfun-ai/Step-3.5-Flash/
- ハギングフェイスモデルライブラリ:https://huggingface.co/stepfun-ai/Step-3.5-Flash
ステップ3.5 Flashの応用シナリオ
- インテリジェントプログラミング開発Claude CodeやCodexなどのツールの基盤となるモデルとして、コード生成、自動デバッグ、ソフトウェアエンジニアリングタスク処理などの機能を提供し、SWE-bench Verifiedで74.4%の合格率を達成しています。
- 自律エージェントの実行これは、詳細な調査、ウェブ情報の検索、クロスプラットフォームのデータ比較など、長大な推論を必要とするエージェントシナリオに適しています。
- リアルタイム対話100~350 TPSの生成速度により、低遅延チャットボット、オンライン教育・個別指導、インテリジェントな顧客サービスなど、リアルタイム応答を必要とするインタラクティブなアプリケーションをサポートします。
- 長文の分析と処理学術論文の読解、法律契約書のレビュー、大規模なコードライブラリの理解などに利用でき、膨大な量の情報を効率的に抽出・統合することができます。
- エンドサイドプライバシーコンピューティングMac Studio M4 MaxやNVIDIA DGX Sparkなどのローカルデバイスに展開することで、金融、医療、企業オフィスにおける機密データのプライベート処理ニーズに対応できます。