project
Step Edge - Step Edge社が発売した、エンドサイドモデルの完全なセット。
Step Edgeは、StepStar社が提供するエッジモデルの包括的なスイートであり、基本モデル、オーディオ、GUI、およびGenという4つの主要コンポーネントで構成され、携帯電話、自動車、その他の端末向けに設計されています。
ステップエッジとは何ですか?
Step Edgeは、StepStar社が提供する包括的なエッジモデルスイートで、モバイルデバイスや自動車向けに設計された、基本モデル、オーディオ、GUI、Genの4つの主要コンポーネントで構成されています。エッジとクラウドの連携アーキテクチャにより、エージェントはローカルで0.1秒の応答時間を実現しながら、完全なモダリティデータのプライバシーを確保できます。29のコア評価で1位を獲得し、端末推論を最適化するために独自開発のStep Inference NPUエンジンを搭載しています。
Step Edgeの主な機能
-
ステップエッジベーシックモデルテキスト、画像、動画、OCR、空間認識、ツール呼び出しなど、エッジ側でのマルチモーダルな理解と推論をサポートします。
-
Step Edge Audioデバイス上での音声理解と音声認識機能。中国語や英語を含む複数の言語での音声認識(ASR)および音声質問応答に対応。
-
Step Edge GUIモバイルおよびデスクトップアプリケーション向けに、視覚認識、要素位置特定、および自動操作をサポートするクライアント側GUIエージェント。
-
Step Edge Genテキストから画像への変換、画像から画像への変換、ローカル編集など、エッジ画像の生成と編集をサポートしており、OneIGやDPG-Benchなどのベンチマークでトップクラスの性能を誇ります。
ステップエッジの技術原理
-
エンドツークラウドのコラボレーションアーキテクチャ単純で頻度の高いタスクはデバイス上でローカルに処理され、複雑で長鎖の推論はクラウドで処理されるため、速度、機能、コストの全体的なバランスが実現される。
-
フルモーダルローカル推論テキスト、画像、音声データを含むマルチモーダルデータは、端末上でローカルに処理されるため、機密情報が端末外に漏洩することはなく、ローカルコンピューティングによってプライバシーとセキュリティが保護されます。
-
ステップ推論NPUエンジン携帯電話や自動車などのハードウェア向けにオペレータとメモリを最適化し、テキスト、画像、音声などの入力形式のエンドツーエンドの遅延を削減する、自社開発の端末推論エンジン。
-
低遅延ツールコール実行クライアント側のローカルツール呼び出しのレイテンシは0.1秒と低く、高頻度のインタラクションシナリオにおけるリアルタイム応答をサポートし、クラウドリンクへの依存度を低減します。
ステップエッジの使い方
Step Edgeスイートは、まだ一般向けテストやAPIリリースが正式に開始されておらず、現在はリリースおよび発表段階にあります。
Step Edgeのプロジェクト住所
- プロジェクト公式サイト:https://static.stepfun.com/blog/step-edge/
Step Edgeの競合製品比較
| 比較対象寸法 | Step Edge | Qwen3-VL |
|---|---|---|
| 製品形態 | エッジサイドモデルの完全なセット(基本モデル+オーディオモデル+GUIモデル+ジェネレーターモデル) | オープンソースのマルチモーダル大型モデルシリーズ |
| エンドサイド最適化 | 端末環境向けに徹底的に最適化されており、自社開発のNPUエンジンを搭載しています。 | エッジでの展開にも対応していますが、主に汎用的なマルチモーダルタスク向けに設計されています。 |
| GUI Agent | OSWorldなどのエッジサイドGUIモデル評価において主導的な役割を果たしている。 | GUIの自動化は、外部フレームワークとの統合によって実現する必要がある。 |
| オーディオ機能 | 独立したオーディオモデル、ASR、およびオーディオ理解が統合されています | 主な焦点は視覚コンテンツとテキストコンテンツであり、音声は主要な分野ではありません。 |
| 画像生成 | Genモデルを内蔵し、デバイス上での画像生成と編集をサポートします。 | 焦点は理解にあり、発電能力は主要な関心事ではない。 |
| プライバシーポリシー | フルモーダルなローカル処理、ネイティブなエッジクラウド連携 | クライアント側で実行することは可能ですが、連携戦略はご自身で構築する必要があります。 |
Step Edge アプリケーションシナリオ
-
スマートフォンアシスタントデバイス側のリアルタイム音声認識とGUI自動化により、テイクアウトの注文、メッセージの送信、写真アルバムの確認といった頻繁に行われるタスクをオフラインで完了させることが可能になる。
-
車載インテリジェントコックピット音声コマンドと車載視覚認識のローカル処理により、運転データのプライバシーが確保され、ナビゲーション、空調、エンターテイメントの遅延のない制御が可能になります。
-
エンドサイドイメージの作成このアプリを使えば、ユーザーはクラウドにアップロードすることなく、スマートフォン上でローカルに写真を作成・編集できるため、即時作成のニーズとプライバシー保護の両方を満たすことができます。
-
工業ターミナルの検査ネットワーク環境が脆弱な工場や屋外環境において、エッジモデルは機器の故障や音声異常を局所的に特定し、重要な情報をリアルタイムで報告することができる。
-
IoTエッジデバイススマートホームやウェアラブルデバイスに導入することで、ローカルでの音声起動、画像認識、簡単な意思決定が可能になり、クラウドコストを削減できます。