project
StepAudio 2.5 ASR - StepAudio社が発表した自動音声認識モデル。
StepAudio 2.5 ASRは、StepAudioが発表した新世代の自動音声認識モデルで、音声の文字起こし、議事録、長時間の音声処理向けに特別に設計されています。このモデルは、オーディオエンコーダー、リニアアダプタ、4B LLMを使用しています。
StepAudio 2.5 ASRとは何ですか?
StepAudio 2.5 ASRは、StepAudioが発表した新世代の自動音声認識モデルで、音声の文字起こし、会議議事録、長時間の音声処理に特化して設計されています。このモデルは、オーディオエンコーダー + リニアアダプタ + 4B LLM + MTP-5のアーキテクチャを採用し、音声認識分野に初めてマルチトークン予測技術を導入することで、500 TPSの超高速推論を実現しています。OGG、mp3、wav、PCMなどの入力フォーマットをサポートし、32Kのコンテキストウィンドウを再利用することで、30分間の音声を1回の操作でエンドツーエンドで文字起こしでき、従来のスライス方式で発生していたコンテキストの破損問題を完全に解消し、業界をリードする速度と精度を実現しています。
StepAudio 2.5 ASRの主な機能
-
高速音声文字起こしこのモデルの推論処理能力は最大で毎秒500トークンに達し、5分間の音声や動画を数秒で文字起こしできる。
-
長尺音声のエンドツーエンド認識32Kのコンテキストウィンドウを再利用して、30分間の音声を1回の完全な文字起こしで書き起こします。
-
マルチフォーマットオーディオ対応OGG、mp3、wav、PCMなどの一般的なオーディオフォーマットに対応しています。
-
中国語、英語、方言の認識中国語と英語の主要言語を網羅し、方言、アクセント付きの標準中国語、そして少数の日本語とアラビア語にも対応しています。
-
高スループットデコードMTP-5アーキテクチャに基づくと、スループットは400%向上し、推論コストは80%削減されます。
StepAudio 2.5 ASRの技術的原理
- 全体的な建築設計このモデルは、音声表現の抽出、次元の整合、言語モデリング、および高スループットのデコードを考慮した、オーディオエンコーダー+リニアアダプタ+4B LLM+MTP-5の4層スタックアーキテクチャを採用しています。
- オーディオコーディング層0.6B Transformerオーディオエンコーダは、入力オーディオを12.5Hzのオーディオ埋め込みに変換し、元の音響信号から意味ベクトルへの初期マッピングを完了します。
- 次元アライメントレイヤーリニアアダプタは、オーディオエンコーダの出力をLLMの隠れ次元に合わせる役割を担い、モード特徴空間全体にわたるブリッジングと適応を可能にします。
- 言語モデリングの基盤4BパラメータLLMはモデルの中核として機能し、文脈理解と自己回帰的なテキスト生成のタスクを実行し、ネイティブの32Kコンテキストウィンドウを再利用して、長尺音声のエンドツーエンドモデリングを実現します。
- MTPマルチトークン予測ステップ3.5のフラッシュと同じMTP-5モジュールを導入することで、1回の順伝播でさらに5つの候補トークンを並行して予測できるようになり、トークンを順次生成する従来のASR生成における速度のボトルネックを解消します。
StepAudio 2.5 ASRの使い方
-
オンライン体験音声をアップロードしてオンラインで文字起こしを行うには、Stepfunエクスペリエンスセンター(https://www.stepfun.com/studio/audio?tab=speech-recognition)にアクセスしてください。
-
APIアクセスAPIドキュメントを表示し、モデル識別子とサンプルコードを取得するには、Stepfunオープンプラットフォーム(https://platform.stepfun.com/docs/zh/guides/models/stepaudio-2.5-asr)またはStep Plan公式ウェブサイト(https://platform.stepfun.com/docs/zh/step-plan/integrations/audio-api)にアクセスしてください。
-
デモページ公開されているサンプルやデモをご覧になるには、デモページ(https://stepaudiollm.github.io/step-audio-2.5-asr/)をご覧ください。
-
開発者アクセスASR APIをプログラムで呼び出すことにより、認識結果を検索、要約、品質検査、またはアーカイブ処理に統合することができます。
StepAudio 2.5 ASRの主要情報と使用要件
- 出版事業体StepFunによって正式にリリースされ、現在StepFunオープンプラットフォームとStep Planで完全に利用可能です。
- モデルアーキテクチャオーディオエンコーダ(0.6B)+ リニアアダプタ + 4B LLM + MTP-5 の4層アーキテクチャを採用し、全体のパラメータ規模は約4.6Bです。
- 推論性能ピークスループットは500トークン/秒に達し、スループットは400%増加し、レイテンシは60%減少し、推論コストは80%減少します。
- 文脈理解力LLMのネイティブな32Kコンテキストウィンドウを再利用し、スライスやスプライシングを必要とせずに、最大30分間の音声を1回の操作で完全に文字起こしできます。
- 対応フォーマット一般的な音声フォーマットには、OGG、mp3、wav、PCMなどがあります。
- 言語対応範囲このゲームは主に中国語と英語に対応していますが、方言、アクセントのある北京語、そして少量の日本語とアラビア語もサポートしています。
- 評価結果中国語(AISHELL、Wenet、FLEURS-zh)、英語(LibriSpeech、Common Voice、VoxPopuli)、および長尺音声を含む、複数の権威あるベンチマークにおいて、最先端(SOTA)の性能を達成しています。
- トレーニングデータ事前学習には数千万時間分の音声データが使用されます。ASR専用の学習には、10万時間分の高品質な短い音声(最大30秒)と5万時間分の長い音声(最大30分)が含まれます。
- アクセスチャネル開発者はStep PlanまたはStep PlanオープンプラットフォームAPIを通じて統合できます。一般ユーザーは体験センターでオンラインで試用するか、デモページにアクセスして効果を確認できます。
StepAudio 2.5 ASRの主な利点
- スピードブレークスルー音声認識分野に大規模言語モデル推論高速化技術を初めて導入し、推論速度は最大500トークン/秒、スループットは400%向上した。
- コスト面での優位性推論遅延が60%削減され、推論コストが80%削減されることで、より低い計算能力でより高い文字起こし限界を実現できる。
- 精密技術のリーディングカンパニー中国語、英語、および長尺音声フォーマットに関する複数の権威あるベンチマークにおいて、業界最低の全体エラー率を達成し、最先端(SOTA)レベルに達しています。
- 長文記事の安定性32Kのネイティブコンテキストウィンドウを再利用することで、30分間の音声のエンドツーエンドの文字起こしを精度を損なうことなく実行でき、スライススプライシングによって引き起こされるコンテキストの破損を完全に排除できます。
- 建築革新ASR+MTP-5ディープフュージョンアーキテクチャに基づき、マルチトークン並列予測および検証メカニズムによって、従来のトークンごとの自己回帰生成における速度ボトルネックを打破します。
- 現場報道OGG、mp3、wav、PCMなど、複数の入力フォーマットに対応しており、中国語と英語の主要言語、方言、アクセントのある北京語などの複雑な音響状況にも対応しています。
StepAudio 2.5 ASRプロジェクトのアドレス
- 技術論文:https://stepaudiollm.github.io/step-audio-2.5-asr/model-card/
- オンラインでデモを体験してください:https://stepaudiollm.github.io/step-audio-2.5-asr/
StepAudio 2.5 ASRの競合製品比較
| 比較対象寸法 | StepAudio 2.5 ASR | Qwen3 ASR | Doubao-ASR-2603 |
|---|---|---|---|
| モデルアーキテクチャ | Audio Encoder+4B LLM+MTP-5 | 非公開 | 非公開 |
| 推論速度 | 500 TPS、スループットが400%向上 | 標準自己回帰 | 標準自己回帰 |
| 中国の平均CER | 2.97% | 3.17% | 3.34% |
| 英語の平均WER | 3.68% | 3.85% | 6.67% |
| 長い音声WER | 3.70% | 4.20% | 6.11% |
| 最大限のコンテキスト | 32K(30分間のエンドツーエンド) | 不明 | 不明 |
| コスト最適化 | 推論コストが80%削減されました | なし | なし |
StepAudio 2.5 ASRの応用シナリオ
- 会議議事録およびインタビュー記録長時間の会議やインタビューの録音を、用語の一貫性と文脈の整合性を維持しながら、分割や結合を行うことなく、エンドツーエンドで文字起こしします。
- 字幕生成とメディアアセットの前処理動画字幕を素早く生成し、OGG、mp3、wav、PCMなどの複数の音声フォーマットのバッチ処理をサポートします。
- 長尺オーディオコンテンツアーカイブポッドキャスト、講義、法廷審理など、30分間の音声録音の完全な文字起こしと検索に適しています。
- リアルタイム音声品質検査低遅延かつ高スループットであるため、顧客サービス通話の品質検査やコンテンツコンプライアンスレビューのシナリオに適しています。
- バックエンドシステムへのアクセス識別結果は、検索、要約、品質検査、またはアーカイブ処理に直接統合することができ、産業グレードの用語の一貫性と安定性に関する要件を満たします。