project
Hojo-ASR-V1 - Hojoオープンソース自動音声認識モデル
Hojo-ASR-V1は、スタートアップチームHojoが開発したオープンソースの自動音声認識モデルです。Whisper特徴抽出、Qwen3-Omni音声エンコーディング、Conformer適応、Qwen3-4B言語モデルデコーディングというアーキテクチャを採用しています。
Hojo-ASR-V1とは何ですか?
Hojo-ASR-V1は、スタートアップ企業Hojoが開発したオープンソースの自動音声認識モデルです。Whisper特徴抽出、Qwen3-Omniオーディオエンコーディング、Conformer適応、Qwen3-4B言語モデルデコードを組み合わせたアーキテクチャを採用しています。LibriSpeech Cleanデータセットでは単語誤り率がわずか1.74%、GigaSpeechでは7.6%、VoxPopuliでは7.02%と、トップレベルのソフトウェアに匹敵する性能を実現しています。ローカル展開に対応しており、エージェントワークフローや音声入力シナリオ向けに設計されています。
Hojo-ASR-V1の主な機能
-
高精度音声文字起こし音声をリアルタイムでテキストに変換し、長文や複雑な意味理解にも対応します。
-
中国語と英語の混合認識中国語と英語が混在する口語表現や場面に対して、高い堅牢性を示す。
-
騒音環境への適応言語モデルによる意味判断の助けを借りて、ノイズの多い環境でも高い認識率を維持している。
-
技術用語を理解するQwen3-4Bのセマンティック機能を用いて、医学、法律、技術などの分野における固有名詞を正確に識別する。
-
ローカルオフライン操作完全なローカル展開をサポートし、インターネット接続なしで音声認識を完了できるため、データプライバシーが確保されます。
Hojo-ASR-V1の技術原理
- 音響特徴抽出音声はOpenAI Whisperの特徴抽出器によって処理され、音素とスペクトル情報を保持しながら、元の波形を高次元の音響特徴ベクトルに変換します。
- 音声意味符号化特徴ベクトルは、Qwen3-Omniオーディオエンコーダに入力され、ディープセマンティックエンコーディングが行われます。これにより、音声情報がテキストのセマンティック空間に合わせた隠れ状態表現に変換されます。
- 特徴の適応と圧縮中間層はコンフォーマー構造を採用し、エンコーダと言語モデルの間で特徴適応と時間圧縮を実行することで、計算効率と情報忠実度のバランスを取っている。
- 大規模言語モデルのデコードQwen3-4B大規模言語モデルが受信および処理した特徴は、意味的文脈と組み合わされて最終的なテキストが生成され、モデルは言語の事前知識を使用して、類似した発音やノイズ干渉によって引き起こされるエラーを修正できるようになります。
Hojo-ASR-V1の使い方
-
モデルをダウンロードHuggingFaceリポジトリにアクセスする
HojoAI/Hojo-ASR-V1またはGitHubHojoAI/Hojo-ASR重量とコードを取得する。 -
依存関係をインストールしますPython環境を設定してインストールします...
hojo_asrおよび関連する依存ライブラリ。 -
モデル:合格
hojo.load_model()このインターフェースは、モデルをローカルのGPUまたはCPUにロードします。 -
入力音声音声ファイルのパスまたはリアルタイム音声ストリームを渡して、文字起こしインターフェースを呼び出します。
-
結果を出すこのモデルは認識されたテキストを返し、それをDeepSeekやGPTなどの大規模モデルと統合することで、二次的な精度向上やフォーマット最適化を行うことができます。
Hojo-ASR-V1の主な利点
-
最高レベルの認識精度LibriSpeech CleanのWERは1.74%で、NVIDIA CanaryやIBM Graniteといったリーダーボード上位のモデルと同等のレベルです。
-
意味エラーの訂正音響マッチングのみに依存する従来の音声認識とは異なり、Qwen3-4B言語モデルは文脈の意味に基づいて正しい単語を推測できるため、同音異義語の誤りを大幅に削減できます。
-
中国シーンの最適化口語的な中国語表現、中性的な声調、そり舌語尾などの細部に至るまで徹底的に最適化されており、一般的な多言語モデルよりも優れたユーザーエクスペリエンスを実現しています。
-
プライバシーとセキュリティ完全なローカル展開をサポートしており、機密性の高い音声データをクラウドにアップロードする必要がないため、企業会議や医療現場に適しています。
Hojo-ASR-V1プロジェクトのアドレス
- GitHubリポジトリ:https://github.com/HojoAI/Hojo-ASR
- ハギングフェイスモデルライブラリ:https://huggingface.co/HojoAI/Hojo-ASR-V1
Hojo-ASR-V1と類似の競合製品との比較
| 寸法 | Hojo-ASR-V1 | OpenAI Whisper |
|---|---|---|
| モデルアーキテクチャ | エンコーダー + アダプター + LLMデコーダー | Encoder-Decoder |
| 意味理解 | 強力な(Qwen3-4B言語モデルのサポート) | 中程度(純粋な音響マッピング) |
| 中国向け最適化 | 高度に最適化されており、高度な会話型言語認識機能を備えています。 | 多言語対応ではあるが、中国語の描写は概して不十分だ。 |
| オープンソースライセンス | Apache-2.0 | MIT |
| ローカル展開 | サポート対象ですが、一定量のビデオメモリ/RAMが必要です。 | サポート、成熟したエコシステム |
| リストWER | LibriSpeech Clean 1.74% | Large-v3 約2.1% |
Hojo-ASR-V1の応用事例
-
AIエージェントによる音声入力インテリジェントエージェントの「耳」として、音声コマンドを実行可能なテキストに変換し、キーボードに代わる主要な対話手段となる。
-
システムレベルの音声入力方法オペレーティングシステムのグローバル入力を制御下に置き、ブラウザ、ChatGPT、Claude、Notionなどのあらゆるテキストボックスで音声入力を有効にします。
-
リアルタイム会議文字起こしローカル展開によりオフラインでの議事録作成が可能になり、機密性の高い業務音声データの漏洩を防ぐことができます。
-
ポッドキャストと動画の字幕長文の音声コンテンツを迅速にテキストに変換し、その後の大規模なモデルの改善や構造化された整理をサポートします。
-
インテリジェントな顧客サービスと電話品質検査コールセンターのシナリオでは、顧客の音声をリアルタイムで認識し、重要な情報や感情的なキーワードを抽出することができます。