AB
AiBoss
project

Hy-MT2-1.8B - テンセント・フンユアンが発表した大規模エッジ変換モデル。

Hy-MT2-1.8Bは、テンセント・フンユアンが開発した大規模エッジ翻訳モデルです。わずか18億個のパラメータで33言語間の相互翻訳をサポートし、FLORES-200などのベンチマークにおいて、MicrosoftやDoubaoといった商用APIを凌駕する翻訳品質を実現しています。

Hy-MT2-1.8Bとは何ですか?

Hy-MT2-1.8Bは、テンセント・フンユアンが開発した大規模なオンデバイス翻訳モデルです。わずか18億個のパラメータで33言語間の相互翻訳をサポートし、FLORES-200などのベンチマークにおいて、マイクロソフトや豆豉の商用APIを凌駕する翻訳品質を実現しています。2ビット(574MB)と1.25ビット(440MB)の解像度による高度な量子化を採用することで、スマートフォンやPC上でスムーズなローカル動作を可能にしています。Bilibiliのライブ配信コメントのリアルタイム翻訳に実装され、低コスト、高プライバシー、高品質のオンデバイス翻訳を実現しています。

Hy-MT2-1.8Bの主な機能

  • 33 言語翻訳中国語、英語、日本語、韓国語といった主要言語に加え、少数言語にも対応しており、あらゆる方向への翻訳をサポートしています。
  • デバイス側でのローカル操作このモデルは、極めて低いビット量子化によって440~574MBに圧縮されており、一般的な携帯電話やPCでバックグラウンドで実行できます。
  • リアルタイム翻訳単一の箇条書きコメントに対する応答時間は500~800msで、Bilibiliのライブ配信における箇条書きコメントなど、高頻度でコメントが発生するシナリオにも組み込まれています。
  • プライバシー保護翻訳プロセス全体はデバイス上でローカルに完了し、クラウドへのアップロードは不要で、データはデバイスから外部に送信されることはありません。

Hy-MT2-1.8Bの技術原理

  • 2ビット極限量子化パラメータは伸縮弾性量子化(SEQ)を使用して4つの離散値{-1.5、-0.5、0.5、1.5}に量子化され、量子化認識蒸留(QAD)と組み合わせることで、574MBに圧縮しながらも翻訳品質はほぼロスレスに維持されました。
  • 1.25ビット疎量子化(シェリー)Hunyuanが独自開発したACL 2026 Oralソリューションの中核は、「きめ細かいスパース性」戦略です。これは、4つのパラメータごとに3±1と10を保持し、パラメータあたり平均わずか1.25ビットしか必要としないというものです。CPU専用に設計されたSTQカーネルと組み合わせることで、モデルサイズは440MBに縮小され、バックグラウンドで実行できます。
  • x86オペレータ適応最適化Intelのチームは、低ビットフォーマット向けにベクトル化、重み再配置、およびVNNI命令融合を最適化し、その結果、主流のCoreプロセッサ上でQ2_0CとSTQのトークンスループットがそれぞれ約2.7倍と5倍向上し、超低ビットソリューションをモバイルデバイスからPCやエッジデバイスへと拡張しました。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

Hy-MT2-1.8Bの使い方

  • モデルの重量をダウンロードハギングフェイスのリポジトリにアクセスする huggingface.co/collections/AngelSlim/hy-low-bit-model2ビットまたは1.25ビットに量子化されたモデルファイルをダウンロードしてください。
  • 推論フレームワークの取得GitHubからクローンする github.com/tencent/AngelSlim 完全なコードはこのリポジトリで入手可能で、そこには極めて低いビット量子化を用いた推論カーネルとロードロジックが含まれています。
  • ロードと推論ダウンロードされた重みはAngelSlimフレームワークを使用してロードされ、変換推論はローカルCPU上で実行されます。x86デバイスは、最適なパフォーマンスを得るために、Intelが最適化したVNNI命令セットカーネルを呼び出すことができます。

Hy-MT2-1.8Bの主な利点

  • 極めて小型で極めて高質量1.8Bのパラメータは、2ビット/1.25ビットで量子化後、わずか440~574MBになりますが、その翻訳品質はMicrosoftやDoubaoなどの商用APIを凌駕します。
  • デバイス側のプライバシーを優先する翻訳プロセス全体はデバイス上でローカルに完了するため、アップロードのためのインターネット接続は不要であり、データ漏洩のリスクを完全に排除できます。
  • シームレスなクロスプラットフォーム運用ARMモバイルデバイスとx86 PCの両方に対応しており、Intelのオペレーターによる最適化後、Coreプロセッサ上でのスループットは2.7倍から5倍に向上する。
  • 現実世界のシナリオが実装されました。Bilibiliのライブ配信におけるリアルタイム翻訳機能と統合されており、応答時間は500~800msで、一般的なインターネットスラングも正確に処理できます。
  • 多言語による完全網羅33言語間の翻訳をネイティブでサポートしており、主要言語から少数言語までを網羅し、グローバルなコミュニケーションのニーズを満たしています。

Hy-MT2-1.8Bのプロジェクトアドレス

  • GitHubリポジトリ:https://github.com/Tencent-Hunyuan/Hy-MT2
  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/AngelSlim/hy-low-bit-model

Hy-MT2-1.8Bと類似競合製品との比較

比較対象寸法 Hy-MT2-1.8B Google TranslateGemma-4B
パラメータサイズ 1.8B 4B
対応言語 33言語+5つの民族言語/方言間の相互翻訳 主要な言語ペアを網羅
末端側容積 440MB (1.25-bit) / 574MB (2-bit) 約2GB以上(ネイティブFP16、手動圧縮が必要)
コア定量技術 シェリー1.25ビット細粒度スパース量子化(ACL 2026 口頭発表) 公式な定量的解決策は存在しないため、サードパーティ製のツールを使用する必要がある。
翻訳品質 FLORES-200は、マイクロソフト、豆瓣(Douban)などの商用APIよりも概して優れています。 研究レベルの品質に迫るバージョン4Bは、モバイルデバイス向けに調整された妥協版である。
推論フレームワーク AngelSlim(自社開発、x86 VNNI最適化カーネルを含む) そのためには、TensorFlow LiteやExecuTorchといった汎用フレームワークの使用が必要となる。
商業化 Bilibiliのライブ配信コメントのリアルタイム翻訳機能が統合されました。 主に研究開発実験に使用され、大規模な商業利用には至っていない。
オープンソースライセンス 重み付け + 完全オープンソースコード Apache 2.0はオープンソースであり、商用利用も自由に行えます。

Hy-MT2-1.8Bの応用シナリオ

  • ライブ配信コメントのリアルタイム翻訳Bilibiliに実装されており、応答時間は500~800msで、人気のインターネットスラングやミームを正確に翻訳できます。
  • オフラインインスタントメッセージングソーシャルアプリに統合されているため、ネットワーク接続がなくても国境を越えたチャットをリアルタイムで翻訳でき、会話のプライバシーを確保できます。
  • モバイルウェブページ/ドキュメントの翻訳ブラウザプラグインまたはシステムレベルの翻訳サービスとして、外国語のウェブページやPDF文書をローカルで翻訳できます。
  • ゲーム内リアルタイムローカライズモバイルゲームやPCゲームのクライアントに組み込まれており、海外のゲームサーバーからチャット、クエストテキスト、UIをリアルタイムで翻訳します。
  • 越境ECコンテンツの翻訳この機能により、販売者は商品タイトル、商品詳細ページ、カスタマーサービススクリプトをローカルで一括翻訳できるため、多言語対応業務のコストを削減できます。