AB
AiBoss
project

HY-1.8B-2Bit - テンセント・フンユアン初の産業グレード2ビットエッジサイドモデル

HY-1.8B-2Bitは、TencentがHunyuanを通じて発表した初の業界標準2ビットエッジサイド大規模モデルです。このモデルは1.8Bモデルをベースに、量子化認識トレーニング(QAT)を用いて圧縮されています。HY-1.8B-2Bitは、パラメータ数がわずか0.3B、サイズがわずか300MBという優れた性能を実現しています。

HY-1.8B-2Bitとは何ですか?

HY-1.8B-2Bitは、テンセント・フンユアン初の業界標準2ビットエッジAIモデルで、1.8Bモデルをベースに量子化認識トレーニング(QAT)を用いて圧縮されています。HY-1.8B-2Bitは、パラメータ数がわずか0.3B、サイズが300MB、メモリ使用量が600MBと、ほとんどのモバイルアプリケーションよりも小型です。元のモデルの思考能力を維持しながら、生成速度を2~3倍向上させています。Arm SME2などのモバイルプラットフォームに既に対応しており、スマートフォン、ヘッドホン、スマートホームデバイスなどのエッジデバイス上で効率的に動作し、「小型ながらパワフル」なエッジAIの展開において画期的な成果を上げています。

HY-1.8B-2Bitの主な機能

  • エッジサイドのインテリジェント推論このモデルは、クラウドサービスに依存することなく、携帯電話、ヘッドホン、スマートホームデバイスなどの一般消費者向けハードウェア上で、大規模な言語モデルのオフライン展開と運用をサポートします。
  • 完全な思考能力このモデルは、元のモデルが持つ、長い思考連鎖と短い思考連鎖を柔軟に切り替えるメカニズムを維持しており、タスクの複雑さに基づいて、簡潔な推論経路または詳細な推論経路を自動的に選択します。
  • 高効率テキスト生成従来の高精度モデルと比較して、実際のエッジデバイス上での生成速度が2~3倍向上し、ユーザーの待ち時間を大幅に短縮します。
  • プライバシーとセキュリティの保護このモデルは完全にローカルで動作するため、ユーザーデータがデバイスから外部に送信されることはなく、オフライン展開や高度なプライバシーが求められるシナリオにおけるセキュリティ要件を満たします。

HY-1.8B-2Bitの技術原理

  • 量子化対応トレーニング(QAT)従来のトレーニング後量子化(PTQ)は、モデルトレーニング後に直接圧縮を行うため精度が大幅に低下するのに対し、QATはトレーニング中に2ビット量子化の順伝播効果をシミュレートすることで、モデルの重みが低精度制約に積極的に適応し、量子化されたモデルのパフォーマンスを大幅に回復させます。
  • 2ビット極限圧縮とそれに相当するパラメータ削減32ビット浮動小数点重みを2ビット表現(離散状態はわずか4つ)に圧縮することで、実際のモデルサイズは1.8BパラメータのGBレベルから300MBに削減され、同等のパラメータ数はわずか0.3Bとなり、6倍のストレージ圧縮率を実現しながら、4ビットPTQと同等の数学的、コード的、科学的推論能力を維持します。
  • データとトレーニング戦略の最適化このモデルは、データ最適化、弾性伸縮量子化、革新的なトレーニング戦略という3つの手法を連携させて、全体的な性能を向上させています。中でも弾性伸縮量子化は、極端な値によって引き起こされる精度低下を最小限に抑えるため、重み分布の量子化範囲を動的に調整します。
  • エンドサイドハードウェアの適応この技術は、GGUF-INT2形式の重みとBF16擬似量子化重みを提供し、Arm SME2命令セットの高度な最適化を実行することで、この技術に対応したモバイルデバイス上で効率的かつ安定した推論を実現します。

HY-1.8B-2Bit のプロジェクトアドレス

  • GitHubリポジトリ:https://github.com/Tencent/AngelSlim
  • ハギングフェイスモデルライブラリ
    • https://huggingface.co/AngelSlim/HY-1.8B-2Bit-GGUF
    • https://huggingface.co/AngelSlim/HY-1.8B-2Bit
  • 技術論文:https://huggingface.co/AngelSlim/HY-1.8B-2Bit/blob/main/AngelSlim_Technical_Report.pdf

HY-1.8B-2Bitの応用シナリオ

  • スマートフォンアシスタント内蔵AIアシスタントとして、オフラインでの音声対話、テキスト生成、インテリジェントな質問応答を可能にします。インターネット接続がなくても、スケジュール管理やメール作成などの日常業務を処理できるため、ユーザーのプライバシーを保護しながらデータ消費量を削減できます。
  • スマートウェアラブルデバイスこのモデルは、スマートヘッドホンやスマートウォッチなどの低消費電力デバイスに展開でき、オフラインでの音声認識、リアルタイム翻訳、健康相談などをサポートすることで、ウェアラブルデバイスの限られた計算能力やバッテリー寿命への敏感さといった課題を解決します。
  • スマートホーム集中制御スマートスピーカーや家電コントローラーなどのIoTデバイス上でローカルに動作し、オフラインでの音声コマンド認識、シーン連動制御、パーソナライズされたレコメンデーションを可能にすることで、応答速度を向上させ、家庭内データのセキュリティを確保します。
  • 車両エッジコンピューティングこれは、不安定なネットワーク環境下でもサービスの継続性を確保するために、車載インフォテインメントシステムや自動運転支援装置に用いられます。
  • 企業民営化の展開このモデルは、金融、医療、政府機関など、極めて高いデータコンプライアンス要件を持つ業界のニーズを満たすことができ、機密文書の処理や専門的な質問への回答をローカルサーバーまたは専用端末で行うことで、データ漏洩のリスクを排除できます。