AB
AiBoss站
project

Hy-MT2-1.8B - 腾讯混元推出的端侧翻译大模型

Hy-MT2-1.8B 是腾讯混元推出的端侧翻译大模型,仅 1.8B 参数却支持 33 个语种互译,翻译质量在 FLORES-200 等基准上超越微软、豆包等商业 API。

Hy-MT2-1.8B是什么

Hy-MT2-1.8B 是腾讯混元推出的端侧翻译大模型,仅 1.8B 参数却支持 33 个语种互译,翻译质量在 FLORES-200 等基准上超越微软、豆包等商业 API。模型通过 2-bit(574MB)与 1.25-bit(440MB)极致量化,可在手机、PC 端本地流畅运行,已落地哔哩哔哩直播弹幕实时翻译,实现低成本、高隐私的端侧高质量翻译。

Hy-MT2-1.8B的主要功能

  • 33 语种互译:覆盖中英日韩等主流语言及少数民族语言,支持任意方向互译。
  • 端侧本地运行:通过极低比特量化将模型压缩至 440~574MB,普通手机与 PC 均可常驻后台。
  • 实时翻译:单条弹幕 500~800ms 响应,已接入哔哩哔哩直播弹幕等高频场景。
  • 隐私保护:翻译全程在设备本地完成,无需上传云端,数据不出端。

Hy-MT2-1.8B的技术原理

  • 2-bit 极致量化:采用拉伸弹性量化(SEQ)将参数量化至 {-1.5, -0.5, 0.5, 1.5} 四个离散值,结合量化感知蒸馏(QAD)在压缩至 574MB 的同时保持几乎无损的翻译质量。
  • 1.25-bit 稀疏量化(Sherry):混元自研的 ACL 2026 Oral 方案,核心为”细粒度稀疏”策略——每 4 个参数中保留 3 个 ±1、1 个置 0,平均每个参数仅需 1.25-bit;配合专为 CPU 设计的 STQ 内核,模型体积降至 440MB,可常驻后台运行。
  • x86 算子适配优化:英特尔团队针对低比特格式优化向量化、权重重排与 VNNI 指令融合,使 Q2_0C 与 STQ 在主流酷睿处理器上的 token 吞吐分别提升约 2.7 倍和 5 倍,将极低 bit 方案从移动端扩展到 PC 与边缘设备。

微信关注回复“开源”,加入AI开源项目交流群

如何使用Hy-MT2-1.8B

  • 下载模型权重:访问 Hugging Face 仓库 huggingface.co/collections/AngelSlim/hy-low-bit-model,下载 2-bit 或 1.25-bit 量化后的模型文件。
  • 获取推理框架:从 GitHub 克隆 github.com/tencent/AngelSlim 完整代码,该仓库包含极低比特量化的推理内核与加载逻辑。
  • 加载与推理:用 AngelSlim 框架加载下载的权重,在本地 CPU 上执行翻译推理;x86 设备可调用英特尔优化后的 VNNI 指令集内核以获得最佳性能。

Hy-MT2-1.8B的核心优势

  • 体积极小质量极高:1.8B 参数经 2-bit / 1.25-bit 量化后仅 440~574MB,翻译质量却超越微软、豆包等商业 API。
  • 端侧隐私优先:翻译全程在设备本地完成,无需联网上传,彻底杜绝数据泄露风险。
  • 跨平台无缝运行:同时适配 ARM 移动端与 x86 PC 端,经英特尔算子优化后在酷睿处理器上吞吐提升 2.7~5 倍。
  • 真实场景已落地:已接入哔哩哔哩直播弹幕实时翻译,单条 500~800ms 响应,能准确处理网络流行语。
  • 多语种全覆盖:原生支持 33 个语种互译,涵盖主流语言及少数民族语言,满足全球化沟通需求。

Hy-MT2-1.8B的项目地址

  • GitHub仓库:https://github.com/Tencent-Hunyuan/Hy-MT2
  • HuggingFace模型库:https://huggingface.co/collections/AngelSlim/hy-low-bit-model

Hy-MT2-1.8B的同类竞品对比

对比维度 Hy-MT2-1.8B Google TranslateGemma-4B
参数规模 1.8B 4B
支持语种 33 个语种互译 + 5 种民族语言/方言 覆盖主流语言对
端侧体积 440MB (1.25-bit) / 574MB (2-bit) ~2GB+ (原生 FP16,需自行量化压缩)
核心量化技术 Sherry 1.25-bit 细粒度稀疏量化(ACL 2026 Oral) 无官方量化方案,需依赖第三方工具
翻译质量 FLORES-200 整体优于微软、豆包等商业 API 接近研究级水平,4B 版为移动端效果妥协版
推理框架 AngelSlim(自研,含 x86 VNNI 优化内核) 需借助 TensorFlow Lite、ExecuTorch 等通用框架
商业落地 已接入哔哩哔哩直播弹幕实时翻译 主要用于研究/开发者实验,无大规模商业集成
开源协议 权重+代码全开源 Apache 2.0 开源,可自由商用

Hy-MT2-1.8B的应用场景

  • 直播弹幕实时翻译:已落地哔哩哔哩,单条 500~800ms 响应,可准确翻译网络流行语与梗。
  • 离线即时通讯:集成于社交 App,在无网络环境下实现跨国聊天实时互译,保障对话隐私。
  • 移动端网页/文档翻译:作为浏览器插件或系统级翻译服务,本地完成外文网页、PDF 文档翻译。
  • 游戏内实时本地化:嵌入手游或 PC 游戏客户端,实时翻译外服游戏聊天、任务文本与 UI。
  • 跨境电商内容翻译:在商家端本地批量翻译商品标题、详情页与客服话术,降低多语言运营成本。