project
Hy-MT2-1.8B - 腾讯混元推出的端侧翻译大模型
Hy-MT2-1.8B 是腾讯混元推出的端侧翻译大模型,仅 1.8B 参数却支持 33 个语种互译,翻译质量在 FLORES-200 等基准上超越微软、豆包等商业 API。
Hy-MT2-1.8B是什么
Hy-MT2-1.8B 是腾讯混元推出的端侧翻译大模型,仅 1.8B 参数却支持 33 个语种互译,翻译质量在 FLORES-200 等基准上超越微软、豆包等商业 API。模型通过 2-bit(574MB)与 1.25-bit(440MB)极致量化,可在手机、PC 端本地流畅运行,已落地哔哩哔哩直播弹幕实时翻译,实现低成本、高隐私的端侧高质量翻译。
Hy-MT2-1.8B的主要功能
-
33 语种互译:覆盖中英日韩等主流语言及少数民族语言,支持任意方向互译。
-
端侧本地运行:通过极低比特量化将模型压缩至 440~574MB,普通手机与 PC 均可常驻后台。
-
实时翻译:单条弹幕 500~800ms 响应,已接入哔哩哔哩直播弹幕等高频场景。
-
隐私保护:翻译全程在设备本地完成,无需上传云端,数据不出端。
Hy-MT2-1.8B的技术原理
-
2-bit 极致量化:采用拉伸弹性量化(SEQ)将参数量化至 {-1.5, -0.5, 0.5, 1.5} 四个离散值,结合量化感知蒸馏(QAD)在压缩至 574MB 的同时保持几乎无损的翻译质量。
-
1.25-bit 稀疏量化(Sherry):混元自研的 ACL 2026 Oral 方案,核心为”细粒度稀疏”策略——每 4 个参数中保留 3 个 ±1、1 个置 0,平均每个参数仅需 1.25-bit;配合专为 CPU 设计的 STQ 内核,模型体积降至 440MB,可常驻后台运行。
-
x86 算子适配优化:英特尔团队针对低比特格式优化向量化、权重重排与 VNNI 指令融合,使 Q2_0C 与 STQ 在主流酷睿处理器上的 token 吞吐分别提升约 2.7 倍和 5 倍,将极低 bit 方案从移动端扩展到 PC 与边缘设备。
微信关注回复“开源”,加入AI开源项目交流群
如何使用Hy-MT2-1.8B
-
下载模型权重:访问 Hugging Face 仓库
huggingface.co/collections/AngelSlim/hy-low-bit-model,下载 2-bit 或 1.25-bit 量化后的模型文件。 -
获取推理框架:从 GitHub 克隆
github.com/tencent/AngelSlim完整代码,该仓库包含极低比特量化的推理内核与加载逻辑。 -
加载与推理:用 AngelSlim 框架加载下载的权重,在本地 CPU 上执行翻译推理;x86 设备可调用英特尔优化后的 VNNI 指令集内核以获得最佳性能。
Hy-MT2-1.8B的核心优势
-
体积极小质量极高:1.8B 参数经 2-bit / 1.25-bit 量化后仅 440~574MB,翻译质量却超越微软、豆包等商业 API。
-
端侧隐私优先:翻译全程在设备本地完成,无需联网上传,彻底杜绝数据泄露风险。
-
跨平台无缝运行:同时适配 ARM 移动端与 x86 PC 端,经英特尔算子优化后在酷睿处理器上吞吐提升 2.7~5 倍。
-
真实场景已落地:已接入哔哩哔哩直播弹幕实时翻译,单条 500~800ms 响应,能准确处理网络流行语。
-
多语种全覆盖:原生支持 33 个语种互译,涵盖主流语言及少数民族语言,满足全球化沟通需求。
Hy-MT2-1.8B的项目地址
- GitHub仓库:https://github.com/Tencent-Hunyuan/Hy-MT2
- HuggingFace模型库:https://huggingface.co/collections/AngelSlim/hy-low-bit-model
Hy-MT2-1.8B的同类竞品对比
| 对比维度 | Hy-MT2-1.8B | Google TranslateGemma-4B |
|---|---|---|
| 参数规模 | 1.8B | 4B |
| 支持语种 | 33 个语种互译 + 5 种民族语言/方言 | 覆盖主流语言对 |
| 端侧体积 | 440MB (1.25-bit) / 574MB (2-bit) | ~2GB+ (原生 FP16,需自行量化压缩) |
| 核心量化技术 | Sherry 1.25-bit 细粒度稀疏量化(ACL 2026 Oral) | 无官方量化方案,需依赖第三方工具 |
| 翻译质量 | FLORES-200 整体优于微软、豆包等商业 API | 接近研究级水平,4B 版为移动端效果妥协版 |
| 推理框架 | AngelSlim(自研,含 x86 VNNI 优化内核) | 需借助 TensorFlow Lite、ExecuTorch 等通用框架 |
| 商业落地 | 已接入哔哩哔哩直播弹幕实时翻译 | 主要用于研究/开发者实验,无大规模商业集成 |
| 开源协议 | 权重+代码全开源 | Apache 2.0 开源,可自由商用 |
Hy-MT2-1.8B的应用场景
-
直播弹幕实时翻译:已落地哔哩哔哩,单条 500~800ms 响应,可准确翻译网络流行语与梗。
-
离线即时通讯:集成于社交 App,在无网络环境下实现跨国聊天实时互译,保障对话隐私。
-
移动端网页/文档翻译:作为浏览器插件或系统级翻译服务,本地完成外文网页、PDF 文档翻译。
-
游戏内实时本地化:嵌入手游或 PC 游戏客户端,实时翻译外服游戏聊天、任务文本与 UI。
-
跨境电商内容翻译:在商家端本地批量翻译商品标题、详情页与客服话术,降低多语言运营成本。