AB
AiBoss
ニュース

Underdog 发布 Saluki 27B:2-bit 量化版 Qwen3.8-27B 工具调用反超原模型

Conway Research 旗下 Underdog 以 Apache 2.0 发布 Saluki 27B,将 Qwen3.8-27B 压缩为 7.89 GB 的 2-bit 混合精度 GGUF,可在原生 llama.cpp 运行。据其公布结果,该模型在工具调用类基准上超过 54 GB 的 BF16 原模型,但数学与多步推理明显下降。

核心事实

据 MarkTechPost 报道,Conway Research 旗下端侧助手项目 Underdog 以 Apache 2.0 许可发布了 Saluki 27B。该模型是 Qwen3.8-27B 的 2-bit 混合精度 GGUF 量化版本,文件体积 7.89 GB,而完整 BF16 版本需要 54 GB。Underdog 表示,其量化调优重点在于保护工具调用能力,使这一 27B 级模型可在原生 llama.cpp 及其衍生应用中运行,并支持完整 GPU 卸载;此外提供 629 MB 或 928 MB 的可选视觉模块。

Saluki 27B 由三层工作叠加而成:底座为 Qwen 团队的稠密 27B 模型 Qwen3.8-27B,共 64 层,混合 Gated DeltaNet 线性注意力与门控注意力,原生支持 262,144 tokens;第二层为 ISTA-DASLab 的 Qwen3.8-27B-GSQ-RCO-GGUF,其中 GSQ 按张量学习低比特标量网格,RCO 在固定体积预算下为每个张量分配量化类型,其最小文件 IQ2_XS 为 8.4 GB、每权重 2.50 比特;第三层是 Underdog 自身的处理,将文件压缩至 7.89 GB 并针对工具调用优化,文件名为 IQ2-mix 并带有 imatrix 标签。Underdog 未公布这一层的完整配方。

背景与影响

据该报道,Underdog 将结果分为两组。同环境对比组中,Underdog Bench 的 120 项任务(取自 BFCL v4,测试前冻结,关闭思考、温度 0)Saluki 得 88 分,完整模型 84 分,PrismML 的 Bonsai 2 得 70 分;100 项 BFCL v4 并行工具调用任务中,Saluki 为 42,完整模型为 35;SWE-bench Verified 的 50 个问题中,Saluki 修复 30 个,完整模型 33 个。另一组与公开的完整模型分数对比显示,Saluki 在 IFEval(prompt-loose)为 93.5 对 91.5、IFBench(prompt-loose)为 72.7 对 71.0,但 MBPP+ 为 78.0 对 83.9、MuSR 为 67.5 对 79.6、AIME 2025(avg@4)为 79.2 对 96.7、AIME 2026(avg@4)为 80.0 对 94.6。报道称其 9 项基准平均保留率约 96%,并行工具调用保留率 120%,而 AIME 2025 约为 82%。

与其他紧凑版本相比,Bonsai 2 体积更小(5.95 GB,每权重 1.75 比特),并报告在 14 项思考模式基准上保留 98.2%,数学成绩更强,但需要 PrismML 的 llama.cpp 分支,因为原生 llama.cpp 不接受其打包格式;Saluki 则可在原生 llama.cpp 上运行。报道同时提醒,各厂商使用各自的测试框架,跨厂商分数不可直接比较。

限制与来源

上述性能数字均来自 Underdog 及报道所引用的公开结果,尚未见独立第三方复现,具体表现可能因硬件、运行时版本与提示设置而异。Saluki 的上下文长度与每权重比特数未披露,量化配方亦未公开。模型许可、可用平台与视觉模块等细节,请以 Hugging Face 模型卡及项目官网当前信息为准。本文不构成任何投资或采购建议。

来源:MarkTechPost,原文链接 https://www.marktechpost.com/2026/10/09/meet-the-underdog-saluki-27b-a-2-bit-qwen3-8-27b-that-beats-the-original-at-tool-calling/