AB
AiBoss站
project

IQuest-Q1 - 面向智能体编程与多步工具调用的 MoE 文本生成模型

IQuest-Q1 是 IQuestLab 发布在 Hugging Face 上的 MoE 文本生成模型,据项目自述面向智能体编程、推理与多步工具调用。本文整理其维护状态、自述能力、部署入口与许可限制。

IQuest-Q1 是 IQuestLab 发布在 Hugging Face 上的一个文本生成模型,任务类型为 text-generation,基于 transformers 框架。据项目自述,它采用混合专家(MoE)架构,面向智能体编程(agentic coding)、推理以及多步工具调用场景。从定位看,它更适合需要把模型接入命令行智能体、代码助手或工具调用链路的开发者与团队,而不是只想在本地跑一个轻量对话模型的普通用户——因为它的部署方式围绕多卡服务化展开。

维护者与状态

该仓库由 IQuestLab 维护,创建时间为 2026-09-28,最后更新时间为 2026-09-29,两者相隔一天,说明这是一个刚发布不久、仍在早期阶段的项目。截至 2026-10-05,近 30 天下载量为 1047,点赞数为 134。仓库当前没有正式 release,模型以仓库文件形式分发,使用者需要直接从仓库拉取权重。

需要说明的是,事实表中没有给出该项目的版本号、发布说明或更新日志,因此无法判断后续迭代节奏。对于准备在生产环境采用它的团队,建议先关注仓库本身的更新情况。

主要能力

以下内容来自项目自述(README / 模型卡),并非独立评测结论,读者应把它当作维护者的能力声明来看待。

  • MoE 架构与规模:据项目说明,IQuest-Q1 总参数量约 320B,每个 token 激活约 15B 参数。模型共 88 层 Transformer,隐藏维度 3,072,注意力头 Q/KV 为 48/8,头维度 128。
  • 混合注意力模式:项目自述采用 3 层滑动窗口注意力加 1 层全注意力的混合模式,滑动窗口大小为 4,096,部分 RoPE 维度为 32。
  • 专家配置:据 README,专家总数为 256,每个 token 激活 8 个。
  • 多 token 预测(MTP):项目说明中提到训练阶段使用 2 个独立 MTP 层,推理阶段使用 1 个递归层乘以 8,MTP 滑动窗口大小为 512。
  • 长上下文:项目自述上下文长度为 524,288,即 512K。在 Claude Code 的接入说明中,项目方特别注明客户端侧的 IQuest-Q1[1m] 设置不会改变 512K 的上下文上限。
  • 工具调用与智能体集成:据项目说明,模型可通过支持工具调用的网关接入 Claude Code 与 Codex CLI,分别走 Anthropic Messages 与 OpenAI Responses 协议。

项目自述中还给出了推荐的采样参数:temperature 1.0、top-p 0.95、top-k 20,并建议在 Claude Code 2.1.140 或 Codex 0.142 环境下复现。这些是维护者给出的建议值,不是第三方验证结果。

使用入口

模型仓库地址为 IQuest-Q1,权重与说明文档均在该页面。

据项目说明,快速开始的方式是先按部署章节启动服务,然后安装 OpenAI 客户端并调用兼容 OpenAI 的接口:

pip install openai

项目自述给出的调用示例使用 base_url="http://127.0.0.1:8000/v1"、api_key="sk-iquest"、模型名 IQuest-Q1,并通过 client.chat.completions.create 发起对话请求。

在生产部署方面,项目推荐使用 SGLang 或 vLLM,并提供了预构建镜像。据 README,SGLang 路径使用镜像 iquestlabworkspace/sglang-iquest-q1:cu130,启动参数包括 --tp-size 8、--dtype bfloat16、--attention-backend fa3、--mem-fraction-static 0.85,以及 --tool-call-parser iquest_q1 和 --reasoning-parser iquest_q1。vLLM 路径使用镜像 iquestlabworkspace/vllm-iquest-q1:cu130,启动参数包括 --tensor-parallel-size 8、--reasoning-parser iquest_q1、--enable-auto-tool-choice 与 --tool-call-parser iquest_q1。两条路径都分别给出了启用与不启用递归 MTP 的配置。

在智能体接入方面,项目自述建议使用支持工具调用的网关,Claude Code 走 Anthropic Messages,Codex 走 OpenAI Responses。README 中给出了对应的环境变量示例,包括 ANTHROPIC_MODEL、ANTHROPIC_BASE_URL、ANTHROPIC_AUTH_TOKEN 等,以及 Codex 侧的 OPENAI_API_KEY、MODEL_ID、BASE_URL。这些配置会修改本地 ~/.codex 下的文件,项目说明中也提示了先备份原有文件。

许可与限制

该仓库的许可证在事实表中标记为 other,即自定义许可,具体条款以仓库 LICENSE 文件为准。本文不对其是否可商用、可否再分发等作出判断,使用前请自行阅读许可原文。

项目自述中提到的已知限制包括:模型目前不具备多模态能力,因此在智能体对话中遇到多模态内容输入时,项目方的做法是在分词阶段用占位符替换。这意味着涉及图像、音频等输入的任务不在其能力范围内。

硬件与部署方面,从 README 给出的启动参数可以推断,官方推荐的部署方式需要 8 卡张量并行(--tp-size 8 / --tensor-parallel-size 8)以及 bfloat16 精度,属于面向多卡服务器的方案,不适合单卡或消费级设备直接运行。项目自述还提到,CyberGym 评测设置了六小时时限,Terminal-Bench 2.1 设置了八小时时限,这从侧面反映出部分智能体任务耗时较长。

此外,README 中给出的基准测试说明涉及若干第三方模型与内部基准,本文不引用其具体分数,也不做任何横向对比。对于关注实际效果的读者,建议以仓库中公开的评测说明为准,并结合自身任务做验证。