AB
AiBoss
project

FrogNano-4B-2609 - 微软开源的仓库级编码智能体模型

FrogNano-4B-2609 是微软在 Hugging Face 上发布的紧凑型仓库级编码智能体模型,从 Qwen/Qwen3.5-4B 派生,仅用强化学习在约 1500 个合成软件工程任务上做后训练,配合轻量五工具 Leaf harness 完成代码库导航、调试与多文件补丁生成。

FrogNano-4B-2609 是微软发布的一个紧凑型仓库级编码智能体模型。据项目说明,它从 Qwen/Qwen3.5-4B 派生而来,额外的后训练完全采用强化学习,在约 1500 个合成软件工程任务上完成,这些任务由 TaskPilot 生成、验证并针对不断演化的策略进行校准。它面向的是软件工程研究与有人监督的开发场景:给定一份获得授权的仓库快照和一段英文自然语言 issue,模型输出文本与结构化的 Leaf 工具调用,由 Leaf harness 在隔离的仓库环境中执行,最终产出一个候选补丁。适合使用它的,是希望在受控沙箱里研究长程编码智能体、或把补丁生成纳入人工复核流程的开发者与研究者。

维护者与状态

该模型由 microsoft 维护,托管在 Hugging Face 上。仓库创建时间为 2026-09-17,最后更新时间为 2026-10-02。截至 2026-10-10,近 30 天下载量为 1119,点赞数为 139。事实表中未列出正式 release 信息,因此这里不对版本发布情况作额外说明。

主要能力

以下能力均来自项目自述,未经本站实测验证:

  • 仓库级问题解决:根据自然语言任务描述与现有源码,定位并处理仓库级别的软件问题。
  • 代码库导航与跨文件理解:支持跨文件的代码理解、调试、缺陷修复与功能实现。
  • 结构化工具调用:生成 Leaf 工具调用,由 harness 在隔离仓库环境中执行,用于检查与搜索文件、编辑代码、运行 shell 命令以及运行测试。
  • 多文件补丁迭代:借助命令与测试反馈,迭代生成并改进多文件补丁。
  • 长上下文处理:在评估所用的编码智能体配置中,组合上下文长度约为 131K tokens。

据项目说明,FrogNano 的智能体后训练没有使用更强模型的解题轨迹、动作、推理痕迹或补丁目标,这一点与基于行为蒸馏的做法不同。模型架构上,它继承了 Qwen3.5-4B 的稠密 32 层混合 Gated DeltaNet 与门控注意力结构;上游 checkpoint 包含图像与视频输入组件,但项目明确表示未对这些模态做后训练或评估,也不将其列为受支持能力。输入为纯文本,包括自然语言指令、源代码与文本形式的工具输出;输出为文本,包括自然语言回复、推理文本、源代码与结构化工具调用。项目说明中给出的已验证配置允许每个助手回合最多生成 8192 tokens。训练时间标注为 2026 年 6 月至 2026 年 8 月。

使用入口

模型权重、配置文件、tokenizer 资产与模型卡通过 Hugging Face 仓库分发:microsoft/FrogNano-4B-2609。

据项目说明,FrogNano 需要支持 Qwen3.5 架构的推理运行时。上游架构兼容 Hugging Face Transformers、vLLM、SGLang 与 KTransformers,而 FrogNano 文档记录的 rollout 配置使用 GPU 服务器上的 SGLang。在 BF16 下,这个约 46.6 亿参数的 checkpoint 仅模型权重就需要约 9.3 GB,此外还需要为运行时状态、工具调用并发与 KV cache 预留内存;当组合上下文接近约 131K tokens 的评估上限时,内存需求会显著上升。项目说明同时指出,确切的最低 GPU 型号、显存配置、运行时版本与性能画像仍需在发布前进一步验证。仓库智能体集成方面,需要模型 tokenizer 与 chat template、JSON-schema 工具调用解析等组件。

许可与限制

按照事实表,该模型采用 mit 许可证。

项目自述中列出的限制与适用边界包括:

  • 对 harness 与测试质量敏感:性能表现与 Leaf harness、测试质量密切相关。
  • 训练数据偏斜:训练数据以 Python 为主,且主要为英文。
  • 补丁可能不正确或不安全:即便通过了现有测试,生成的补丁仍可能有误或存在安全隐患。
  • 不自行部署:FrogNano 本身不部署变更,Leaf 在隔离环境中执行获授权的工具调用并产出候选补丁;补丁属于提案而非已批准的变更,使用或部署前需要合格的人工复核,以及独立的回归测试与安全验证。
  • 安全对齐范围有限:FrogNano 专属后训练没有使用专门的安全偏好、拒答、有害内容或对抗性数据集,因此不应被视为可独立安全对齐、可用于不受限自主部署的模型。
  • 超出范围的使用:项目未将其设计或评估为通用助手、多模态模型,也不保证代码正确、安全或可直接用于生产。图像与视频使用不受支持。非英文交互、与 Python 为主的训练环境差异较大的仓库、形式化验证、安全关键软件,以及医疗、法律、金融、工业或关键基础设施等高影响应用,均未建立性能表现。它也不适用于直接作用于生产系统、未经授权访问仓库,或让执行 harness 无限制访问凭据、敏感数据、网络或特权基础设施的工作流。
  • 适用场景:项目自述认为它最适合英文、以 Python 为主、环境可复现、任务边界清晰且具备可执行测试套件的仓库,并应在沙箱化的 Leaf harness 或类似受控环境中使用。

需要说明的是,以上能力与限制均来自项目自述,本站没有运行过该项目,也未对其性能、安全性或生成补丁的正确性做过验证。