AB
AiBoss站
project

Orchard - 微软研究院开源的 Agentic AI 建模框架

Orchard 是微软研究院推出的开源 Agentic AI 建模框架,核心为基于 Kubernetes 的 Orchard Env 环境服务,支持跨域复用沙箱进行数据蒸馏、强化学习 rollout ...

Orchard是什么

Orchard 是微软研究院推出的开源 Agentic AI 建模框架,核心为基于 Kubernetes 的 Orchard Env 环境服务,支持跨域复用沙箱进行数据蒸馏、强化学习 rollout 与评估。框架已覆盖软件工程、浏览器导航和个人助理三大场景,并开源了训练数据与评估方法。

Orchard的主要功能

  • 跨域统一环境服务: Orchard Env 提供沙箱生命周期管理、命令执行、文件 I/O、网络策略与 REST API,一套基础设施可支撑代码、网页、桌面、移动端及生产力工作流。
  • 三大领域训练配方: Orchard-SWE 专攻代码修复,Orchard-GUI 处理视觉网页导航,Orchard-Claw 面向邮件、日历等日常生产力任务,均提供完整的 SFT + RL 训练流水线。
  • 真实 Harness 内训练: 支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中完成端到端训练与评估,消除训练环境与部署环境之间的错配。
  • 开源数据集与评估协议: 释放 107K 条 SWE 轨迹与 3,070 条 GUI 多模态 rollout 数据,以及对应的评测基准与可复现配方。

Orchard的技术原理

  • Kubernetes-native 环境层: Orchard Env 作为独立服务运行,通过容器编排实现数千个隔离沙箱的并行创建与销毁,平均命令执行延迟仅 0.28 秒,支持自动扩缩容与 Redis 分布式锁。
  • Credit-Assignment SFT: 在软件工程领域,系统不丢弃部分失败的轨迹,而是从有效片段中提取监督信号,将可用训练数据量最大化。
  • Balanced Adaptive Rollout + 密集奖励: 针对 RL 稀疏反馈问题,采用平衡自适应 rollout 捕获稀少成功信号,并引入 on-policy 蒸馏与基于规则的流程奖励模型,为中间步骤提供密集指导。
  • Value Model 重排序: 利用 20 次历史实验的 rollout 轨迹训练 4B 参数价值模型,在推理阶段对多个候选解进行评分并选取最优,将 Orchard-SWE 从 69.7% 提升至 73.0%。
  • Harness-Agnostic 代理记录: 轻量级代理记录 harness 自身的模型调用并重构为训练样本,使任何 RL 代码库均可对接任何 harness,无需修改环境镜像。

微信关注回复“开源”,加入AI开源项目交流群

如何使用Orchard

  • 安装 SDK: 执行 pip install -e "orchard_env[dev]" 安装 Python SDK,配置 SANDBOX_BASE_URLSANDBOX_API_KEY 环境变量。
  • 快速调用沙箱: 使用 SandboxClient 上下文管理器创建沙箱并执行命令,支持同步与异步模式、文件读写、git patch 应用及 PTY 会话。
  • 部署编排器: 通过 Azure AKS 提供的四个脚本(provision、build、deploy、smoke-test)约 20 分钟即可完成多副本编排器部署,也支持非 Azure 集群。
  • 运行训练配方: 参照 GitHub 仓库中的 trainer/slime/ 目录,在 Orchard Env 上执行 Orchard-SWE、Orchard-GUI 或 Orchard-Claw 的完整 SFT + RL 训练流程。

Orchard的核心优势

  • 小模型逼近大模型性能: Orchard-SWE 用约 3B 活跃参数在 SWE-bench Verified 上达到 73.0%,接近参数量 10 倍以上的前沿系统;Orchard-GUI 以 4B 参数在三大网页基准平均达到 68.4%,媲美 OpenAI CUA 与 Gemini CUA。
  • 成本显著降低: 相比 E2B、Daytona 等托管沙箱服务,Orchard Env 按需成本约为 0.47 倍,Spot 实例成本仅为 0.10 倍,约 10 倍价差。
  • 跨 Harness 泛化能力强: 同一环境层支持 ReACT、ZeroClaw、OpenClaw、Codex 等多种 harness,Orchard-Claw 在 ZeroClaw 下 pass@3 从 59.6% 提升至 73.9%。
  • 训练数据高效: Orchard-GUI 仅用 400 条蒸馏演示与 2,200 条开放任务即达到开源最强网页 Agent 水平,证明小数据量配合正确环境即可训练出高能力模型。

Orchard的项目地址

  • 项目官网:https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
  • GitHub仓库:https://github.com/microsoft/Orchard
  • HuggingFace模型库:https://huggingface.co/datasets/microsoft/Orchard
  • arXiv技术论文:https://arxiv.org/pdf/2605.15040

Orchard的同类竞品对比

维度 Orchard OpenHands
定位 微软开源的跨域 Agentic 建模框架,覆盖代码、网页、生产力三大场景 开源社区主导的软件工程 Agent,专注代码库修复与开发任务
环境层 自研 Kubernetes-native 通用环境服务(Orchard Env),一套基础设施跨域复用 依赖 Docker 容器化环境,针对代码任务定制,难以直接迁移到网页或桌面场景
训练能力 内置完整 SFT + RL 训练流水线,支持在 Codex、OpenClaw 等真实 harness 内直接训练 主要提供推理与执行框架,训练流水线需自行搭建,通常在简化环境中进行
数据开源 开源 107K 条 SWE 轨迹、3,070 条 GUI 多模态 rollout 及完整评估协议 开源代码与部分评测结果,但大规模训练轨迹数据集未完整公开
模型效率 3B–35B 活跃参数即可在 SWE-bench 达到 73.0%,接近 10 倍参数量前沿模型 通常依赖 70B 级模型或 GPT-4 等商业 API 才能达到相近的 SWE-bench 成绩
成本结构 自托管沙箱成本约为商业服务的 10%–50%,支持 Spot 实例大幅降低训练开销 主要依赖云服务器或商业 API,成本随模型规模与调用量线性增长
Harness 支持 原生支持 ReACT、ZeroClaw、OpenClaw、Codex 等多种 harness 无缝切换 主要围绕自身 harness 设计,切换外部 harness 需额外适配

Orchard的应用场景

  • 自动化软件工程: 在真实代码库中自主诊断 Bug、编写测试、生成补丁并通过验证,适用于开源项目维护与企业内部代码审查。
  • 智能网页导航: 基于视觉理解自动操作浏览器完成订票、购物、信息检索等开放域任务,可作为 RPA 替代方案。
  • 个人生产力助手: 跨邮件、日历、文档等工具执行复杂工作流,如自动安排会议、整理收件箱、生成报告。
  • Agent 研究基础设施: 为学术与工业研究团队提供可复现、低成本的 Agent 训练与评估平台,加速开源 Agentic AI 生态建设。
  • 跨域 Agent 能力迁移: 用统一环境层探索代码、网页、桌面操作之间的技能迁移与累积学习。