训练一个像样的 AI 智能体(Agent),过去有多烧钱?光是搭环境就要投入大量人力:每个实验都要重新克隆仓库、装依赖、跑测试,一次强化学习实验往往要同时跑几千个隔离沙箱。租用托管沙箱服务,账单更是层层加码。8 月 3 日,微软研究院宣布开源 Orchard——一个面向研究社区、可跨任务类型训练和评估 AI 智能体的框架,用官方的话说,它让”小模型也能跑出强劲性能”,同时把最烧钱的环境层成本大幅压低。

Orchard 是什么:智能体训练的”共享基础设施”

Orchard 的核心是 Orchard Env——一个轻量级、Kubernetes 原生的环境服务。它把沙箱管理、命令执行、文件访问、网络控制这些重复性极高的能力,封装成统一的服务,通过 REST API 和 Python 接口对外提供。研究人员只需搭建一次环境,就能在数据生成、强化学习训练、最终评估等多个环节复用,不用再为每个任务重建一套系统。

微软研究院在博客中介绍,Orchard 支持三大任务域,并配套发布了三个”配方”:Orchard-SWE 面向编码智能体,Orchard-GUI 面向浏览器操作智能体,Orchard-Claw 面向个人助理智能体。整套框架采用 MIT 许可证开源,代码托管在 GitHub,训练数据集一并开放。

硬数据:小模型打出了什么成绩

Orchard 最值得关注的是它的性能表现——因为它用的小模型,拿到的成绩却逼近闭源大系统:

  • Orchard-SWE:在 SWE-bench Verified 上达到 69.7%(约 30 亿激活参数的模型),配合价值模型重排后可提升到 73%,逼近参数规模大 10 倍以上的前沿系统;
  • Orchard-GUI:4B 参数的视觉语言模型,仅用 400 条蒸馏演示和 2200 个训练任务,就在 WebVoyager(74.1%)、Online-Mind2Web(67.0%)、DeepShop(64.0%)三个基准上拿到平均 68.4% 的成功率,跻身开源最强浏览器智能体行列;
  • Orchard-Claw:仅用 200 个合成任务训练,在 Claw-Eval 上 pass@3 达到 59.6%,配合更强的 ZeroClaw 系统可达 73.9%。

这些数字背后是一个共同的方法论:环境层和训练数据可以复用,模型就能把”力气”花在真正重要的能力上。Orchard-SWE 的训练数据包含 107,185 条多轮轨迹,覆盖 2788 个代码仓库,其中成功与失败案例都有——失败案例同样有价值,可以用来做奖励建模和失败分析。

成本账:自托管到底能省多少钱

微软研究院在论文中给出了一组成本估算。以 128 个沙箱、每个 2 核 CPU + 8GB 内存、运行 240 小时的工作负载为例:使用 Orchard Env 自托管,按需实例约 3362 美元,使用 spot 实例约 673 美元;而同等负载下,E2B 或 Daytona 约 7078 美元,Modal 约 10305 美元。也就是说,自托管 Orchard 的成本大约是托管服务的三分之一到一半,如果会用 spot 实例,差距更大。

当然,省钱的前提是团队具备运维 Kubernetes 集群的能力——微软研究院也承认,Orchard 是把花在托管服务上的钱,转移到了自运维的工作量上。对已经运行着集群的研究机构和智能体创业公司来说,这笔账是划算的;对完全没有运维能力的团队,门槛依然存在。

另一个信号:环境层正在成为智能体竞争的新焦点

Orchard 的发布还有一层行业意义:智能体领域的竞争,正在从”谁的模型强”延伸到”谁的基础设施成本低”。微软研究院明确表示,希望借助开源,让更多人摆脱对专有云服务的依赖,也让智能体训练经验能够跨代积累——上一轮训练产生的轨迹不再被丢弃,而是蒸馏成可复用的价值模型,让下一代智能体”站在前人的肩膀上”。

对国内开发者和研究团队来说,Orchard 的 MIT 许可意味着可以自由使用、修改和商用。如果你想动手训练自己的智能体,现在去 GitHub 搜 microsoft/Orchard,就能看到完整的部署文档和环境服务代码。

你怎么看”环境层开源”对智能体行业的影响?是成本革命的开始,还是技术门槛换了个地方?评论区聊聊。


数据来源:微软研究院博客《Orchard: An open framework for scalable agentic AI》、GitHub 仓库 microsoft/Orchard(MIT License)、runtimewire 报道(2026-08-04)。