AI 资讯产品发布 · 更新于 2026年8月28日 · 5 分钟阅读

OpenAI 开源 Codex Harness:执行框架比模型更值钱?

OpenAI 开源 Codex Harness:执行框架比模型更值钱?

「模型没换、得分翻了快 3 倍」——这句话在 AI 圈炸开,靠的不是新模型,而是一次开源。8 月 20 日,OpenAI 把自己智能体产品 Codex 的底层执行框架 Harness 全面开源了,代码挂在 GitHub 上,许可证 Apache-2.0,任何人可以拿去用、改、甚至放进自己的产品里。仓库目前已经积累了超过 10 万 star,成了最近一周开源圈最火的项目之一。

为什么要关注这件事?因为 OpenAI 用一组数据把行业的一个认知直接颠覆了:同一颗模型(GPT-5.6 Sol),只调整了执行框架里的两项能力——保留推理状态和上下文压缩,在 ARC-AGI-3 这个号称「最难」的推理基准上,得分从 13.3% 直接冲到 38.3%,接近 3 倍提升,同时输出 token 降到原来的六分之一。也就是说,模型的「智商」一点没变,只是换了个更聪明的「身体」,结果判若两人。

这对普通人的意义很直接:过去我们总以为 AI 好不好用全看模型大不大、参数多不多,而这次开源告诉你——把 AI 用起来的「执行系统」,可能比模型本身更值钱。这篇文章就把这次开源拆开讲清楚:开源了什么、数据意味着什么、以及它为什么是 AI 行业的一个分水岭。

一、OpenAI 这次到底开源了什么

先说结论:开源的不是模型,而是「跑模型的那套机器」。Codex 是 OpenAI 的 AI 编程智能体,你给它一个需求,它自己写代码、跑命令、改文件。这套东西能干活,靠的不只是背后的大模型,还有一层被叫做「Harness(执行框架)」的软件系统。

这次开源的就是这层系统,它由三大部分组成:

第一,codex-rs 核心执行引擎。这是整个框架的心脏,用 Rust 语言编写,负责管理对话状态、调度工具调用、隔离沙箱环境、处理审批策略。简单说,Agent 的「大脑」是模型,「身体」就是这一层——它决定 Agent 怎么理解任务、怎么记住上下文、怎么调用工具、怎么在人需要把关的时候停下来问一句。

第二,codex exec 命令行工具。它让你可以在终端里、在 CI/CD 流水线里、在脚本里一次性跑完一个任务,适合自动化场景。比如「重构一下某个函数并加错误处理」这种活儿,一行命令丢给它就行。

第三,官方 SDK 与 app-server。TypeScript 和 Python 两套官方 SDK,让开发者可以在自己的应用里启动、恢复、流式获取 Codex 任务;app-server 则暴露了一个 JSON-RPC 协议,负责长期会话的状态保持和事件推送——你现在在 IDE 插件里看到 Codex 的进度条、审批弹窗,底层走的就是这个协议。

值得注意的是,OpenAI 仓库里的很多代码其实早在 2025 年就在了,Apache-2.0 协议也不是今天才挂上的。这次真正的变化是:OpenAI 把「读代码自己琢磨」升级成了「官方支持你基于它做产品」——SDK 转正、协议文档化、明确邀请第三方来构建。这是一个信号:OpenAI 想把 Codex 的执行框架变成行业默认的「Agent 底座」。

二、13.3% 到 38.3%:这个数据为什么震撼

这次发布里最抓眼球的是那组 ARC-AGI-3 数据。ARC-AGI-3 是一个专门测「类人推理」的基准,被很多团队认为是当前最难的大模型评测之一。OpenAI 给出的对照是:同一颗 GPT-5.6 Sol 模型,什么都不改,只动 Harness 层的「保留推理状态」和「上下文压缩」两项,得分就从 13.3% 涨到 38.3%,翻了近 3 倍,输出 token 反而只有原来的六分之一。

这说明什么?说明长任务的 Agent 出问题,很多时候不是模型「不够聪明」,而是「上下文在运行两小时后散架了」——记不住前面干了什么、推理过程被截断、对话越来越长越来越乱。执行框架解决的就是这些「运行时的脏活累活」。

这套逻辑放到现实里,最典型的例子就是:同一个模型在 A 平台跑得很顺、在 B 平台频繁出错,用户往往以为是平台「用了假模型」,其实多半是执行框架的差距。模型负责「想」,框架负责「把想的东西变成结果」——后者做得怎么样,直接决定体验。

三、为什么说这是行业分水岭

第一,AI 竞争的主战场正在从「模型层」挪向「执行层」。过去一年,各家卷的是参数、跑分、上下文长度;而 OpenAI 这次用一组数据证明,执行系统的优化空间可能比模型升级还大。当模型能力拉不开差距的时候,谁能把 Agent 用得又稳又省,谁就赢了。

第二,OpenAI 在下一盘「平台棋」。把执行框架免费开源、SDK 转正、协议文档化,本质上是在说:你们尽管基于我的底座做产品,流量和模型调用自然就流到我这里。这被业内解读为「免费送管道、收费卖水」的打法——先让开发者在生态里长起来,再通过模型 API 变现。

第三,对开发者和副业党的直接利好。以前想在产品里嵌一个能自己干活、能审批、能流式输出的 Agent,得从零搭一套执行系统;现在直接基于开源框架起步,省掉大量重复造轮子的时间。对想用 AI 做自动化产品、接企业定制单的团队来说,门槛实实在在降了一截。

四、普通人怎么理解这件事

如果你不是开发者,这篇新闻对你最大的价值是更新一个认知:AI 好不好用,模型只占一半,另一半是「怎么用它」

以后你选 AI 工具、看 AI 产品的评测,除了看「用了什么模型」,还可以多问一句「它的执行系统怎么样」——同一个模型在不同产品里表现天差地别,原因往往就在这层看不见的框架上。这也是「AI 智习室」一直强调的:看懂 AI,先看懂它干活的那套机制,而不只是看参数。

这次开源把 AI 行业的「军备竞赛」从拼模型拉进了拼执行的新阶段。接下来值得观察的是:谁能把这套开源框架真正用起来,做出稳定、省钱的 Agent 产品——那才是普通人能实实在在用上的红利。

· · · · ·

关注「AI 智习室」,每天一条看得懂的 AI 情报。

游客头像

龙主编

龙主编,AI智习室官方媒体主编。 专注 AI 行业观察与实操分享,擅长将复杂技术转化为通俗易懂的实战指南。 坚信 AI 不是取代人类,而是赋能每个人。 内容风格: 真实案例 + 详细干货 + 可操作性 使命: 让普通人也能抓住 AI 时代的红利。

发表评论