一、开源的不只是代码,而是Agent的“中枢神经”
2026年8月21日,OpenAI悄然做出一项比发布新模型更具战略意义的动作:将驱动Codex智能体的底层框架Codex Harness,以Apache-2.0协议全面开源。当外界还在为模型榜单上的分数争执不休时,真正的战场已经转移——从“谁更聪明”变成了“谁能把聪明稳定地嵌入真实工作流”。
OpenAI用一组硬数据直接宣告了这一转变:在ARC-AGI-3基准测试中,同一款GPT-5.6 Sol模型,仅调整Harness的推理与上下文压缩配置,得分就从13.3%飙升至38.3%,输出Token反而缩减至原来的六分之一。模型没变,变的是驾驭模型的方式。这足以说明,Agent的表现不仅取决于模型本身,更取决于其运行时的工程架构。
过去两年,行业沉迷于“模型军备竞赛”——参数更大、榜单更高、价格更低。但Codex Harness的开源,像一记重锤敲醒了所有人:模型正在商品化,而“怎么用好模型”的运行时框架,正在成为新的护城河。
二、Harness到底是什么?五个能力撑起Agent的“身体”
很多人对Codex的印象还停留在IDE里的代码补全,但Harness完全是另一个层面的东西。它是Codex背后的Agent运行时环境——连接模型、用户与工具,管理任务执行、上下文、会话和代码操作的完整框架。它回答的是一个底层问题:当一个AI要独立干活时,它的“身体”长什么样?
Harness的核心能力可以拆解为五块:一是Agent Loop,让模型理解任务、规划步骤、执行工具、读取反馈,在循环中持续推进目标;二是线程生命周期与持久化,让长时间任务不会“失忆”,状态可恢复、可断点续作;三是工具执行与扩展机制,通过MCP调用外部系统,把业务能力无缝交给Agent;四是配置、认证与安全边界,让宿主应用控制Agent能访问什么、能执行什么;五是Human-in-the-loop,关键操作自动暂停,等待人类审批后再继续。
这五个能力组合在一起,解决了一个长期被忽视的问题:大模型很强,但把它放进真实业务系统里,需要一整套工程基础设施。Codex Harness就是这套基础设施的参考实现。OpenAI将其开源,等于把自家顶级Agent的“骨架和神经系统”公之于众。值得注意的是,这次开源并非象征性扔出几段代码,而是完整释放了三个可直接用于生产的组件:命令行Agent流水线codex exec、支持TypeScript和Python的Codex SDK,以及通过双向JSON-RPC协议连接应用的Codex App Server。三者组合起来,实际上提供了一套“Agent即平台”的参考架构:你的前端归你,你的数据归你,你的审批流程归你;底层的Agent循环、记忆、工具调用、失败恢复,交给Harness。
三、开源背后的算盘:反套壳、进企业、卡位Harness层
OpenAI这次开源的商业意图非常清晰。它想做的不是卖一个更好的代码助手,而是成为Agent时代的底层基础设施。官方博客直言:与其让每个团队把业务流程塞进通用代码助手,不如把Agent带进围绕真实工作设计的软件里。安全分析师看告警队列,产品经理看需求看板——界面本身就是最重要的上下文。Harness让开发者保留自己的界面,只把Agent当引擎用,这无疑是对“套壳聊天框”模式的一次釜底抽薪。
在企业级落地方面,Harness把控制权交还给宿主应用:企业可以决定Agent在哪里运行、能访问什么、哪些危险操作必须人工放行。前端业务规则归你,底层Agent循环归OpenAI——这个分工是企业级落地的关键。而更值得玩味的是时间点:8月13日DeepSeek Harness刚刚开源,8天后OpenAI就带着Codex Harness跟进。两者定位相似但路线不同:Codex Harness强调嵌入自有产品,DeepSeek Harness强调多模型调度,把Claude Code和Codex收编成子代理。Agent底座层的卡位战已经打响。
我的判断是,OpenAI选择开源,是因为它比任何人都清楚:如果Agent运行层被竞争对手占据,模型层的优势会被稀释。与其让别人定义规则,不如自己先把规则公开。这是典型的“开源抢标准”打法——就像安卓之于移动互联网,Codex Harness想成为Agent时代的默认操作系统。
四、Harness时代:开发者的价值从“写代码”转向“设计任务结构”
如果只看表面,AI编程赛道最近热闹非凡:Cursor推出Origin、Warp发布Factories、Replit联手OpenAI、Claude Platform上线Computer Use……但这些事件的共同主线只有一个:AI正在从“聊天框时代”和“副驾驶时代”进入“Harness时代”——AI成为业务系统的执行引擎,人类负责目标和把关。Relay物流看板的官方演示很能说明问题:用户选中延误货单,点击“比较恢复方案”,Harness自动把货单详情、物流数据作为上下文喂给Agent,调用MCP工具获取实时数据,分析出最优重新订舱方案,弹出审批框等待人类确认,最后刷新看板。整个过程没有聊天框,但AI无处不在。
对开发者个人而言,Harness开源后最直接的体感是:AI离“独立执行复杂任务”又近了一大步。“写代码”仍然有价值,但价值会从“写出每一行”转向“设计Harness能正确执行的任务结构”。未来的核心竞争力不再是“我能写多少行代码”,而是“我能不能把业务目标拆成Agent可执行的子任务和工具链”;不再是“我熟悉多少框架”,而是“我能不能设计安全边界、审批节点和失败恢复机制”。当Harness负责记忆、循环、工具调用和状态恢复时,人的价值就集中在三件事上:定义正确的问题、设计合理的边界、判断产出的质量。
更宏观地看,2026年8月的这一连串事件——OpenAI开源Codex Harness、DeepSeek Harness一周三更、NVIDIA AVO用Harness拿下ARC-AGI-3满分、Cursor用Origin重写代码托管——它们的交集不是模型,而是Agent的运行时基础设施。当模型差距缩小,胜负就取决于谁能把模型稳定、安全、低成本地嵌入真实工作流。Greg Brockman说“Codex能驱动的远不止编程工具”,这句话的潜台词是:Codex的终点不是写代码,而是成为通用Agent的运行时。对开发者来说,这意味着一个巨大的机会:你不再需要从头造一个Agent引擎,只需要把Harness嵌入自己的业务系统,就能做出过去只有巨头才能做的原生AI应用。而对整个行业来说,这意味着AI竞争的焦点,正在从“谁有更聪明的模型”转向“谁能定义Agent怎么工作”。
