Codex底座开源,AI胜负手转向工程

Codex中文版一键安装,送1000万token,国内大模型

8月20日,OpenAI将驱动Codex的底层执行系统以Apache-2.0协议完整开源。八天前,DeepSeek刚开放了自己的Harness。两件事放在一起,AI圈真正该关注的不是又多了两个模型仓库,而是Agent的竞争重心正在从“大脑”移向“骨架”。

所谓Harness,直译是马具,在Agent架构里指模型外面的执行层。模型负责推理,Harness负责读文件、调用工具、管理记忆、故障恢复、拦截危险操作。没有它,模型只是会思考的聊天框。

这次开源的,是一套能跑业务的Agent骨架

openai/codex仓库最新提交停在8月22日,累计9684次提交、4626条分支。它已经滚动迭代超过一年,至今仍在高频更新,不是发布会演示品。开源组件有三个:codex exec是轻量命令行工具,适合挂进自动化流水线;SDK提供TypeScript和Python两套编程接口;最值得关注的是app-server,它通过JSON-RPC协议让外部软件直接接入AI引擎,获得持久对话、实时事件流、中途打断、人工审批等能力。一句话概括:业务界面和数据留在你手里,AI循环交给引擎。

我特别关注app-server。它意味着企业可以把AI嵌进现有业务系统,而不是把用户拽进聊天框。税务机构Thrive Holdings用这套底座处理了7000份申报表,准备时间缩短三分之一;思科搭出App Builder,用户用自然语言创建云应用。这些场景里没有ChatGPT式对话框,AI藏在业务界面后面干活。

仓库里还有几个细节比发布会更说明问题。MCP协议依赖已升到3.1.3,说明外部工具兼容是被认真维护的;安全设计分V8沙箱、执行策略、进程加固,Linux和Windows各有一套;文档明确写着不接受外部代码贡献和Pull Request。这三点放在一起,是一个“企业级发动机”的完整画像。

同一模型,得分从13.3%到38.3%

OpenAI官方博客给出一组反直觉数据:在ARC-AGI-3基准上,模型不变,只对Harness做保留推理和上下文压缩两项调整,GPT-5.6 Sol得分从13.3%升至38.3%,输出Token还省了六倍。

这直接冲击了“模型为王”的默认叙事。同样的大脑,换一副骨架,成绩相差近三倍。它等于OpenAI自己承认:Agent上限更多由执行系统设计决定,而非模型参数。把这样一套底座开源,让全球开发者来用、来提issue,是划算的生态策略——OpenAI保住架构主导权,同时获得大量真实场景的反馈。

两条路线:插件生态与整体引擎

八天内两家顶级玩家接连开放Agent底座,不是巧合。但路线截然不同。DeepSeek选择的是插件生态路线,模型、工具、界面、存储、安全策略全部可插拔。社区增长惊人,开源半小时星数破万,截至8月20日dsh-plugin标签仓库超2600个,Oh-My-DSH收录1117个插件。有dsh-agent-teams、OpenViking这样的产品级组件,也有大量电子宠物、俄罗斯方块等玩具。社区繁荣,但质量参差。

OpenAI Codex Harness更像一台整体式引擎:不拆开,装进自己的车。它在企业级深挖,记忆系统读写分离、两阶段提取,安全层层设防。但最硬的一条限制是:不接受外部代码贡献和Pull Request,社区只能提issue。

这引发了“不接受外部PR,还能叫开源吗”的争论。支持者认为Apache-2.0在手,代码可运行、可修改、可商用;反对者认为只开放代码不开放治理,等于给图纸但不给车间。两边都有道理。对实用主义者,拉代码就能用;对想长期共建的人,这是天花板。

我更在意另一层:工具门槛被抹平,套壳模式的最后一块遮羞布也没了。过去两年,太多产品拿现成模型包个聊天框就自称AI应用,护城河越来越浅。现在两套顶级底座免费开放,竞争门槛还在,只是从接口对接能力,换成了业务理解能力。拿到发动机图纸的人,未必会看说明书。

谁该动手,谁该观望

如果你在一家有自己业务系统的公司,管着CRM、工单、内部工具,现在就可以把app-server拉下来研究。界面和数据留在自己手里,AI循环交给引擎,这正是它最对口的场景。如果你是独立开发者,DeepSeek的插件生态路线更顺手,2600个插件摆在那儿,组装成本低。如果你只是个人用户,两家都先别碰,日常需求用现成AI助手就能解决。

最后说判断。8天内两套顶级底座相继免费,标志着AI工具竞争进入下半场。上半场拼模型参数,下半场拼业务场景。工具可以免费,认知不会自动变现。对普通人,心法只有一句:不要先问哪个AI最强,而要问自己公司哪个流程最值得被AI重做一遍。