🛠️ Codex 工具是什么
Codex 是 OpenAI 开发的 AI 编程代理,2025 年 4 月以命令行工具 Codex CLI 的形式首次亮相,2025 年 5 月 16 日正式以“云端软件工程代理”的研究预览版进入 ChatGPT。需要特别说明的是,它跟 2021 年那个作为 GitHub Copilot 底层模型的同名语言模型完全是两回事——现在的 Codex 是一个面向软件工程工作流的代理式产品,不是代码补全模型。
它的核心定位用一句话概括:你把一个开发任务丢给 Codex,它在自己的沙盒里读代码、改代码、跑测试,然后把改好的东西以 Pull Request 的形式交回来,你审一下决定合不合。不是补全一两行,是替你跑完一个完整的工作流。
它解决的问题是:开发者的时间不应该被消耗在那些“知道怎么做但做起来很烦”的任务上。修个 bug、加个测试、更新依赖、写个文档、重构一段代码——这些任务本身不复杂,但做起来要切来切去、跑测试、等结果。Codex 把这些“有明确终点但需要多步操作”的任务打包成异步工作流,你派发任务,它后台跑,你去做别的事,回头审 PR 就行。
几个事实要先说清楚。Codex 不是一个独立软件,它包含在 ChatGPT 订阅里(Free、Go、Plus、Pro、Business、Enterprise 都有),用 ChatGPT 账号登录就能用。2026 年 4 月推出了代号“Codex for almost everything”的重大更新,让它从纯编程工具往通用电脑工作流 Agent 演变——现在它能操作 macOS 应用、浏览网页、发 Slack 消息、生成图片。但它的核心场景仍然是软件工程,只是边界在扩大。

⚡ 核心功能
- 异步任务委派:这是 Codex 最本质的工作方式。你描述一个任务,它在一个独立的云端沙盒环境里执行——读取仓库、修改文件、运行测试、检查 lint。任务完成后返回一个 Pull Request,里面包含完整的代码变更和测试输出。你不需要一直盯着它,可以并行派发多个任务,做完一个审一个。
- 多代理并行运行:2026 年 4 月的更新让 Codex 支持多个代理同时工作。你可以同时派发“修这个 bug”、“更新那个依赖”、“给这个模块写测试”,它们各自在自己的沙盒里跑,互不干扰。对于批量处理独立任务的团队来说,吞吐量提升明显。
- 后台 Computer Use:2026 年 4 月新增的能力。Codex 可以在后台直接操作 macOS 应用,你继续用你的电脑,它在后台干活。这意味着它能处理那些只能通过桌面 GUI 完成的任务,不只是命令行和代码。
- AGENTS.md 项目规则:你可以在仓库里放一个 AGENTS.md 文件,写明项目的编码规范、测试要求、构建方式。Codex 在执行每一项任务时都会读取并遵循这些规则。这是让 Codex 输出符合团队标准的关键配置,不做的话它只能靠猜。
- Slack / Gmail / Notion 协作工具联动:Codex 可以从这些工具里读取上下文,跟进任务进展。比如你在 Slack 里讨论了一个问题,Codex 能读取相关消息来理解任务背景。
- Codex Security:2026 年 3 月推出,自动做应用安全审查、识别漏洞、提出修复建议。把安全审查从“上线前突击”变成“每次改代码时自动跑一遍”。
- 持久线程与目标模式:Codex 的每个工作线程可以保留上下文,你可以在一个线程里持续跟进一个长期任务。目标模式(Goal Mode)让你定义明确的完成条件(比如“单元测试全部通过”),Codex 会朝着这个目标迭代直到达成。
- 多端接入:ChatGPT 网页版(chatgpt.com/codex)、macOS/Windows 桌面应用、VS Code 扩展、终端 CLI、手机端(通过 ChatGPT App 扫码配对)。你在电脑上派发任务,在手机上审批和跟进,同一个工作流跨设备连续。
✨ 主要亮点与优势
1. “异步队列”的工作模式是真正的差异化。Claude Code 是终端里逐步交互的,Cursor 是编辑器里实时反馈的,Codex 的核心场景是你派发任务,它后台跑,回头审 PR。这个模式适合的是“我知道要做什么,只是不想现在做”的任务。你不需要坐在那里看它写代码,它做完会告诉你。
2. 全能型选手,任务覆盖最均衡。2026 年 MSR 会议的一篇论文分析了 7,156 个真实 PR,对比了 Codex、Claude Code、Cursor、Copilot、Devin 五个代理。Codex 是唯一在全部 9 个任务类别中接受率都在 59.6%-88.6% 之间的——没有明显的短板。fix 和 refactor 任务尤其突出,Bug 修复接受率 83%,重构也是最佳。对比 Claude Code 在测试任务上只有 33.3% 的接受率,Codex 的稳定性优势明显。
3. 包含在 ChatGPT 订阅里,没有单独的 Codex 账单。你不需要为了用 Codex 单独买一个 $20/月的工具。ChatGPT Plus 用户本来就在付 $20/月,Codex 直接用,额度共享。Go 用户 $8/月也能有限度试用。对于已经在用 ChatGPT 的人来说,Codex 是“已经付了钱但可能还没用”的能力。
4. 从编程工具往通用 Agent 的演进速度很快。2025 年 5 月发布时只是编程代理,到 2026 年 4 月已经能操作电脑、浏览网页、发 Slack、生成图片、跑 90+ 插件。OpenAI 的路线图很明确——Codex 正在变成一个“数字员工”,而不只是一个“编程助手”。
🎯 使用场景
Codex 的场景围绕“有明确终点的开发任务”展开。它不是用来做创意探索的,也不是用来写作或设计的。
- 批量 Bug 修复:你有一堆 GitHub issue 标签是 bug,每个都不复杂但数量多。把 issue 派给 Codex,它修完开 PR,你审就行。论文数据显示 Codex 在 fix 任务上的接受率是 83%,是同类工具里最高的。
- 重构与代码迁移:把一段代码从旧模式迁移到新模式、更新 API 调用、统一代码风格。Codex 在 refactor 任务上的表现也是同类最佳。配合 AGENTS.md 写明重构规范,输出质量更稳定。
- 测试覆盖:给现有代码补单元测试。这是 Codex 的强项之一,比 Claude Code 在测试任务上的表现好很多(Codex 测试接受率在 70% 以上,Claude Code 只有 33.3%)。
- 文档更新:代码改了,文档没跟上,或者 API 参考过期了。Codex 读取代码后自动更新文档,开 PR。这类任务几乎零风险,适合让 AI 批量处理。
- 依赖升级:把一个项目从旧版本依赖升级到新版本,跑测试,修兼容性问题。这是典型的“知道怎么做但很烦”的任务,Codex 的异步模式正好匹配。
- 不适用的人群:不写代码的用户(Codex 的核心是软件工程);需要实时交互式补全的开发者(Cursor 或 Copilot 更合适);预算极有限、只想用免费工具的用户(Free 版的 Codex 额度非常受限);需要终端深度交互和逐步控制的高级用户(Claude Code 更灵活)。
📋 如何使用
第一步:找到 Codex 入口
登录 ChatGPT,在左侧工具栏找到 Codex。Free 和 Go 用户也能看到入口,但额度很受限。Plus 及以上用户有实际可用的配额。也可以在 chatgpt.com/codex 直接访问 Web 版,或者下载 macOS/Windows 桌面应用获得更完整的界面。
第二步:设置多因素认证(MFA)
第一次使用 Codex 会要求你设置 MFA。用 Google Authenticator 或 Authy 扫码绑定,输入验证码完成。这一步是强制的,不能跳过。
第三步:连接 GitHub
点击“Connect to GitHub”,授权 OpenAI 的 GitHub 连接器。你可以选择授权所有仓库,也可以只授权特定的几个。授权完成后,你的仓库会出现在 Codex 界面里。
第四步:创建环境并开始任务
选择一个仓库,点击“Create environment”。然后你就可以在对话框里描述任务了。比如“修复 #123 这个 issue”、“给 utils 模块补测试”、“把 React 18 升级到 19”。Codex 会在沙盒里执行,完成后生成一个 PR 供你审阅。
第五步:配置 AGENTS.md(强烈建议)
在仓库根目录创建一个 AGENTS.md 文件,写明:项目用什么语言、怎么跑测试、编码规范是什么、哪些文件不要动。Codex 每次执行任务都会读取这个文件。不配置的话,它只能靠代码本身猜你的规范,输出质量会打折扣。
💡 使用技巧
- AGENTS.md 是 Codex 输出质量的最大杠杆。花 20 分钟写好 AGENTS.md——测试命令、lint 规则、代码风格、禁止事项——比任何提示词技巧都管用。Codex 每个任务都会读它,相当于给 AI 配了一本项目手册。
- 任务描述要包含验收标准。“修复登录 bug”太模糊,“修复登录时邮箱大小写敏感导致的验证失败,需要加单元测试覆盖这个场景”才是 Codex 能高质量执行的任务。论文数据也显示,任务类型对接受率的影响(29 个百分点)远大于代理之间的差异(大多数在 10-20 个百分点)。
- 用“目标模式”定义明确的完成条件。弱目标是“帮我实现这个计划”,强目标是“把这个 Python 工具迁移到 Rust,直到所有单元测试通过”。有验证器的任务,Codex 能自主迭代到达成,没有验证器的任务它不知道什么时候算完成。
- 派发任务前先 Git commit。Codex 会改你的代码。虽然它开的是 PR,但在某些配置下(比如 CLI 模式)它可能直接改本地文件。任务前 commit 一下,不满意可以回退。
- 注意用量消耗,小任务不一定省。有用户反馈,仅仅修改 AGENTS.md 里几行规则,5 小时额度就从 91% 掉到了 89%。Codex 的 credit 消耗跟任务复杂度不完全成正比,有时候一个简单任务的“思考开销”也不小。派发任务时尽量描述清楚,减少它来回试错的次数。
📦 安装方式
| 平台 | 安装方式 |
|---|---|
| Web(ChatGPT 内) | chatgpt.com/codex,无需安装,用 ChatGPT 账号登录即可 |
| macOS 桌面应用 | 2026 年 2 月发布,官网下载 .dmg 安装,提供更完整的多任务管理界面 |
| Windows 桌面应用 | 2026 年 3 月发布,官网下载安装包 |
| VS Code 扩展 | VS Code Marketplace 搜索 “Codex”,安装后在编辑器内使用 |
| 终端 CLI | npm install -g @openai/codex(需 Node.js 22+),或官方脚本安装。注意包名是 @openai/codex,不是 codex |
| iOS / Android | 通过 ChatGPT App 扫码配对桌面版 Codex,在手机上审批和跟进任务 |
| 浏览器插件 | 2026 年 5 月推出 Chrome 扩展 |
一个实际建议:如果你只是想在浏览器里跑几个任务,直接用 Web 版就够了。如果你需要管理多个并行任务、或者想要更完整的文件浏览和 diff 查看体验,装 macOS/Windows 桌面应用。CLI 适合习惯终端工作流的人,但要注意包名别装错。
💰 收费情况
Codex 没有独立的定价——它包含在 ChatGPT 的订阅方案里,用量和 ChatGPT 共享同一个额度池。这意味着你不需要为 Codex 单独付费,但你也无法“只买 Codex 不买 ChatGPT”。
| 方案 | 价格(月付) | Codex 额度 | 适合谁 |
|---|---|---|---|
| Free | $0 | 非常受限,仅够快速体验 | 只想看看 Codex 长什么样 |
| Go | 约 $8/月(区域定价) | 有限度使用 | 轻度试用,预算敏感 |
| Plus | $20/月 | 每周几次专注的编码工作 | 个人开发者日常使用 |
| Pro 5x | $100/月起 | Plus 的 5 倍用量 | 每天做多文件 Agent 工作的重度用户 |
| Pro 20x | $200/月 | Plus 的 20 倍用量 | 并行运行多个 Agent、持续重构的团队 |
| Business | $20/用户/月(年付) | 与 Plus 相同的每席位额度 | 需要集成和管理控制的企业团队 |
| Enterprise / Edu | 定制报价 | 弹性计费,无固定速率限制 | 大型组织 |
几个关键点要留意:额度每 5 小时重置一次,不是每月。Pro 用户还有每周上限,但 2026 年 7 月曾临时移除过 5 小时限制。模型选择直接影响消耗速度——GPT-5.6 Astra 比 Luna 贵得多,用便宜模型能让额度撑更久。用超了可以在不升级方案的情况下单独买 credit,但免费版不能买。
一个实话:如果你每天只跑两三个小任务,Plus 的额度基本够用。但如果你在做大规模的 Agent 工作流——批量修 issue、持续重构、多任务并行——Plus 的额度可能一周内就消耗得差不多了。Pro 5x 的 $100/月对于重度用户来说可能是必须的。API 模式是另一个选项,按 token 计费没有 5 小时窗口限制,适合批量处理或程序化调用,但会失去 GitHub 集成和 Slack 联动。
👥 适用人群
- 开发者/工程师:这是 Codex 最核心的用户群。你每天写代码,有明确的开发任务需要完成,愿意把一部分“有标准答案”的工作交给 AI。Bug 修复、重构、测试、依赖升级这些任务最适合。
- 技术团队负责人:你需要管理一批开发任务,但团队产能有限。把批量的小任务(文档更新、代码风格统一、测试补全)派给 Codex,让人类开发者专注在更需要判断力的工作上。论文数据显示 Codex 的 PR 接受率稳定在 77.9%,对于标准化任务来说这个质量是够用的。
- 已经在用 ChatGPT 的人:你本来就在付 $20/月的 Plus 订阅,Codex 是“已经包含但可能还没用”的能力。不需要额外花钱,值得试一下。
- 初创公司和小团队:预算有限但需要快速迭代。Codex 的异步队列模式让一个人可以“管理”多个开发任务,相当于用 $20/月买了一个初级开发者的部分产能。
- 不适用的人群:不写代码的用户;需要实时交互式补全的开发者(Cursor 或 Copilot 更合适);习惯终端逐步交互控制的高级用户(Claude Code 更灵活);对中国网络环境有硬性要求但无法稳定访问 OpenAI 服务的用户。
🌍 全球使用情况
Codex 在 2025 年 5 月发布后增长迅速。OpenAI 在 2026 年 6 月披露 Codex 的全球周活跃用户超过 500 万。2026 年 4 月时周活跃开发者约 300 万,一个多月内增长了 60% 以上。
亚太地区是增长最快的区域。OpenAI 的 APAC 初创企业负责人 Thomas Jeng 表示,自 2025 年底推出以来,Codex 在该地区的采用率增长了约 17 倍,“我职业生涯中从未见过这样的增长势头”。新加坡已经进入 Codex 全球前五大市场。
印度是 Codex 增长最猛的市场之一。2026 年初以来,印度周活跃用户增长了 27 倍,日交互量增长超过 20 倍。印度目前是 Codex 全球前五大市场之一,前十大参与度市场之一。有意思的是,印度超过 25% 的 Codex 请求是非编程任务——研究、文档、工作流自动化——说明它正在从“编程工具”变成“通用工作流工具”。
在中国市场,Codex 的直接使用受到网络访问限制。国内开发者要稳定使用 Codex 需要解决网络问题,这比 Claude Code 或 Cursor 的门槛更高。实际使用 Codex 的国内用户主要是两类:一是能稳定访问 OpenAI 服务的出海团队和跨境开发者;二是通过 API 中转或企业采购渠道获得访问的团队。中文社区关于 Codex 的系统性教程和实战分享也在增加,但整体规模不如 Copilot 和 Cursor 的中文生态。
⚖️ 优缺点分析
优点
- 全能型选手,任务覆盖最均衡。2026 年 MSR 论文的 7,156 个 PR 分析显示,Codex 是唯一在全部 9 个任务类别中接受率都在 59.6% 以上的代理,fix 和 refactor 尤其突出,Bug 修复接受率 83%。没有明显的短板,适合作为团队的“默认选项”。
- 异步队列模式真正解放时间。你派发任务,它后台跑,回头审 PR。不需要坐在那里看它写代码。配合多代理并行,一个人可以同时管理多个开发任务,吞吐量提升明显。
- 包含在 ChatGPT 订阅里,没有独立成本。Plus 用户不需要额外付费就能用 Codex,额度共享。对于已经在用 ChatGPT 的人来说,这是一个“已经付了钱但可能还没用”的能力。
- AGENTS.md 让输出可预测。你可以在仓库里定义编码规范、测试命令、禁止事项,Codex 每个任务都会遵循。这比其他工具靠提示词“提醒”AI 要可靠得多。
- 从编程工具往通用 Agent 的演进很快。2026 年 4 月以来的更新让 Codex 能操作电脑、浏览网页、联动 Slack/Gmail,边界在持续扩大。OpenAI 的路线图很明确——Codex 正在变成一个通用工作流 Agent。
缺点
- Mac 桌面应用的资源消耗问题严重。多个用户反馈 Codex 桌面应用导致 Mac 系统卡顿,即使关闭应用,问题仍然持续,只有重启才能解决。有用户测算,运行约 21 天后 SSD 写入量达到约 37 TB,一年可能写入约 640 TB,足以在不到 12 个月内消耗掉普通消费级 SSD 的全部写入寿命保修额度。这是硬件层面的真实损伤,不是“体验不好”这么简单。
- 用量消耗不透明,小任务也可能吃掉大量额度。有用户反馈,仅仅修改 AGENTS.md 里几行规则,5 小时额度就从 91% 掉到 89%。更严重的是,当 Codex 产出错误结果时,用户需要消耗更多额度来让它修正或重做,而“错误-修正”的循环成本全部由用户承担。有用户购买了 €20 的额外 credit,在做了少量有用工作后 93 个 credit 就已经消耗完了。
- 需要网络访问,国内使用门槛高。Codex 的核心服务运行在 OpenAI 的云端,国内直接访问不稳定。跟 Cursor(有国内可用的替代方案)或本地部署的 AI 工具相比,Codex 对中国开发者的“可用性”门槛更高。这不是功能问题,是能不能用上的问题。
- Free 和 Go 版的 Codex 额度非常受限。Free 版“仅够快速体验”,Go 版 $8/月也只是“有限度使用”。要真正把 Codex 作为日常开发工具,至少需要 Plus($20/月),重度使用需要 Pro($100/月起)。这个价格门槛对于学生和预算敏感的用户来说不低。
🔄 与同类工具对比
| 维度 | OpenAI Codex | Claude Code | Cursor | GitHub Copilot |
|---|---|---|---|---|
| 核心模式 | 异步任务委派,审 PR | 终端逐步交互 | 编辑器内实时协作 | IDE 内交互 + 云端代理 |
| 价格(个人) | 包含在 ChatGPT 订阅中($20/月起) | $20-100/月 | $20-200/月 | $10/月起 |
| PR 接受率(总体) | 77.9% | 未在论文中对比 | 71.9% | 68.0% |
| Bug 修复接受率 | 83.0% | — | 80.4% | — |
| 测试任务接受率 | ~70%+ | 33.3% | 77.8% | — |
| 并行任务 | ✅ 多代理并行 | 有限 | 有限 | ✅ 云端代理 |
| 终端原生 | ✅(CLI) | ✅(核心形态) | ❌ | 有限 |
| 国内可用性 | 需网络环境 | 需网络环境 | 需网络环境 | 相对稳定 |
| 最适合谁 | 异步队列、批量任务 | 终端深度交互 | 编辑器内实时工作流 | GitHub 原生团队 |
跟 Claude Code 的对比值得多说一句。两者都是终端优先的 AI 编程工具,但工作模式完全不同。Claude Code 是逐步交互的——你在终端里看着它执行,每一步都可以介入和调整。Codex 是异步队列的——你派发任务,它自己跑,回头审 PR。选哪个取决于你的工作习惯:如果你想“盯着它干活,随时叫停”,Claude Code 更合适;如果你想“派活给它,回头收货”,Codex 更对路。论文数据也显示,Claude Code 在功能开发(72.6%)和文档任务(92.3%)上表现更好,但测试任务接受率只有 33.3%,是明显的短板。
跟 Cursor 的对比:Cursor 是编辑器内的实时协作工具,你写代码的时候它在旁边辅助。Codex 是异步任务代理,你不需要一直坐在编辑器前。如果你习惯“边写边改,实时反馈”,Cursor 的体验更好。如果你要处理的是“我知道要改什么,但不想现在动手”的任务,Codex 的异步模式更省心。价格上 Cursor 起步 $20/月,Codex 包含在 ChatGPT 订阅里(也是 $20/月起),但如果你已经在用 ChatGPT,Codex 相当于“不加钱”。
跟 GitHub Copilot 的对比:两者都走云端异步代理的路线,但 Codex 的 PR 接受率更高(77.9% vs 68.0%)。Copilot 的优势在于深度绑定 GitHub 工作流——issue、PR、CI 全部原生集成,权限和分支策略可以直接复用。如果你的团队一切都在 GitHub 上,Copilot 的集成摩擦更小。如果你更看重输出质量而不是集成度,Codex 的数据更好看。
📝 总结:值不值得用
明确结论:如果你已经在用 ChatGPT Plus 或更高级的订阅,Codex 是“已经付了钱但可能还没用”的能力,值得试。如果你需要的是一个异步任务代理来处理批量开发工作,Codex 是目前同类工具里任务覆盖最均衡、PR 接受率最高的选择之一。如果你需要的是终端里逐步控制的深度交互,Claude Code 更合适。
Codex 的核心价值不在“AI 能写代码”——现在所有工具都能做。它的价值在于它改变了你使用 AI 的方式:从“坐在那里跟 AI 对话”变成“派发任务然后去做别的事”。异步队列的模式配合多代理并行,让一个人可以管理多个开发任务,相当于把 AI 从“结对编程的搭档”变成了“带一组实习生的工头”。MSR 论文的数据也支持这一点——在标准化任务上(Bug 修复、重构、测试、文档),Codex 的 PR 接受率稳定在 77.9%,是五个代理里唯一没有明显短板的。
什么时候值得用:你已经是 ChatGPT Plus/Pro 用户(不加钱就能用);你的团队有批量的标准化开发任务(Bug 修复、依赖升级、测试补全、文档更新);你习惯“派活-收货”的工作模式而不是“实时盯着 AI 写代码”;你需要一个在多个任务类型上都表现稳定的代理,不想为不同任务换不同工具。这些情况下,Codex 的异步队列模式能真实提升你的吞吐量。
什么时候不推荐:你不用 ChatGPT,也不打算为它付 $20/月(Codex 没有独立版本);你习惯终端逐步交互,需要随时介入和调整(Claude Code 更合适);你对 Mac 桌面应用的资源消耗问题非常敏感(目前有真实的 SSD 磨损和系统卡顿反馈);你在国内,无法稳定访问 OpenAI 服务;你只需要简单的代码补全(Copilot 更轻、更便宜)。
说得直白一点:Codex 是一个“为异步开发工作流设计的 AI 代理”,不是一把万能钥匙,也不是一个必须拥有的工具。它做的事情很专一——把“有明确终点的开发任务”自动化掉。如果你恰好有这个问题,而且已经在 ChatGPT 的生态里,它是目前最值得试的选项之一。如果你不在这个场景里,它就是一个需要 $20/月起步的额外工具,不如先用 Copilot 或 Cursor 看看自己到底需要什么。用之前建议先想清楚一个问题:你的日常工作里,有多少任务是“我知道怎么做但不想现在做”的?如果这个比例超过 30%,Codex 的异步模式可能真的能帮你省时间。

评论