Codex(OpenAI)
产品概述
Codex 是 OpenAI 的云端软件工程智能体平台,面向 100 万+ 开发者。它的核心范式是「托管式派单」:你把一张清晰的工作单描述给 Codex,它在隔离的云端沙箱里读你的代码库、写代码、跑测试、迭代直到测试通过,最后提交 Pull Request。你可以一次派发多个任务、走开,稍后回来审阅多份 diff。
这与「编辑器内补全」的工具(如 Copilot、Cursor)不同——Codex 不是在你打字时给建议,而是把整个任务接过去自主完成。它的模型核心是 GPT-5-Codex,一个在真实软件工程任务上做强化学习微调的 GPT-5 变体,让模型从「自动补全引擎」进化为「能承接多步骤工单的自主工程师」。
发展历程
| 时间 | 事件 |
|---|---|
| 2021 | Codex v1 发布,最初驱动 GitHub Copilot |
| 2025-05 | Codex 重新发布,运行于 codex-1(基于 o3 推理模型微调) |
| 2025-09 | GPT-5-Codex 发布,成为默认模型 |
| 2026-02 | GPT-5.3-Codex / GPT-5.3-Codex-Spark 发布;桌面 App(2 月)上线,含 Xcode 集成 |
| 2026-04 | GPT-5.5(最新旗舰)在 Codex 可用,成为推荐默认 |
核心功能详解
1. 并行云端沙箱
每个任务在安全隔离的云端容器内运行,执行期间互联网访问被禁用,Agent 只能访问你明确提供的代码与预装依赖。这种隔离保证了安全性,也让「并行派单」成为可能——同一时间多个任务在不同沙箱独立推进。
2. 长时间自主执行
GPT-5-Codex 能对单个复杂任务独立工作数小时不丢主线,并动态分配「思考时间」:简单任务快速响应,复杂任务深度推理。这是「把 Agent 当第二工程师用」的能力基础。
3. 多端接入
- CLI:
npm install -g @openai/codex或brew install codex,终端原生,开源(openai/codex)。 - VS Code 插件:官方「Codex - OpenAI’s coding agent」扩展。
- macOS 桌面 App:含 Xcode 集成(面向 Apple 开发者)。
- Web / API:通过 Responses API 或 ChatGPT iOS App 访问。
4. 代码库问答与重构
针对代码库提问获取解答;智能分析代码结构给出重构建议;自动生成单元测试与集成测试。
5. 审查智能体(Reviewer Agent)
新增自动审批审查能力,配合 PR 生成完整说明与测试结果;浏览器内可复现可视化 Bug 并验证修复。
适用场景
有测试套件的自包含任务(最佳场景)
- 带失败测试的 Bug 修复:Agent 有明确的「测试通过」信号可迭代。
- 范围明确的功能新增、依赖升级、重构、补测试覆盖。
批量并行开发
一次派发 5 个独立任务,并行跑完统一审阅——「排队派单、事后审阅」的工作方式。
GitHub 工作流
自动代码审查、自动生成 PR、在 PR 上做 code review。
不适合的场景
- 需求没想清楚的探索性工作、模糊的架构决策。
- 没有测试的代码库——Agent 失去迭代信号,只能产出待审的猜测性 diff。
- 技术债不是「魔法橡皮擦」,无法一键清除。
定价详情
Codex 以 ChatGPT 订阅捆绑方式售卖,档位决定任务量与速度,而非功能差异;CLI 开源免费,直接对接 API 则按 token 计费。
| 档位 | 价格 | 说明 |
|---|---|---|
| ChatGPT Plus | $20/月 | 个人,轻中度任务量 |
| ChatGPT Pro | $200/月 | 重度用户,最大化任务限额 |
| Team | $25/用户/月 | 小团队,共享工作区 + 管理 |
| Enterprise | 定制 | SSO、控制、规模化 |
| API(GPT-5-Codex) | $1.25 / 1M 输入,$10 / 1M 输出 | 400K 上下文,缓存输入 $0.125 |
实际成本测算
- 每天派发几个任务的单人开发者,$20 Plus 足够。
- 把 Codex 当「第二队友」、每天几十个并行任务的工程师,会很快触达限额,需升 $200 Pro——仍远低于一个初级工程师约 $10,000/月的全成本。
定价核验日期:2026-08-13。订阅额度与 API 价格变动频繁,以 OpenAI 官网为准。
技术架构与模型
- GPT-5.5(2026-04):最新旗舰,Codex 推荐默认,适合复杂编码、重构、调试、测试与知识工作产物。
- GPT-5.3-Codex(2026-02):当前稳定主力。
- GPT-5.3-Codex-Spark(2026-02):极速研究预览版。
- GPT-5-Codex(2025-09):Agentic SWE 微调,400K 上下文,支持图像输入,SWE-bench Verified 74.5%。
- codex-mini:轻量快速 CLI 任务。
优势领域
与 Claude Code 的差异
两者在基准上互有胜负(取决于测试 harness),区别在「姿态」:Codex 围绕「交出去就走开」设计(托管、并行、异步),Claude Code 围绕「留在终端循环里」设计(交互、逐步推进)。团队有良好 CI 和清晰仓库约定时,Codex 的并行沙箱模型收益最大。
核心优势
- SWE-bench 领先的自主编码能力。
- 开源 CLI,可脚本化、可集成进自定义流水线。
- 与 GitHub 深度集成(PR 生成、code review)。
短板与限制
- 订阅捆绑:能力绑定 ChatGPT 订阅,重度使用易触达限额。
- 依赖测试信号:无测试、约定混乱的代码库收益骤降。
- 不适合探索:需求未定的探索性工作、模糊架构决策非其强项。
- 国内可访问性:需科学上网,国内直连受限。
使用建议
- 适合:有良好 CI 与清晰仓库约定的团队;需要批量并行处理工单的工程师;希望把重复性 Bug 修复/重构外包给 AI 的开发者。
- 不适合:探索性原型开发;无测试的遗留代码库;需求频繁变动的早期项目。
- 最佳实践:任务描述越清晰、越自包含,效果越好;确保有测试套件给 Agent 提供成功信号;先从小任务建立信任,再逐步放权复杂任务。