AI Agent 百科
8推荐指数
7性价比
满分 10 分

Codex(OpenAI)

产品概述

Codex 是 OpenAI 的云端软件工程智能体平台,面向 100 万+ 开发者。它的核心范式是「托管式派单」:你把一张清晰的工作单描述给 Codex,它在隔离的云端沙箱里读你的代码库、写代码、跑测试、迭代直到测试通过,最后提交 Pull Request。你可以一次派发多个任务、走开,稍后回来审阅多份 diff。

这与「编辑器内补全」的工具(如 Copilot、Cursor)不同——Codex 不是在你打字时给建议,而是把整个任务接过去自主完成。它的模型核心是 GPT-5-Codex,一个在真实软件工程任务上做强化学习微调的 GPT-5 变体,让模型从「自动补全引擎」进化为「能承接多步骤工单的自主工程师」。

发展历程

时间 事件
2021 Codex v1 发布,最初驱动 GitHub Copilot
2025-05 Codex 重新发布,运行于 codex-1(基于 o3 推理模型微调)
2025-09 GPT-5-Codex 发布,成为默认模型
2026-02 GPT-5.3-Codex / GPT-5.3-Codex-Spark 发布;桌面 App(2 月)上线,含 Xcode 集成
2026-04 GPT-5.5(最新旗舰)在 Codex 可用,成为推荐默认

核心功能详解

1. 并行云端沙箱

每个任务在安全隔离的云端容器内运行,执行期间互联网访问被禁用,Agent 只能访问你明确提供的代码与预装依赖。这种隔离保证了安全性,也让「并行派单」成为可能——同一时间多个任务在不同沙箱独立推进。

2. 长时间自主执行

GPT-5-Codex 能对单个复杂任务独立工作数小时不丢主线,并动态分配「思考时间」:简单任务快速响应,复杂任务深度推理。这是「把 Agent 当第二工程师用」的能力基础。

3. 多端接入

  • CLInpm install -g @openai/codexbrew install codex,终端原生,开源(openai/codex)。
  • VS Code 插件:官方「Codex - OpenAI’s coding agent」扩展。
  • macOS 桌面 App:含 Xcode 集成(面向 Apple 开发者)。
  • Web / API:通过 Responses API 或 ChatGPT iOS App 访问。

4. 代码库问答与重构

针对代码库提问获取解答;智能分析代码结构给出重构建议;自动生成单元测试与集成测试。

5. 审查智能体(Reviewer Agent)

新增自动审批审查能力,配合 PR 生成完整说明与测试结果;浏览器内可复现可视化 Bug 并验证修复。

适用场景

有测试套件的自包含任务(最佳场景)

  • 带失败测试的 Bug 修复:Agent 有明确的「测试通过」信号可迭代。
  • 范围明确的功能新增、依赖升级、重构、补测试覆盖。

批量并行开发

一次派发 5 个独立任务,并行跑完统一审阅——「排队派单、事后审阅」的工作方式。

GitHub 工作流

自动代码审查、自动生成 PR、在 PR 上做 code review。

不适合的场景

  • 需求没想清楚的探索性工作、模糊的架构决策。
  • 没有测试的代码库——Agent 失去迭代信号,只能产出待审的猜测性 diff。
  • 技术债不是「魔法橡皮擦」,无法一键清除。

定价详情

Codex 以 ChatGPT 订阅捆绑方式售卖,档位决定任务量与速度,而非功能差异;CLI 开源免费,直接对接 API 则按 token 计费。

档位 价格 说明
ChatGPT Plus $20/月 个人,轻中度任务量
ChatGPT Pro $200/月 重度用户,最大化任务限额
Team $25/用户/月 小团队,共享工作区 + 管理
Enterprise 定制 SSO、控制、规模化
API(GPT-5-Codex) $1.25 / 1M 输入,$10 / 1M 输出 400K 上下文,缓存输入 $0.125

实际成本测算

  • 每天派发几个任务的单人开发者,$20 Plus 足够。
  • 把 Codex 当「第二队友」、每天几十个并行任务的工程师,会很快触达限额,需升 $200 Pro——仍远低于一个初级工程师约 $10,000/月的全成本。

定价核验日期:2026-08-13。订阅额度与 API 价格变动频繁,以 OpenAI 官网为准。

技术架构与模型

  • GPT-5.5(2026-04):最新旗舰,Codex 推荐默认,适合复杂编码、重构、调试、测试与知识工作产物。
  • GPT-5.3-Codex(2026-02):当前稳定主力。
  • GPT-5.3-Codex-Spark(2026-02):极速研究预览版。
  • GPT-5-Codex(2025-09):Agentic SWE 微调,400K 上下文,支持图像输入,SWE-bench Verified 74.5%
  • codex-mini:轻量快速 CLI 任务。

优势领域

与 Claude Code 的差异

两者在基准上互有胜负(取决于测试 harness),区别在「姿态」:Codex 围绕「交出去就走开」设计(托管、并行、异步),Claude Code 围绕「留在终端循环里」设计(交互、逐步推进)。团队有良好 CI 和清晰仓库约定时,Codex 的并行沙箱模型收益最大。

核心优势

  • SWE-bench 领先的自主编码能力。
  • 开源 CLI,可脚本化、可集成进自定义流水线。
  • 与 GitHub 深度集成(PR 生成、code review)。

短板与限制

  1. 订阅捆绑:能力绑定 ChatGPT 订阅,重度使用易触达限额。
  2. 依赖测试信号:无测试、约定混乱的代码库收益骤降。
  3. 不适合探索:需求未定的探索性工作、模糊架构决策非其强项。
  4. 国内可访问性:需科学上网,国内直连受限。

使用建议

  • 适合:有良好 CI 与清晰仓库约定的团队;需要批量并行处理工单的工程师;希望把重复性 Bug 修复/重构外包给 AI 的开发者。
  • 不适合:探索性原型开发;无测试的遗留代码库;需求频繁变动的早期项目。
  • 最佳实践:任务描述越清晰、越自包含,效果越好;确保有测试套件给 Agent 提供成功信号;先从小任务建立信任,再逐步放权复杂任务。

相关词条

不确定选哪个?

把 Codex 和其他 Agent 放在一起并排对比,18 个维度一目了然。

开始并排对比