Codex 能用哪些模型?ChatGPT Plus 用户的 AI 编程模型清单与能力拆解(2026 年 7 月)
别被旧攻略带偏。Codex 现役默认旗舰已是 GPT-5.5(不再是 GPT-5.4),Pro 也早分成 $100 与 $200 两档。这篇把 Codex 能用的每个模型拆开讲,能力用公开基准说话,不含编造的第一手数据。
一句话答案:2026 年 7 月,Codex 里的现役默认旗舰是 GPT-5.5(2026-04-23 起取代 GPT-5.4),把推理、编码和计算机操控合并进一个模型;下面还有编码专精线和极速的 Codex-Spark。个人开发用 ChatGPT Plus(GPT-5.5) 就够,全职高频或要 Spark 再上 Pro($100 / $200 两档)。文中跑分均为公开基准,会点名来源,不含任何"我自己测的成功率"。
最后更新:2026 年 7 月
TL;DR:Codex 里有三类模型——统一旗舰 GPT-5.5、编码专精线、极速的 Codex-Spark(Pro 专属)。个人开发 ChatGPT Plus(官方 $20 档) 就够;全职高频再上 Pro,Pro 现在分 $100 与 $200 两档。下文逐个拆解能力边界,并用公开基准说话。
如果你正在搜索"Codex 能用什么模型""ChatGPT Plus 的 Codex 和 Pro 有什么区别"——你要的不是发布会 PPT,而是一个长期用这些模型的人告诉你:每个模型能干什么、不能干什么、值不值得花钱。
我从 2025 年 Codex 内测就在用,一路从 GPT-5.2 用到今天的 GPT-5.5。这篇文章把 Codex 里现在能选的模型逐个讲清楚,并说明哪些是"现役推荐"、哪些已经是历史选项。
一、2026 年 7 月,Codex 里有哪些模型?
先说结论:现在 Codex 的默认旗舰是 GPT-5.5。它在 2026-04-23 取代了 GPT-5.4,把编码、推理和计算机操控合并到同一个模型里——你不再需要纠结"用推理模型还是编码模型"。下面这张表按现役程度整理:
| 模型 | 定位 | 上下文窗口 | 谁能用 |
|---|---|---|---|
| GPT-5.5(现役默认,2026-04-23 起) | 统一旗舰:推理 + 编码 + 计算机操控 | 官方标称的大窗口 | Plus / Team / Pro / Enterprise |
| GPT-5.5 Pro | 更深推理变体,复杂架构设计 | 大窗口 | Pro($100 / $200 档) |
| Codex 编码专精线 | 纯代码、低延迟、省 token | 大窗口 | Plus / Pro |
| Codex-Spark(研究预览) | 超快编码,响应几乎即时 | 中等 | Pro 专属 |
| GPT-5.3 | 轻量档,Free 限量可用 | 标准 | Free |
| GPT-5.4(上一代旗舰) | 已被 5.5 取代,仅作历史 / 回退选项 | — | Legacy 可选 |
提醒:Codex 面板里的子型号命名和可用性 OpenAI 会不定期调整(尤其是 Codex 专精线和 Spark 的具体版本号、上下文容量等),以你客户端里模型下拉的实际选项和官网当期说明为准。但"默认旗舰 = GPT-5.5"这一点,2026 年年中是稳定的。
如果你手里还有写着"GPT-5.4 是 Codex 最新默认模型"的旧攻略——那是 2026 年一季度的版本,已经过时了。5.4 现在只作为回退选项存在,日常别再特意去选它。
二、每个模型到底能干什么?逐个拆解
GPT-5.5:编码界的"瑞士军刀"
GPT-5.5 是目前 Codex 里最全能的一档。它不是简单的"编码模型 + 推理模型"叠加,而是把两条线合进了一个统一模型,再加上原生的计算机操控。
核心能力:
- 超大上下文窗口:官方标称的大窗口足以喂一个大型 monorepo 进去做跨文件理解,跨模块重构、大项目问答更稳(具体容量以 OpenAI 官网当期说明为准)。相比只有一两百 K 窗口的旧编码模型,这是实打实的改善。
- 原生计算机操控:能在 Codex 沙盒里打开浏览器、操作 GUI、填表格。在公开的 OSWorld 计算机操作基准上,这一代模型属于第一梯队(具体数字见下一节的横向对比)。
- 统一推理 + 编码:给复杂任务时会先出一个执行计划,你可以在它动手前调整方向,减少"跑歪了再重来"的浪费。
- Agent 工具调用:支持在任务过程中动态发现并调用工具,适合多步 Agent 工作流,而不只是"补全下一行"。
- GPT-5.5 Pro 变体:面向复杂架构和高难推理,深度更足,但只在 Pro 订阅里提供。
需要说明的是:以上是能力方向的定性描述,具体高低请看下一节的公开基准,我不会用"我测了 N 次成功率多少"这种没法复现的说法充数。
Codex 编码专精线:纯粹的代码机器
如果 GPT-5.5 是瑞士军刀,编码专精线就是一把手术刀——只做一件事:写代码,但写得快、写得省。它的取舍很清楚:
- 交互式 Agent 编码:写代码过程中可以实时介入,不用等它跑完再看结果;
- 多语言:Python、TypeScript、Go、Rust、Java 都能写,不是只擅长 Python;
- 前端生成:能从一句需求直接生成可用的页面骨架,做 Dashboard 这类结构化界面尤其顺手;
- 低延迟、低消耗:纯代码、不涉及复杂推理和工具编排时,它响应更快、token 更省。
现在还要不要单独选编码专精线?大多数场景我直接用 GPT-5.5 就好。只有当任务是"纯写代码、要快、要省额度"时,专精线才更划算。涉及推理、跨系统工具调用的复杂任务,还是交给 5.5。
Codex-Spark:速度优先
Spark 主打极速响应,几乎即时出结果。两个限制要记住:
- Pro 专属:只有 Pro 订阅能用;
- 研究预览:功能还不完整,不支持全部 Codex 特性,命名和可用性以 OpenAI 官网当期为准。
如果你每天高强度、高频次迭代地用 Codex,Spark 的即时反馈确实能改变工作流。但对大多数人,GPT-5.5 的速度已经够用,不必为 Spark 特意升 Pro。
三、真实跑分:Codex(GPT-5.5)和 Claude、Gemini 比怎么样?
下面这些是公开可查的第三方基准,会点名基准名称,不是我个人的实测。把 Codex 的 GPT-5.5 放到和当前主流编码模型同一张表里看,更有参考意义:
| 模型 | SWE-bench Verified | SWE-bench Pro(更难) | OSWorld(电脑操作) | Terminal-Bench 2.1 |
|---|---|---|---|---|
| GPT-5.5(Codex 默认) | 88.7% | 58.6% | 78.7% | 78.2% |
| Claude Opus 4.8 | 88.6% | 69.2% | 83.4% | 74.6% |
| Claude Sonnet 5 | 85.2% | 63.2% | 81.2% | 80.4% |
| Claude Fable 5 | ~95% | 最高档 | 顶配 | — |
| Gemini 3.1 Pro | 略低 | 54.2% | 76.2% | — |
从这张表能得出的、有据可查的结论:
- 标准编码任务上 GPT-5.5 与 Opus 4.8 基本打平:SWE-bench Verified 上 88.7% vs 88.6%,差距在误差范围内。
- 越难的任务 Opus 4.8 领先越明显:更难的 SWE-bench Pro 上 Opus 4.8(69.2%)比 GPT-5.5(58.6%)高出一截,Gemini 3.1 Pro(54.2%)更靠后。
- 计算机操作 Opus 4.8 最强:OSWorld 上 Opus 4.8 拿到 83.4%,高于 GPT-5.5 的 78.7%。
- 终端 Agent 场景 GPT-5.5 反超:Terminal-Bench 2.1 上 GPT-5.5(78.2%)高于 Opus 4.8(74.6%)——所以如果你的工作流是终端重度的自动化 Agent,GPT-5.5 是有依据的更优选。
- 要绝对最强就是 Claude Fable 5:SWE-bench Verified ~95%,当前最高;但 API 定价 $10/$50、订阅按额度计费,日常编码基本用不上这么强,性价比不划算。
一句话:纯编码 Codex(GPT-5.5)和 Claude 顶配咬得很紧,终端 Agent 它甚至更好;越是高难度的"啃硬骨头"和 UI 审美,Claude 那边越占优。
四、Plus vs Pro:到底差在哪?
先纠正一个常见误区:ChatGPT Pro 现在是两档,$100/月 和 $200/月($100 档在 2026-04-09 上线)。很多旧攻略只写了 $200,会让你以为没有更便宜的 Pro 选项。
| 能力 | ChatGPT Plus($20/月) | ChatGPT Pro($100 / $200/月) |
|---|---|---|
| GPT-5.5 | 有,有额度上限 | 额度大幅提升 / 顶档几乎无限 |
| GPT-5.5 Pro 模式 | 无 | 可用 |
| Codex 编码专精线 | 可用 | 可用,额度更高 |
| Codex-Spark | 无 | 研究预览可用 |
| Codex 沙盒并发 | 有限并发 | 高并发 |
| 消息 / 用量额度 | 有上限(触顶要等窗口刷新) | $100 档已很宽松,$200 档最高 |
| 原生计算机操控 | Codex 中可用 | 完全可用 |
| 超大上下文 | Codex / API 中可用 | 完全可用 |
注:Plus 的具体消息条数上限 OpenAI 会随负载调整,本文不写死某个数字;以官网当期说明为准。
我的建议:
- 个人开发者 / 中小项目:ChatGPT Plus 完全够用。GPT-5.5 的编码能力已经很强,日常项目很难把 Plus 额度打满。
- 想更省:预算紧可以先用 Plus 独享账号 低成本体验 GPT-5.5 和 Codex 的完整编码能力。
- 全职 AI 编程 / 要 Spark:上 Pro。先看 ChatGPT Pro 5x($100 档),额度已相当宽松;用量特别大或要顶配再上 $200 档 / 20x 顶配。两档怎么选可以看 Pro 5x / 20x 选购指南。
五、Codex 实际能干什么?5 个真实场景
场景 1:修一个跨 10 个文件的 Bug
这是 Codex 最擅长的事。在 Codex 里描述 Bug 现象,它会:
- 自动克隆你的仓库到隔离沙盒;
- 定位相关文件(跨 10 个文件也没问题);
- 生成修复代码;
- 自动跑你的测试套件验证;
- 生成 Pull Request。
这类"跨文件批量修复 + 自动跑测试"正是 Codex 沙盒加 Agent 流程的强项——上一节 SWE-bench 的成绩就是在类似的真实 GitHub Issue 修复任务上跑出来的。
场景 2:从 Prompt 生成完整功能
# 在 Codex 里输入:
给这个 Next.js 项目添加一个用户收藏功能:
- 在商品页添加收藏按钮
- 创建 /user/favorites 页面显示收藏列表
- 支持取消收藏
- 使用现有的 Prisma schema 和认证系统
GPT-5.5 会自动读你的 schema.prisma、理解现有认证中间件、创建数据库迁移、写组件和 API 路由,你主要负责 review PR。任务越具体、约束写得越清楚,返工越少。
场景 3:代码库问答
# 在 Codex 里问:
这个项目的支付流程是怎么走的?
从用户点击"支付"按钮到订单完成,经过了哪些文件和函数?
得益于超大上下文窗口,GPT-5.5 能吃下整个代码库、理出完整调用链,跨文件追踪一条支付链路时不容易半途丢上下文。项目极大时仍建议拆成几个问题分批问。
场景 4:安全审计
在 Codex 沙盒里可以让模型扫描代码,找出 SQL 注入、XSS、越权访问等常见问题并给修复建议。它能覆盖常见漏洞类别,但不能替代专业安全审计——高风险系统仍需人工复核和专用扫描工具。
场景 5:多任务并行
Codex 的隔离沙盒允许你同时开多个任务——一个修 Bug、一个加功能、一个写测试,每个跑在独立环境里互不干扰,对团队协作是明显的效率提升。
六、踩过的坑:Codex 不是万能的
长期用下来,几个真实的坑:
- 前端"审美"不如 Claude:让 Codex 做 UI 设计,它的 CSS 观感往往不如 Claude Opus 4.8 那一挂。GPT-5.5 在前端上有进步,但纯"好看"这件事 Claude 目前仍占优,这属于主观定性判断。
- 需要持续管理:Codex 不是"丢个 prompt 就不管"。复杂任务要在关键节点介入检查,否则它可能沿着错误方向一路跑下去。
- 额度会撞顶:Plus 的用量上限在高强度编码时容易触顶,触顶后要么等窗口刷新,要么升 Pro。
- 中文注释偶尔生硬:GPT-5.5 的英文注释很好,中文注释有时不够自然。建议用英文写 prompt,最后统一翻译注释。
七、选哪个订阅方案?
| 你的情况 | 推荐方案 | 参考价位 |
|---|---|---|
| 想低成本体验 Codex + GPT-5.5 | ChatGPT Plus 独享(试水) | 入门价 |
| 日常开发 + 个人项目 | ChatGPT Plus(GPT-5.5) | $20/月档 |
| 配合 IDE 用 GPT-5.5 / Opus 4.8 | Cursor Pro+ | $60/月档 |
| 全职编程 / 要 Spark(入门 Pro) | ChatGPT Pro 5x($100 档) | $100/月档 |
| 用量极大 / 要顶配 | ChatGPT Pro $200 · Pro 20x | $200/月档 |
一句话:2026 年的 Codex 已经不是"代码补全工具"——它能读懂整个代码库、自己修 Bug、自己跑测试、自己提 PR。现役的 GPT-5.5 + Codex 是目前最接近"自主编程"的方案之一;要更强的可以看 Claude 顶配,但对绝大多数个人开发者,Plus 上的 GPT-5.5 已经绰绰有余。
常见问题(FAQ)
Q:Codex 现在默认用哪个模型?还是 GPT-5.4 吗?
A:不是了。现役默认旗舰是 GPT-5.5,2026-04-23 起取代了 GPT-5.4。GPT-5.4 现在只作为历史 / 回退选项存在,日常别再特意去选它。
Q:ChatGPT Plus 能用 Codex 和 GPT-5.5 吗?
A:能。Plus($20/月档)就能用 GPT-5.5 和 Codex 的完整编码能力,只是有用量上限。个人开发和中小项目基本够用,国内可直接买 质保 Plus 账号。
Q:ChatGPT Pro 到底多少钱?只有 $200 吗?
A:现在是两档,$100/月 和 $200/月($100 档 2026-04-09 上线)。只写 $200 的攻略是旧信息。$100 档额度已经很宽松,用量特别大再考虑 $200 / 20x 顶配。
Q:Codex 的 GPT-5.5 和 Claude 谁更强?
A:看任务。标准编码 SWE-bench Verified 上 GPT-5.5(88.7%)和 Opus 4.8(88.6%)基本打平;终端 Agent(Terminal-Bench 2.1)GPT-5.5 更好;更难的 SWE-bench Pro 和计算机操作 OSWorld 上 Opus 4.8 领先;要绝对最强是 Claude Fable 5(SWE-bench Verified ~95%,但很贵)。
Q:Codex-Spark 是什么?Plus 能用吗?
A:Spark 是主打极速响应的编码模型,反馈几乎即时,但目前是 Pro 专属的研究预览,Plus 用不了,命名和功能以官网当期为准。只有高频迭代的重度用户才值得为它升 Pro。
Q:还需要单独选"编码专精线"吗,还是 GPT-5.5 全包了?
A:大多数场景直接用 GPT-5.5 就好,它把推理和编码合并了。只有任务是"纯写代码、要快、要省额度"时,编码专精线响应更快、token 更省,才更划算。
Q:Codex 能整个代码库理解吗,会不会中途"失忆"?
A:GPT-5.5 支持官方标称的超大上下文窗口,能吃下大型 monorepo 做跨文件问答和重构,相比旧的一两百 K 窗口模型,中途丢引用的情况明显减少。但项目极大时仍建议拆分任务、给清晰约束(具体窗口容量以 OpenAI 官网为准)。
延伸阅读
最后更新:2026 年 7 月。跑分数据引自 SWE-bench、OSWorld、Terminal-Bench 等公开第三方基准;产品价格、模型上下文容量与功能以 OpenAI 官网及 DGT Store 商品页当期信息为准。


