Gemini 3.1 Pro vs Claude Opus 4.8 vs GPT-5.5:只买一份订阅该选谁(2026-07 选型)
o3-pro 已作废,本篇按 2026-07 基线改成 Opus 4.8 × GPT-5.5 × Gemini 3.1 Pro 三方选型。用真实公开跑分回答一个实际问题:只掏一份订阅该给谁——落到人群和套餐,附 60 秒自测和可抄的 Code Review Prompt。
先给结论(该买哪个订阅):如果你的主力工作是写代码、改代码、加上电脑操作类 Agent(自动点网页、跑本地工具),选 Claude Opus 4.8(Claude Pro / Max)——它在越难的编程基准上领先越明显,OSWorld 电脑操作也是三者最强。如果你要的是一个什么都能接的通用助手,尤其重度用终端 Agent、又想顺带用 Sora / Deep Research,选 GPT-5.5(ChatGPT Plus / Pro)。如果你经常一次性喂进几十万字资料、做长文档与多模态分析,且对 API 成本敏感,选 Gemini 3.1 Pro。三者不是替代关系,很多人是"一主一辅"。原标题里的 o3-pro 已经作废,本篇按 2026-07 基线改成 Opus 4.8 × GPT-5.5 × Gemini 3.1 Pro 三方选型。
最后更新:2026 年 7 月
先说清楚这篇跟站内另一篇的分工:如果你只想看"谁写代码强、谁跑分高",去看纯编程横评那篇(文末有链接)。这一篇不重复堆跑分,而是回答一个更实际的问题——你只打算掏一份订阅的钱,该掏给谁。所以下面每个结论都会落到"对应哪种人、买哪个套餐"。
先纠正三个过时说法
网上很多老帖还在用旧型号名,直接照抄会踩坑:
- "o3-pro":已作废,别再拿它当选项。OpenAI 当前旗舰是 GPT-5.5(2026-04-23 起为默认),还有 GPT-5.5 Pro 变体。
- "Claude 4.5 Opus / Opus 4.6 / 4.7":都过时了,现旗舰是 Claude Opus 4.8;再往上还有更贵的 Fable 5(Mythos 级,能力在 Opus 之上)。默认模型已经换成更便宜的 Sonnet 5。
- "Gemini 3 Pro":Google 当前主力是 Gemini 3.1 Pro,不是 3.0。
三者的真实定位:不是三选一,是三种活
| 模型 | 一句话定位 | 最适合的人 | 对应订阅入口 |
|---|---|---|---|
| Claude Opus 4.8 | 能动手的工程代理:写代码、改代码、操作电脑 | 开发者、重度 Agent 用户 | Claude Pro / Claude Max |
| GPT-5.5 | 生态最全的通用旗舰:终端 Agent、Deep Research、Sora 一把抓 | 什么都要沾一点的通才、终端 Agent 重度党 | ChatGPT Plus / Pro |
| Gemini 3.1 Pro | 装得下整个项目的大脑:长上下文 + 多模态 + API 便宜 | 做长文档分析、成本敏感、量大的人 | Gemini / Google AI Ultra |
这张表是本篇的骨架,下面每一行都拆开讲清楚,尽量用可查的公开跑分说话,说不清的地方我会明说是体感判断、不假装成实测。
真实跑分对比表(点名基准,不编造)
下面这些是各家公开的基准分数,不是我自己跑的"实测"。看跑分要认准是哪个基准——同样叫"编程能力",简单变体和困难变体能拉开很大差距。
| 模型 | SWE-bench Verified (常规编程修复) |
SWE-bench Pro (更难变体) |
OSWorld (电脑操作) |
Terminal-Bench 2.1 (终端 Agent) |
|---|---|---|---|---|
| Claude Opus 4.8 | 88.6% | 69.2% | 83.4% | 74.6% |
| GPT-5.5 | 88.7% | 58.6% | 78.7% | 78.2% |
| Gemini 3.1 Pro | 低于前两者 | 54.2% | 76.2% | — |
| Claude Sonnet 5(便宜档参考) | 85.2% | 63.2% | 81.2% | 80.4% |
| Claude Fable 5(顶配参考) | ~95% | 最高档 | 顶配 | — |
从这张表能读出几个靠谱结论:
- 常规编程,Opus 4.8 和 GPT-5.5 基本打平:SWE-bench Verified 88.6% vs 88.7%,肉眼没差。谁便宜、谁顺手就用谁。
- 越难,Opus 4.8 拉得越开:换到更难的 SWE-bench Pro,Opus 69.2% 明显领先 GPT-5.5 的 58.6% 和 Gemini 的 54.2%。跨文件、需要真正理解大项目的复杂改动,Opus 更稳。
- 电脑操作 Opus 最强:OSWorld 83.4%,就是让模型自己点浏览器、操作 GUI 完成任务这类活,Opus 是三者第一。
- 终端 Agent GPT-5.5 反超:Terminal-Bench 2.1 上 GPT-5.5 的 78.2% 高过 Opus 的 74.6%。所以"在终端里跑命令、串工具链"这类重度终端 Agent 工作流,GPT-5.5 反而更合适——这是有基准依据的判断,不是拍脑袋。
- Sonnet 5 性价比很高:作为便宜档,Terminal-Bench 甚至跑到 80.4%,日常知识工作能顶大半个 Opus。预算紧可以先上 Sonnet 5。
注意 Gemini 那行有的格子是"低于前两者 / —",这是因为公开可比的对应分数不足,我不会给它编一个数字凑齐。Gemini 的真正强项不在这张编程表里,下一节说。
Gemini 3.1 Pro 强在哪:这是体感 + 公认定位,不是我跑的实测
如果只看上面这张编程/Agent 表,Gemini 会显得平平。但那张表衡量的是编程和 Agent,不是 Gemini 的主场。以下是定性判断(业界公认定位 + 我自己的使用体感),不是第一手跑分:
- 长上下文:一次性把一整个代码库、几十页 PDF、一份长会议纪要全塞进去做整体分析,Gemini 这条路线一直是强项。你缺的是"看得全"而不是"改得动"时,它更合适。
- 多模态:图、表、截图、文档混着喂,做归纳和复盘,Gemini 处理起来更自然。
- API 便宜:Gemini 3.1 Pro 的 API 价约 $2/M 输入、$12/M 输出,明显低于 Opus 4.8 的 $5/$25 和 GPT-5.5 的 $5/$30。你要跑大批量任务、对每百万 token 的成本敏感,这是实打实的差价。
所以 Gemini 的价值不是"编程比 Opus 强",而是"当你要的是一个能装下整个项目、还便宜的大脑"时,它更划算。别拿它去跟 Opus 抢困难编程活,那不是它该赢的赛道。
价格与订阅:一次说清各买什么
Claude Opus 4.8
API 定价 $5/M 输入、$25/M 输出。日常用不着碰 API,直接买订阅:Claude Pro 适合个人主力写代码;用量大、要接近"无限量"体验就上 Claude Max($100 / $200 两档)。想要比 Opus 更强的 Fable 5 也在 Claude 体系内,但 Fable 5 API $10/$50、订阅按额度计费,日常严重过剩,绝大多数人不需要。
GPT-5.5
API $5/M 输入、$30/M 输出。订阅上 ChatGPT Plus $20/月 就能用 GPT-5.5、Deep Research、Sora、Agent Mode——这是"一份订阅顶多种用途"的性价比之选。要更高额度和 GPT-5.5 Pro,走 ChatGPT Pro($100 / $200 两档)。
Gemini 3.1 Pro
走 Google 的 Gemini 订阅或 Google AI Ultra($250 顶配,含 25000 AI Credits + Veo 视频)。如果你是冲着长上下文和便宜 API 去的,先算清自己的月用量再决定是订阅还是直接用 API。
60 秒自测:你到底是哪种人
不想读完全文的话,回答下面三个问题,答案基本就出来了:
- 问题一:你每天在模型上花最多时间的活是什么?写/改代码 → 偏 Opus 4.8;查资料、写文档、做分析 → 偏 GPT-5.5 或 Gemini;让模型自己跑一串终端命令、接工具链 → 偏 GPT-5.5。
- 问题二:你更缺"改得动"还是"看得全"?缺"改得动"(把复杂改动落地)→ Opus 4.8;缺"看得全"(一次消化整个项目/大批资料)→ Gemini 3.1 Pro。
- 问题三:你在不在意每百万 token 的成本、任务量大不大?量大且在意成本 → Gemini 3.1 Pro 的 API 便宜一截;量不大、走订阅 → 看套餐额度就行,单价不是重点。
三个问题里如果有两个指向同一个模型,就先买它,别纠结。订阅大多是按月的,用一个月不合适再换成本也不高。
几个容易踩的误区
- "跑分高就一定顺手"——不一定。SWE-bench Verified 上 Opus 和 GPT-5.5 只差 0.1 个百分点,实际手感差别更多来自你喂的上下文够不够、Prompt 写得清不清楚。差别不明显时,先怀疑自己的输入。
- "一个模型通吃所有活"——同一个模型在不同基准上排名会翻转(Opus 赢 OSWorld,GPT-5.5 赢 Terminal-Bench)。别指望一个订阅在每个维度都第一。
- "越贵越好,直接上 Fable 5 / Pro $200"——顶配对日常任务是过剩。先从 Sonnet 5 或 Plus $20 起步,用量顶到天花板了再升,省下的钱不少。
什么情况下别买某一个(反向排除)
正面推荐容易让人都想买,反过来说"什么时候别买"往往更省钱。以下是定性建议:
- 只偶尔问问题、写点文案,别急着上 Opus 4.8 或 Fable 5。这类轻量知识工作,Sonnet 5 或 ChatGPT Plus 就够,多花的钱换不来你能感知的差别。困难编程和电脑操作才是 Opus 该出场的地方。
- 你从不喂大段资料、也不在意 API 单价,别为了"便宜"专门去配 Gemini。它的长上下文和低 API 价,是给量大、要整体消化大项目的人省钱的;用量小的话,这份优势你根本吃不到。
- 你不用命令行、不跑工具链,别把"终端 Agent 强"当成买 GPT-5.5 的理由。Terminal-Bench 那 78.2% 只有在你真的让模型自己在终端里干活时才有意义;纯聊天问答,这条优势对你等于零。
一句话:先看自己每天真正在干的活,再对照上面的排除项——买贵了不如买对了。
该选哪个:对号入座
你主要写代码、改代码,还要让模型自己操作电脑
选 Opus 4.8。困难编程(SWE-bench Pro 69.2%)和电脑操作(OSWorld 83.4%)都是它领先。入口:Claude Pro 账号 →,用量大就 Claude Max $100 订阅 →。
你要一个通用助手,重度用终端 Agent,还想顺手用 Sora / Deep Research
选 GPT-5.5。终端 Agent(Terminal-Bench 78.2%)反超 Opus,生态又最全。入口:ChatGPT Plus(GPT-5.5)订阅 →。
你经常喂大段资料、做长文档/多模态分析,且在意成本
选 Gemini 3.1 Pro。长上下文 + 便宜 API 是它的主场。入口:Gemini 3.1 Pro 年费会员 →,要顶配连视频生成就 Google AI Ultra $250 →。
预算有限,想先花小钱试水
先上 Sonnet 5——它现在是 Claude 的默认模型,多数知识工作能顶大半个 Opus,而且更便宜;等确认某项活确实需要更强的推理,再针对性升到 Opus 4.8。
双持怎么配(很多人的实际做法)
如果预算允许两份订阅,常见的是"一主一辅",各干各擅长的:
- Opus 4.8 当主力:写代码、改代码、写实现计划、把任务做完。
- Gemini 3.1 Pro 当副脑:读大段资料、长代码库整体理解、多模态复盘,产出结论再交给 Opus 去落地。
如果你是终端 Agent 重度用户,也可以把主力换成 GPT-5.5,让 Opus 专门啃困难编程。没有唯一正解,取决于你每天缺的是"改得动"还是"看得全"。
可直接复制的 Code Review Prompt
不管你最后用哪个,这段 Prompt 三者都能吃。把它贴进对话,再附上代码即可:
你是资深 Tech Lead。请对我提供的代码做 Review,按下面格式输出:
1) 总体评价(先指出影响稳定性的问题)
2) 潜在 bug(按严重程度从高到低排序,标明触发条件)
3) 可维护性问题(命名、边界处理、耦合、可测试性)
4) 性能 / 安全风险(如果有,说明具体场景)
5) 最小改动修复方案 + 可选的重构方案(分开写)
6) 我应该补哪些测试用例(列成清单,标注覆盖的边界情况)
要求:直接引用具体行 / 函数名,不要泛泛而谈;拿不准的地方明说"需要更多上下文"。
小技巧:用 Opus 4.8 跑这段时,多喂它相关文件(不止改动那一段),困难跨文件问题它才发挥得出来;用 Gemini 时干脆把整个模块贴进去,它的长上下文正好派上用场。
三方选型常见问题
Q:我只买一个订阅,到底选哪个?
A:主要写代码 + 操作电脑 → Opus 4.8(Claude Pro / Max);要通用、重度终端 Agent、顺带 Sora/Deep Research → GPT-5.5(ChatGPT Plus);主要读大段资料/长文档、在意成本 → Gemini 3.1 Pro。
Q:o3-pro 现在还能选吗?
A:不能,o3-pro 已作废。OpenAI 当前旗舰是 GPT-5.5(含 GPT-5.5 Pro 变体),别再照抄老帖里的 o3-pro。
Q:Opus 4.8 和 GPT-5.5 到底谁编程强?
A:常规编程基本打平——SWE-bench Verified 88.6% vs 88.7%。但换到更难的 SWE-bench Pro,Opus 4.8(69.2%)明显领先 GPT-5.5(58.6%)。复杂、跨文件的活选 Opus,简单修复谁顺手用谁。
Q:那 Terminal-Bench GPT-5.5 反超又是怎么回事?
A:Terminal-Bench 2.1 衡量的是终端 Agent(在命令行里跑工具、串流程),GPT-5.5 的 78.2% 高于 Opus 的 74.6%。所以终端重度 Agent 工作流,GPT-5.5 反而更合适。不同基准量的是不同能力,别混为一谈。
Q:Gemini 3.1 Pro 编程为什么在表里偏弱?
A:那张表衡量的是编程和 Agent,不是 Gemini 的主场。它的强项在长上下文、多模态分析和更便宜的 API——这些是定性/公认定位,不是我跑的实测。别拿它去抢 Opus 的困难编程活。
Q:预算紧,有没有更省的选项?
A:有。Claude Sonnet 5 现在是默认模型,多数知识工作顶大半个 Opus,还更便宜(Terminal-Bench 甚至到 80.4%)。先用 Sonnet 5,确认某项活确实要更强推理再升 Opus 4.8。
Q:Fable 5 值得为它多花钱吗?
A:多数人不值。Fable 5 是 Mythos 级顶配,SWE-bench Verified 约 95%,但 API $10/$50、订阅按额度计费,日常任务严重过剩。除非你有稳定的极难任务,否则 Opus 4.8 够用。
Q:三家 API 价格差多少?
A:Gemini 3.1 Pro 约 $2/M 输入、$12/M 输出;Opus 4.8 是 $5/$25;GPT-5.5 是 $5/$30。跑大批量、成本敏感时 Gemini 便宜一截;但日常用订阅的话,看的是套餐额度而不是 API 单价。
Q:这三个在中国怎么开通、怎么付款?
A:DGT Store 提供成品账号和订阅代充,支持支付宝 / USDT,付款后即时发货。具体开通方法和注意事项见文末对应的中国购买指南文章。
Q:这篇跟站内的"纯编程横评"有什么区别?
A:那篇比的是"谁代码写得更好",堆的是编程细节。这篇回答"只掏一份订阅该给谁",落到套餐和人群。想深挖编程细节看那篇,想快速决定买哪个看这篇。


