先说结论,省得你往下拉:预算敏感、要读长东西、要跑量,Gemini 3.1 Pro;改老项目的代码、要模型别自作主张,Claude Opus 4.8;要它自己在终端里泡半小时把一件事从头干到尾,GPT-5.6 Sol。
这个结论是我这两个月把三个都当主力用过之后的偏见。下面说怎么来的。
先看谁什么时候出的,这决定了你在网上看到的评测有多少水分
Gemini 3.1 Pro 是 2 月 19 日发的,Claude Opus 4.8 是 5 月 28 日,GPT-5.6 Sol 最晚,7 月 9 日。
时间差有个很实际的后果:你现在搜到的三方对比,一大半是拿 Gemini 3.1 Pro 去比 Claude Opus 4.6、GPT-5.4 这些已经下架的版本,数字全是过期的。而 Sol 出得太晚,社区的长期使用反馈还没攒够,你看到的多是首周体验帖,那玩意儿的信噪比你懂的。
另外 OpenAI 这次挺鸡贼——Sol 发布时只放了 Terminal-Bench 2.1 这一个头条基准,GPQA、SWE-Bench、OSWorld 这些大家最想看的对照数字,到现在都没给全。一家公司选择公布什么、不公布什么,本身就是信息。
战场一:在一个十万行的老项目里改东西
这是最能拉开差距的场景,也是我个人权重最高的场景。
Opus 4.8 在这块是目前的天花板,而且不是靠一点点。SWE-bench Verified 88.6%,SWE-bench Pro 69.2%——后面这个数字更值得看,因为 Pro 版本收录的是更长、更脏、依赖关系更复杂的真实 issue。同一批题目上 GPT-5.5 是 58.6%,Gemini 3.1 Pro 是 54.2%。十几个点的差距在实际使用里的体感是:你让它改一处,它是只改这一处,还是顺手把周围三个文件也”优化”了一遍。
Gemini 3.1 Pro 在 SWE-Bench Verified 上是 80.6%,看起来跟 Opus 差得不算离谱,但一到 Pro 那种复杂度就掉得厉害。Reddit 上 Day 1 那波评测里有个说法我很认同:3.1 Pro 相比 3 Pro 最大的进步不是变聪明了,是终于肯听系统提示词了,简单任务不再啰嗦一大堆,重构代码也干净了不少。这是从”能用”到”敢用”的跨越,但离 Opus 那种”你说改哪就改哪”还有距离。
Sol 在这块的公开数据是 DeepSWE 72.7%,跟前两个不是一套题,没法直接比。我自己的体感是它比 Opus 更爱动手,好处是遇到需要跨文件大改的任务它不怯场,坏处是你得盯着。
战场二:扔进去一本书,然后问问题
这个战场 Gemini 赢得毫无悬念,而且赢的原因一半是能力一半是价格。
三家的上下文都在百万 token 这个量级上——Opus 4.8 是 100 万输入、128k 输出,Sol 是 105 万输入、128k 输出,Gemini 3.1 Pro 官方口径在不同文档里有 100 万和 200 万两种说法,输出上限 65k。参数上大家拉平了。
真正的分水岭在钱。你把一本 60 万字的书扔进去,光输入就是几十万 token,这个动作用 Gemini 做和用 Opus 做,账单差两倍半。如果你是一天要跑几百次这种任务的场景(合同审查、论文综述、财报解析),这个倍数直接决定项目能不能立项。
Gemini 还有一点很实用:它在超长上下文里的注意力衰减控制得比另外两个好。同样是把一份 80 万 token 的材料喂进去,问一个只在中间某处出现过一次的细节,Gemini 的召回稳定性明显更高。Google 在这块投入了很多年,DeepMind 那套长上下文的工程积累是真的。
另外提一句 ARC-AGI-2 这个基准,Gemini 3.1 Pro 拿了 77.1%,上一代 Gemini 3 Pro 只有 31.1%。这个基准考的是抽象规律归纳,翻一倍多是一个很反常的跳变,说明 Google 在训练方法上改了什么比较根本的东西。GPQA Diamond 94.3% 也是三家里最高的。
战场三:让它自己在终端里干半小时活
这是 Sol 存在的理由。
OpenAI 给 Sol 挂的头条数字是 Terminal-Bench 2.1 88.8%,Sol Ultra 91.9%。这个基准考的是模型能不能在一个真的 shell 环境里,自己装依赖、跑命令、看报错、改方案、再跑,直到任务完成。BrowseComp 90.4% 考的是自己上网找东西的能力,ExploitBench 73.5% 考的是安全相关的自动化。
这三个数字放一起,画像很清楚:Sol 不是被设计来跟你一问一答的,它是被设计来接一个目标然后消失半小时的。用过 Codex 那套 CLI 的人应该有体会,模型愿不愿意”再试一次”这件事,比它第一次答得多准更重要。长任务里错误会累积,能自己发现走错了并回头的模型,最终成功率高得多。
反过来说,如果你的用法是在聊天框里一句一句地问,Sol 的这些能力你一点都用不上,还得为它更贵的输出价买单。
账单
这部分不绕弯子,直接摆数字。所有价格都是每百万 token。
| Gemini 3.1 Pro | Claude Opus 4.8 | GPT-5.6 Sol | |
|---|---|---|---|
| 输入 | $2(超 200k 后 $4) | $5 | $5 |
| 输出 | $12(超 200k 后 $18) | $25 | $30 |
| 上下文 | 100 万起 | 100 万 | 105 万 |
| 最大输出 | 65k | 128k | 128k |
| 发布 | 2026-02-19 | 2026-05-28 | 2026-07-09 |
输出价从 $12 到 $30,两倍半。绝大多数应用的成本大头在输出侧,所以这个倍数基本就是最终账单的倍数。
Opus 4.8 这次还有个容易被忽略的变化:Fast Mode 从上一代的 $30/$150 砍到了 $10/$50,速度大约是标准模式的 2.5 倍。同样的速度,价格是原来的三分之一。如果你之前因为 fast mode 太贵而放弃过某个交互式产品的设想,现在这笔账可以重算了。
那些榜单不告诉你的事
三个模型我都在生产里跑过一段时间,说几个基准测不出来的差异。
指令遵循的稳定性。 Opus 是三个里最”听话”的,你说输出 JSON 它就输出 JSON,不会在前面加一段”好的,我来帮你……”。Gemini 3.1 Pro 相比上一代进步很大但偶尔还会犯病。Sol 在这方面居中,不过它有个特点是任务越长越稳,短任务反而容易发挥。
拒答和过度谨慎。 这块 Gemini 最松,Opus 中间,Sol 在涉及安全、代码执行的边界话题上会比较啰嗦,可能跟它的 ExploitBench 训练目标有关——一个被专门训练过安全攻防的模型,对这类请求天然更敏感。
中文。 三个都够用,但风格差别很明显。Opus 的中文最像人写的,句子长短有变化;Gemini 的中文有一股翻译腔,尤其是长段落;Sol 介于两者之间,但它特别喜欢用破折号,写出来的东西一眼就能认出是它。做中文内容的话这个差异比跑分重要得多。
榜单领先 ≠ 生产可靠。 这句话是我从一个在生产环境用 Gemini 3.1 Pro 的工程师那儿看到的,他的原话大意是:基准分领先没能转化成实际的可靠性。这个观察对三家都成立。基准是静态的、干净的、有标准答案的;生产环境是脏数据、模糊需求、要求一次做对。这中间的落差谁也没填平。
怎么选
按你的钱和场景对号入座:
选 Gemini 3.1 Pro,如果:你要处理大量长文档;你的调用量大到价格敏感;你在做偏推理和分析的活;或者你只是想找一个性价比最高的日常主力。它是三个里最容易证明 ROI 的一个。
选 Claude Opus 4.8,如果:你每天的主要工作是在已有代码库里改东西;你受够了模型自作主张;你要做的是中文内容且在意文字质感。它贵,但在它最强的那条赛道上没有替代品。
选 GPT-5.6 Sol,如果:你在搭那种”给个目标就自己干完”的 Agent;你的任务链条长、需要模型自己纠错重试;你需要它自主上网检索。日常聊天用它是浪费。
最后一句实在话:这三个的差距,比它们跟一年前的自己的差距要小得多。真到了选不出来的时候,选你团队已经接好的那个,省下来的时间比省下来的 token 值钱。
想直接上手试的,站内条目在这儿:Claude、ChatGPT、Gemini。写代码的场景建议配合 Cursor 或 Codex 一起用,光有模型没有趁手的壳子,体验会差一大截。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro:两个月都用下来,我给的选择清单