Qwen3.8-Max-0902 和 Claude Fable 5.1:缓存价现在一模一样,差价全在别处

AI资讯2小时前发布 Plumbago
2.5K 0

这两天最流行的两句话是”Fable 5.1 降价 25%”和”Qwen 只要它四分之一的钱”。两句都有出处,也都不算说错,但摆在一起推出”所以该换”这个结论,中间少了一大截。

少的那一截里,有一个数字两家现在完全相同。

$0.25 这个价,两边一模一样

Anthropic 9 月 1 日发布 Claude Fable 5.1,基础价一分没动:输入每百万 tokens 10 美元,输出 50 美元,和 Fable 5 一样。批处理也没变,5 美元和 25 美元。真正动的只有一项,缓存读取从 1 美元砍到 0.25 美元,降幅 75%。缓存写入没跟着降,5 分钟档 12.5 美元,1 小时档 20 美元,原样。

阿里第二天放出的 Qwen3.8-Max-0902,输入 2 美元、输出 6 美元,缓存读取——0.25 美元。

同一个数。

所以那句”便宜四分之一”只在基础 token 上成立。一旦你的负载是重度缓存命中型,两家在这一项上的单价完全一致,价差全部回落到输入输出那部分。Fable 5.1 那个”降 25%”也是同理,Anthropic 自己在文档里写清楚了:省多少完全取决于缓存读取占你账单的比重,没有可复用前缀的负载一分钱都省不到。它给的 45% 那个上限对应的是高度智能体化的场景,也就是同一段长 system prompt 被反复读几百次的那种。

升级 Fable 5.1 之前要先改代码

发布通稿里没有的东西在迁移文档里。

Fable 5.1 的 thinking 是常开的,自适应,没有手动 token 预算可调。这个设计带来一个直接后果:tool_choice 设成 any 或指定具体工具名,请求会返回 400。官方给的理由是强制调用会跳过思考,把推理挤进工具参数里,参数质量反而变差。替代写法是 tool_choice: auto 配严格工具约束或结构化输出。

另外两条容易埋雷。thinking 块变成单向的了,5.1 能读旧模型的推理内容,旧模型读不了 5.1 的;以及 append-only 强制执行——改动早先轮次会让后续的 thinking 块失效,这条对 8 月 31 日之后创建的账号是硬性的。

如果你的编排层里有 forced function calling,这不是”换个模型 ID”的事。

Qwen 的账单上有一项不在价目表里

Qwen3.8-Max 这一代有个被讨论得不多的问题:token 消耗比前代整体涨了约 17%。增量主要来自指令遵循和约束求解类任务,个别题目的 token 用量相比前代暴涨了 7 倍。这不但会触发长度惩罚,也会把平均单次调用成本拉高。

换句话说,价目表上的 5 美元均价是分子,分母那个”平均要用多少 token”这一代变大了。

长上下文这块也要打个折。它原生上下文是 262144,可以扩到 1M,但实测有效处理精度会随文本长度增长而衰减,延迟和成本同步上去。1M 这个标称值和 Fable 5.1 的 1M 不是一回事——后者 1M 是默认值也是最大值,输出上限 128K。

再有一条来自第三方对比测评:长任务稳定性略输 Kimi K3。幻觉这块倒是明显好转,比上一代降了 62%,捞针类任务表现更稳。

它们根本没站在同一张榜上

Qwen3.8-Max-0902 拿的第一是 CodeArena 前端编程总榜,1691 分,比旧版涨 22 分——旧版排第四,1668 分档位。Arena 类榜单测的是人类评审在盲测里更喜欢哪个输出,前端场景里这基本等于”生成的界面好不好看、符不符合描述”。

Fable 5.1 官方摆出来的是另一组:Terminal-Bench 4.0 从 42.0% 提到 55.8%,Terminal-Bench-Science 0.1 从 24.7% 翻到 52.6%,OSWorld 2.0 严格模式 41.7%,CursorBench 3.2.0 73.4%,AutomationBench 从 17.1% 提到 31.4%。这些考的是能不能在终端里跑通一串带副作用的操作。

两组东西不可比。

而且 Anthropic 自己在 Terminal-Bench-Science 那一行标了标准误 3.5 到 4.5 个百分点。52.6% 对 Opus 5 的 29.0% 这个差距远超误差范围,可以信;但如果哪天出现两个模型差 3 个点的对比图,那张图基本没有信息量。

Qwen 侧公布的 Terminal-Bench 是 2.1 版的 86.6 分,版本号不同,跟 Fable 的 4.0 也对不上。SWE-bench Pro 67.7、DeepSWE 1.1 的 56.6、PaperBench 93.0 这几项倒是通用榜,可以横向找对手。

各自适合谁

Claude Fable 5.1 Qwen3.8-Max-0902
输入 / 输出(每百万 tokens) $10 / $50 $2 / $6
缓存读取 $0.25 $0.25
上下文 1M(默认即最大),输出上限 128K 原生 262144,可扩至 1M
参数 未公开 2.4T 总参,激活约 95B
知识截止 2026 年 6 月 未公开
明显短板 强制工具调用被移除,迁移要改代码;基础价没降 token 用量比前代涨约 17%;长上下文精度衰减;长任务稳定性输 K3

如果你在做的是长时程智能体,一段几万 token 的 system prompt 要被读上几百次,中间还要跑终端命令、改文件、验证结果,那 Fable 5.1 的缓存降价是实打实落到账单上的,而 Terminal-Bench 那组数字也正好对应这类活。前提是你的编排层没在用 forced tool call。

如果你的活是一次性的:生成一个前端页面、写一段脚本、做一轮文档处理,前缀复用率接近零,那 5 倍的基础价差就是 5 倍,缓存那 0.25 美元根本用不上。这种场景 Qwen 的性价比没什么可争的,哪怕它多烧 17% 的 token 也照样便宜。

还有一类活两边都别指望:需要塞进 80 万 tokens 然后指望模型每个角落都读准。Fable 5.1 的 1M 是默认值,Qwen 的 1M 是扩展值,但两家在超长上下文上的实际召回质量都没有第三方系统性验证过。真要做这种事,先自己拿业务数据跑一遍召回测试,别信标称值。

最后提醒一句版本号:Qwen 这次是 0902 后缀的增量后训练版本,不是新架构;Fable 5.1 相对 5 也是小版本。两边都还在快速迭代,上面这些价格和分数的保质期,按过去半年的节奏算,大概三到四周。

相关对比:《四个AI音乐工具,四颗不同的雷:Suno、海绵音乐、MiniMax Music 3、快乐虾米》

© 版权声明

相关文章

Qwen3.8-Max-0902 和 Claude Fable 5.1:缓存价现在一模一样,差价全在别处 暂无评论

none
暂无评论...