把模型名从 claude-haiku-4-5 改成 claude-haiku-5-5,重新跑一遍分类脚本,第一条返回就是 HTTP 400。
原因藏在一个很多人写了两年都没动过的参数上:temperature: 0。Haiku 5.5 只接受 temperature 为 1,top_p 只能是 0.99,传 top_k 也报错。删掉之后再跑,第二个 400 来自 assistant 预填充,老脚本里用来逼模型直接吐 JSON 的那一行。第三个来自 thinking 里的 budget_tokens,新模型只认自适应思考加 effort 档位。三处都改完,脚本终于跑通,返回里排第一的内容块却是思考块,取 content[0] 的代码拿到的是空字符串。
这是迁移的开胃菜。
Anthropic 10 月 7 日发布的 Haiku 5.5,标价和 OpenAI 9 月 22 日上 API 的 GPT-6 Luna 一模一样:输入每百万 token 0.10 美元,输出 0.50 美元。再加上 9 月 2 日发布的 Gemini 3.8 Flash,和 9 月 10 日上线的 DeepSeek V4.1 Flash,这一档小模型在一个多月里全部换了代。四张价目表摆在一起看着差不多,真正决定账单的东西都不在第一行。
九成降价,先被分词器吃掉一截
Haiku 4.5 的价格是 1 美元和 5 美元,5.5 打了一折。官方自己的口径却是“平均便宜约 75%”,中间少掉的那部分去了两个地方。
第一个是新分词器。官方写明,同样的文本在 Haiku 5.5 上比 4.5 多出约 30% 的 token,具体看内容。没有给分语种的数字。能参考的是第三方用计数接口对同一套分词器(Claude 4.7 换上的那套)做的实测:英文技术文档 1.47 倍,Python 1.29 倍,英文散文 1.20 倍,紧凑 JSON 1.13 倍,中文散文 1.01 倍。
中文几乎不涨,代码和英文文档涨得最凶。
第二个是 10 万 token 这道线。Haiku 5.5 的 prompt 只要超过 100,000 token,整单所有单价乘以 5,输入 0.50、输出 2.50 美元,连缓存价也一起乘。它是 Claude 现役模型里唯一按请求长度分档的,Sonnet 5.5 和 Opus 5.5 都是 100 万上下文统一价。有个细节官方没写明:缓存读写的 token 算不算进这 10 万。缓存价本身也分两档,所以大概率是算的,但这只是推断,上生产前最好自己用小流量验一下。
分词器和这道线叠在一起,效果是线被往前推了。按官方的 30% 估,一个在 4.5 上量出来 8 万 token 的英文 prompt,换到 5.5 可能就是 10.4 万,刚好跨过去。
还有一处更隐蔽。Haiku 5.5 默认会把前几轮的思考块留在上下文里,按输入计费;Haiku 4.5 及更早的 Haiku 会自动剥掉。一个来回十几轮的子代理,输入的增长速度会比在 4.5 上快,越线也就越早。
同样标 0.10 美元,GPT-6 Luna 的线画在 27.2 万
GPT-6 Luna 也有长上下文加价,门槛是 27.2 万输入 token,超出后输入和缓存乘 2,输出乘 1.5。门槛高了近三倍,涨幅温和得多。有开发者算过一个检索场景:15 万 token 输入加 1000 token 输出,Haiku 5.5 一次约 0.078 美元,Luna 约 0.016 美元,差了快 5 倍。
短请求里两边标价相同,差距又出在别处。
Artificial Analysis 的智能指数里,Haiku 5.5 开 max 档拿 43 分,GPT-6 Luna 开 max 是 38 分,Haiku 赢了。代价是 token:在同一套任务上,Haiku 5.5 max 档的输出 token 大约是 Luna 的 3 倍。几处来源给的具体数字口径不一,“约 3 倍”这个量级是一致的。HN 上有人引同一组数据算每完成一个任务的成本,Haiku 在各个档位都比 Luna 贵出约 3 倍。
effort 档位就是这笔账的旋钮。Anthropic 在提示词文档里给过一组数:长的编程智能体 prompt 下,从 low 调到 medium,提前停工的情况减少约一半,每次尝试的输出 token 翻了一倍多。思考 token 按输出价算,也算进 max_tokens。在 4.5 上只回 100 个 token 的分类器,换到 5.5 如果不主动压档,回出来的会长得多。
可压到 low 也有代价。simonw 拿他那个“鹈鹕骑自行车”的 SVG 测试跑了各档,low 和 medium 画出来的车架是坏的,xhigh 以上才正常;max 一次 3.38 美分,low 只要 0.09 美分。官方文档也承认,low 档在长 prompt 里更容易漏搜索、提前收工,编程任务里会出现没跑检查就报完成的情况。
Luna 的毛病在另一头。Artificial Analysis 测出它的幻觉率 77%,而且在 SWE-Atlas-QnA、DeepSWE 等几项上比上一代 GPT-5.6 Luna 还退了,比如 SWE-Atlas-QnA 从 49% 掉到 44%。同一项幻觉测试里 Haiku 5.5 是 40%,四家里最低。便宜、话少、但更敢编,这是 Luna 的画像。
| Claude Haiku 5.5 | GPT-6 Luna | Gemini 3.8 Flash | DeepSeek V4.1 Flash | |
|---|---|---|---|---|
| 发布 | 2026-10-07 | 2026-09-22(API) | 2026-09-02 | 2026-09-10 |
| 输入 / 输出(每百万 token) | $0.10 / $0.50 | $0.10 / $0.50 | $0.75 / $3.75(限时至 12-31) | 闲时 $0.15 / $0.60,峰时翻倍 |
| 缓存命中 | $0.01 | $0.01 | $0.075 + 存储费 | 闲时 $0.003 |
| 长请求加价 | 超 10 万,全部 ×5 | 超 27.2 万,输入 ×2、输出 ×1.5 | 未分档 | 未分档 |
| 上下文 / 最大输出 | 1M / 128K | 1.05M / 128K | 1M / 64K | 1M / 384K |
| Terminal-Bench 4.0 | 39.2% | 16.4% | 19.1% | 31.2% |
| AA 智能指数 | 43(max) | 38(max) | 41 | 39 |
表里的 Terminal-Bench 4.0 有个前提:Haiku 5.5 那 39.2% 是 max 档、5 次平均跑出来的,Luna 的 16.4% 由 Anthropic 在系统卡里给出。各家自报的分数测法不完全一样,看量级就好,别抠个位数。
Gemini 3.8 Flash 的价格,有效期到年底
单看能力,Gemini 3.8 Flash 是这一档里最均衡的。AA 智能指数 41,知识类的 AA-Omniscience 拿到 55%,Haiku 5.5 只有 36%。要查事实、问冷知识,它比 Haiku 靠谱。
价格页上写得很清楚,0.75 美元和 3.75 美元是限时价,截止 2026 年 12 月 31 日。2027 年 1 月 1 日起恢复 1.50 和 7.50 美元,翻一倍。现在按它做的成本预算,三个月后就得重算。
缓存也不便宜。命中价 0.075 美元之外,还按每百万 token 每小时 0.50 美元收存储费。长时间挂着一份大系统提示的服务,这笔存储费会悄悄累积。
它在智能体任务上偏弱。Terminal-Bench 4.0 只有 19.1%,OSWorld-2.0 是 59.0%。谷歌自己在说明里写了,遇到更长更复杂的任务它会用更多 token,“这是设计如此”。最大输出 64K,也是四家里最短的。
DeepSeek V4.1 Flash:白天跑批贵一倍
V4.1 Flash 的闲时价是这一档的地板:缓存命中 0.003 美元,未命中 0.15,输出 0.60。命中和未命中差了 50 倍,缓存设计得好,长系统提示的成本几乎可以忽略。权重是 MIT 协议开源,552B 的 MoE,解码时激活 16B,自己部署也是一条路。
坑在时段。峰时价是闲时的两倍,峰时定在工作日北京时间 9 点到 12 点、14 点到 18 点。国内团队最常跑任务的时间,正好被划进了贵的那一档。把批处理挪到晚上,能直接省一半。
另一个让人不放心的是路由。DeepSeek 公告里说,从 9 月 14 日起 V4-Pro 的请求会被路由到 V4.1-Flash,但定价页上 V4-Pro 的价格还挂着,Hugging Face 讨论区有用户反映模型 ID 和计费对不上。这种事发生一次,财务对账就得多花一个下午。能力上,它的 Terminal-Bench 4.0 是 31.2%,HLE 是 36.8%,复杂推理和头部闭源模型还有明显差距。
Haiku 5.5 自己的两处硬伤
一是拒答。系统卡里有个矛盾的数字:普通良性请求的过度拒答率从 4.5 的 0.44% 降到 0.17%,但在自动行为审计里,它的过度拒答比测过的所有模型都多。新加的安全分类器会返回 stop_reason 为 refusal,而 Haiku 5.5 没有服务端兜底,同样的请求重发多半还是拒。在 Terminal-Bench 4.0 的 660 次试验里,有 12 次就是被分类器拦下判了失败。做安全、做逆向的团队,迁移前要先拿自己的真实请求过一遍。
二是档位不太听话。有用户反映在 Claude Code 里把 effort 设成 max,会被自动改回 xhigh,思考内容又是隐藏的,没法核对它到底想了多少。顺带一提,Max 订阅每月送的 100 美元和 200 美元 API 额度,恰好不能用在 Claude Code 上,只能走 API、Agent SDK 和 Playground,当月到期也不结转。
它也有 4.5 没有的好处。最小可缓存长度从 4096 token 降到了 512,系统提示短的子代理以前根本吃不到缓存,现在可以了。不过改顶层 effort 会让整段会话的缓存失效,想按任务动态调档,得用逐消息 effort 那个 beta 头。
一个跟主流评测相反的判断
HN 上骂 Haiku 5.5 的帖子,几乎都在说它对智能体不友好:10 万线太低,max 档太费 token,按任务算比 Luna 贵。这些都对,但讨论的基本是英文编程智能体。
中文的情况正好反过来。
如果中文真像第三方测的那样只多 1% 的 token,那么中文分类、中文摘要、中文客服回复这类短请求,就能吃到几乎完整的九折降价,而且很难碰到 10 万线。分词器那 30% 的税,主要收在英文技术文档和代码上,也就是 HN 上那批人自己的工作负载。Haiku 5.5 被骂最狠的场景,恰好是中文用户用得最少的场景。
这个判断有个前提没验证过:Haiku 5.5 的中文能力本身。官方只给了 42 种语言平均 87.8% 的 GMMLU,没有中文单项分数,社区里也还没看到像样的中文实测。所以我的建议是小批量灰度,盯住两个数:同一批中文请求在 4.5 和 5.5 上的 token 计数,以及 medium 档的输出质量。
按请求形状分派
中文短请求、高并发、要结构化输出:Haiku 5.5,effort 从 low 或 medium 起步,抽检质量再往上调。记得先把 temperature、预填充和 budget_tokens 三处改掉。
英文长上下文检索、一次就要塞十几万 token:GPT-6 Luna。27.2 万的门槛加上温和的涨幅,长请求的账单最可控。但它幻觉率高,结果要能被校验,别让它直接回答事实问题。
知识问答、事实核查:Gemini 3.8 Flash,前提是能接受明年价格翻倍,或者到时候再换。
夜间跑批、对成本极度敏感、或者想自己部署:DeepSeek V4.1 Flash,把任务排到北京时间 18 点以后。
多轮编程智能体:这一档四个都不太合适。Haiku 5.5 的 max 档能力够,但 token 和 10 万线会把账单推上去;这类活更适合直接上 Sonnet 5.5,它的缓存读取价刚降到 0.10 美元。
相关对比
《Kimi K2.7 Code、DeepSeek V4.1 Flash、GPT-5.6 Luna:便宜五分之一的前提,没人写在价格页上》
《Qwen3.8-Omni-Flash 和 Gemini 3.8 Flash:音频便宜了四十多倍,可你的账单大头不一定在音频》
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Claude Haiku 5.5、GPT-6 Luna、Gemini 3.8 Flash:标价一样的0.10美元,10万token那道线画在不同地方