Claude Fable 5.1 和 GPT-6 Astra:分数差在哪儿,钱为什么流向不一样

AI资讯15分钟前发布 Zora
599 0

把两家近三个月的动作按日子排一遍,比看任何一张跑分表都清楚。

9 月 1 日,Anthropic 放出 Claude Fable 5.1,官方定位写得很直白:面向编程和知识工作的最强一代。9 月 3 日,OpenAI 发 GPT-6 Astra,公告上线即被撤下,页面失联一段时间,官方解释是内容管理系统故障加网络中断。9 月 6 日,有人翻出博客的修改记录,发现评测数字被动过。9 月 7 日,黄仁勋在 X 上说 AGI 已经到来,同一周奥尔特曼说 AGI 是个”无关紧要的营销术语”。

四天,四个方向。

这一段时间线本身,比两个模型的能力差异更能解释一件事:为什么 Anthropic 的年化收入是 650 亿美元,而 OpenAI 是 400 亿。

Astra 的分数是真的高,问题出在旁边那个数字

先把 Astra 的成绩摆清楚,它确实猛。FrontierMath Tier 4 拿了 98%,ARC-AGI-3 拿了 99.9%,ExploitBench 100%。它还帮着把素数间隔的上界推进到了 186。OpenAI 自己说这是”代际跃迁”,在计算机操作、软件工程、网络安全和科研上都到了最先进水平。

训练它用了大约 10 万颗 NVIDIA Grace Blackwell NVLink72。

然后是那个旁边的数字:幻觉率 4.2%。

一个在漏洞利用基准上满分、在前沿数学题上 98 分的模型,同时有 4.2% 的幻觉率。这两个数字放一起不矛盾,但它们说明能力上限和可信度是两条独立的线。前一条决定它能不能做成一件难事,后一条决定你敢不敢不检查就用。

4.2% 落到真实工作里是什么概念:一天二十次调用,差不多每天有一次它一本正经地编东西给你。如果这二十次里有几次是让它改生产代码,你就得每次都读一遍 diff。

那份被改了两次的博客

幻觉率这个数还有后续。

Astra 公告重新上线之后,4.2% 先被下调到 2%,过一阵又被调回 4.2%。同一批修改里,GPT-5.6 Sol 的 ExploitBench 从 5.5% 上调到 11.5%;Anthropic 家 Fable 5.1 的数学分数一度被调低了约 10 个百分点,随后回升。OpenAI 给的说法是,调整是为了让数字更好地代表对模型性能的最佳估计。

改自家的数字是流程问题,改竞品的数字是另一回事。而且部分修改的时间点,早于官方对外做出说明。

这件事对选型的实际影响很具体:如果你打算拿一张官方对比表去过采购流程,那张表在你签字之后可能已经不是你看到的那张了。

Fable 5.1 的位置:不是分数,是在别人代码库里的手感

Claude 这一代的强项不太好用榜单表达,但有两个旁证挺硬。

一个是哥伦比亚商学院的彭天翼用它在 11 天内完成了费马大定理的形式化证明,1300 万行 Lean 代码,途中证出 29500 个中间定理。另一个是它把黎曼猜想的零点下界推到 67.25%,而此前 37 年人类在这个下界上一共只推进了约 0.8%。

这两件事的共同点不是”数学好”,是能在一个几千步、上百万行的长链任务里不跑偏。形式化证明这活儿的特点是每一步都有验证器判对错,模型没法蒙混,一步错就卡住。能撑住 1300 万行,说明它在超长上下文里的状态维持能力是真的。

这个能力和企业买单的场景高度重合。真实工程活儿的难点从来不是写一个漂亮的函数,是在一个百万行、没文档、到处是历史包袱的仓库里,找到该改的地方,并且不搞坏另外三处。

OpenAI 总裁自己承认了这件事

关于收入差距,布罗克曼被问到时给的回答比外界的分析都直接:我们在真实世界的编程上入场晚了。

他的完整逻辑是,OpenAI 长期盯着编程竞赛类基准,而且在那些榜单上一直领先,所以对真实编码这块投入得少。

这是个相当罕见的样本:一家厂商公开承认,自己在基准上的长期领先,反而误导了自己的产品判断。

竞赛题和生产仓库的差别,是有没有一个你没写过的三十万行代码,有没有一堆没人记得为什么要这样写的约定。一个模型在算法题上 90 分,跟它敢不敢被接进 CI 流程,是两个问题。

OpenAI 补课的速度不慢。它公开的内部数据说,工程师人均代码变更速率相比 2025 年之前提高了约 7 倍,Astra 上线后部分项目整体提前了约 6 个月,原本排在 2027 年年中的东西可能今年就出。不过”代码变更速率”这个指标本身要打折看,模型辅助会天然抬高提交行数和 PR 数量,7 倍不等于产出 7 倍。

顺带说一句 AGI 那场争论里最少被引用的一条:加里·马库斯按自己列的十项标准核对,认为 Astra 目前满足的只有一到两项。

钱的部分,别只看标价

Astra 的 API 标准定价是每百万输入 token 10 美元、每百万输出 token 50 美元。

标价之外有两处容易漏算。第一,缓存读取和写入另行收费,长会话和智能体工作流恰好是缓存命中最多的场景,这笔钱不小。第二,API 里给 Astra 提供了快速模式,处理速度最高可达标准模式的 2.5 倍,这个模式不是白送的。

换句话说,你按 10/50 算出来的预算,跟真实账单大概率对不上。做智能体的尤其注意,那类工作负载的 token 结构和聊天完全不一样。

GPT-6 Astra Claude Fable 5.1
发布日 2026-09-03 2026-09-01
官方定位 端到端完成工作的最强模型 面向编程与知识工作
标价(每百万 token) 输入 10 美元 / 输出 50 美元 Anthropic 未在本轮公告中统一披露
额外计费项 缓存读写另计;快速模式最高 2.5 倍速 缓存与批处理按官方价目
公布的幻觉率 4.2%(曾改为 2% 后改回) 本轮未单独公布
训练算力(已披露) 约 10 万颗 Grace Blackwell NVLink72 未披露
厂商年化收入 OpenAI 约 400 亿美元 Anthropic 约 650 亿美元

两边各自的短板

Astra 的短板是可信度和披露方式。4.2% 的幻觉率在这个能力档位上偏高,而发布后 48 小时内数据被反复修改这件事,比数字本身更影响信任。此外 OpenAI 自己的首席科学家帕乔基在发布几天后发长文呼吁行业放慢,理由是智能体可能学会逃避监督和欺骗人类。自家安全负责人在旗舰发布后公开踩刹车,这个信号需要用户自己掂量。

Fable 5.1 的短板也不含糊。Anthropic 刚为版权诉讼掏了 15 亿美元和解金,覆盖近 50 万部作品、每部 3000 美元,法院认定用受版权保护材料训练属于合理使用,但盗版渠道获取不受保护。这笔钱和随之而来的数据来源约束,会不会影响后续训练语料的规模,现在没人能给准话。

另外 Anthropic 在消费级产品上一直偏慢。Claude 到这个月才刚接进 CarPlay,还得靠 iOS 26.4 开的第三方口子,不支持唤醒词,得手动点开。同期 Gemini 已经在做悬浮气泡这种细节了。

我会怎么分

要做一次性的难题攻坚,要前沿数学、要漏洞分析、要一个模型在陌生领域给你一个高质量的初稿,用 Astra。它的能力上限现在是最高的,这点没什么争议。

要把模型接进已有代码库、要它连续跑几小时不跑偏、要审计和合规部门点头,用 Fable 5.1。

要控成本的,两个都别急着上。这一周 Anthropic、Meta、谷歌、OpenAI 接连发版本,CNBC 那边已经出现”模型疲劳”的说法,企业 IT 负责人抱怨的不是模型不好,是评估本身正在变成一项固定开销。Gartner 预计今年全球 AI 支出 2.59 万亿美元、同比增长 47%,其中超过 45% 流向基础设施,掏钱的人证明回报的压力只会更大。

在这种节奏下,最理性的做法是把自己业务里两百条真实样本跑一遍,看谁的错误更容易被发现。能被发现的错误比更少的错误值钱。

相关对比

GPT-6 Astra、Claude Opus 5、DeepSeek V4 Pro 一夜全崩之后,正经业务该怎么放

Qwen3.8-Max-0902 和 Claude Fable 5.1:起步价一模一样,差别全在暗处

Gemini 3.8 Flash 和 Muse Spark 1.3 同期上线,从 Opus 5 迁过去要改哪些东西

© 版权声明

相关文章

Claude Fable 5.1 和 GPT-6 Astra:分数差在哪儿,钱为什么流向不一样 暂无评论

none
暂无评论...