GPT-6 Astra 发布,ARC-AGI-3 从个位数跳到接近满分

AI头条2小时前发布 Royce
2.6K 0

OpenAI 把 GPT-6 Astra 放出来了,发布会上那句话说得很满:欢迎来到 AGI 时代。

先看跳得最狠的那一项。ARC-AGI-3 这套测试专门考陌生环境下的抽象推理,上一代 GPT-5.6 Sol 连 8% 都摸不到,Astra 直接冲到接近满分。不同渠道流传的数字有 98.6% 和 99.9% 两个版本,差别不大,反正都是「这套题基本被打穿了」的意思。

其他几项:代表高阶数学的 FrontierMath Tier 4 拿到 97.6%,GPQA Diamond 96%,BenchCAD 95.9%,DeepSWE v1.1 74.1%。计算机操作那项 OSWorld 2.0 是 72.6%,单个任务耗时比 Sol 少了大约 47%。

此前预告过的那条网络安全能力上限,这次跟着正式版一起确认了:ExploitBench 满分,高级能力初期只开给少数测试者。

比这个更影响日常使用的是一条计费细节。单次请求的输入一旦越过 272000 token,整个请求的输入和缓存费率翻倍、输出乘 1.5,注意是整包重算,不是超出部分单独加价。做长文档的把上下文压在 27 万以内,比任何优化都省钱。

价格是另一个话题。API 标准档输入每百万 token 10 美元、输出 50 美元,缓存输入 1 美元,另有一个最高 2.5 倍速度的快速模式,价格翻倍。上下文 1.05M,单次输出上限 128K。

付费用户没能第一时间用上的,OpenAI 给了个补偿方案:等待期间每天累计一次可储存的重置机会。微软那边的动作更快,早期客户已经在 Azure 上跑起来了。

值得留个心眼的是,第三方评测站给出的画像和官方通稿不太一样。有站点把 Astra 排在综合第 4,但分项里 Agentic 工具使用只排到二十几名,编程排三十几名,同时标注「跟踪的基准槽位大部分还是空的,不足以给出已核实的位次」。等第三方把数据补齐,这个画像大概率还会动。

© 版权声明

相关文章

GPT-6 Astra 发布,ARC-AGI-3 从个位数跳到接近满分 暂无评论

none
暂无评论...