Gemini 3.8 Flash 上线:跑分压过 Opus 5 半个点,账单可能反而更厚

AI资讯29秒前发布 Wynn
960 0

谷歌周三放出了 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。前者主攻长周期编程和智能体工作流,后者专门做漏洞发现与自动修复。距离 3.7 Flash 发布才过去一个月。

数字是好看的。HLE-Verified 上 3.8 Flash 拿到 54.9%,Claude Opus 5 是 54.4%。半个百分点。

发布前一周风声就漏出来了。谷歌员工说新模型内部代号 Skimaki,重点全砸在编程上。DeepMind 内部有个叫 Jetski 的编程工具,拿它做对比测试时,一部分工程师给 3.8 Flash 投了票,而不是 Opus。这个细节比跑分有意思——工程师用的是自家日常吃饭的工具,投票时没什么客气可讲。

Flash 能这么快迭代,跟体量直接相关。调一次 Flash 吃掉的训练算力有限,几支团队可以同时试不同方案,谁跑赢算谁的。同样的改动挪到 Pro 上,资源不够分,只能排队。皮查伊五月对外说过新一代 Pro 次月就推,结果没兑现,据说是几个内部候选版本没能明显跑赢 Flash,直接被砍了。

Pro 线被自家 Flash 线堵住了。这事挺尴尬的。

价格官方说不变,这句话很容易被读成成本不变。Gemini 3.8 Flash 是推理模型,同一道题它会想得更久,吐出来的思考 token 更多。单价没动,单次任务的账单是会动的。真要评估别看价目表,看你自己那条业务线跑完一轮的实际花销。

Cyber 那款更该盯。一个专门被训练来找漏洞并自动修补的模型,攻和防两边都用得上。谷歌把它单拆出来发布,等于承认这条能力已经强到不适合混在通用模型里一起卖。

下一个观察点是 Pro。Flash 已经把水位顶到这儿,谷歌下一代 Pro 要是还拿不出明显差距,”Pro”这个层级存在的理由就得重新算一遍。

© 版权声明

相关文章

Gemini 3.8 Flash 上线:跑分压过 Opus 5 半个点,账单可能反而更厚 暂无评论

none
暂无评论...