Gemini 3.8 Flash 正式发布:Terminal-bench 2.1 榜首,换到 4.0 榜只有 19.1

AI头条38分钟前发布 Sirin
1.4K 0

官方模型卡今天挂出来了,Gemini 3.8 Flash 正式发布。

不过论坛上五个小时前就已经在传了。有人发现网页版和 Antigravity 里那个还标着 3.7 Flash 的选项,问它”你是什么模型”,它回答自己是 3.8 Flash。界面没变,模型先换了。等到晚上,Antigravity 的模型列表里 3.8 Flash 才正经露面,带着 High 档位。昨天关于它内部代号 Skimaki、最快周三上线的说法,到这儿算是落地了。

规格和价钱

输入上下文 1M token,输出上限 64K。知识截止 2026 年 3 月,但官方特意加了一句:部分领域只到 2025 年 1 月。这种分层截止日期以前很少写进模型卡,写出来其实是好事,至少你知道哪些方向不能指望它。

努力等级(effort level)延续了 3.7 Flash 那套,可以在质量、成本和延迟之间自己调。代价官方也写了:等级调高,token 用量会跟着涨。

价格是这次最有意思的部分。输入每百万 token 0.75 美元,输出 3.75 美元——但这是引导价,标注写着 2026 年 12 月 31 日到期,2027 年 1 月 1 日起恢复成 1.50 和 7.50 美元。也就是说现在看到的便宜,是打了对折的四个月。

横向摆一下:Claude Opus 5 是 5.00 / 25.00,Sonnet 5 是 2.00 / 10.00,GPT-5.6 Sol 是 4.00 / 20.00,Terra 是 2.00 / 12.00。哪怕按恢复后的 1.50 / 7.50 算,它也还是这张表里最便宜的一档。

跑分

基准 Gemini 3.8 Flash Gemini 3.7 Flash Claude Opus 5 GPT-5.6 Sol
DeepSWE v1.1(长周期软件工程) 71.0 65.3 74.0 72.7
GDPVal-AA v2(知识工作,Elo) 1545 1482 1824 1710
Vals Finance Agent v2 61.4 59.0 58.6 53.8
Harvey 法律智能体 10.0 8.8 6.7 2.5
Terminal-bench 2.1 89.4 85.8 89.1 88.8
Terminal-bench 4.0 19.1 11.2 51.8 37.3
CharXiv Reasoning(无工具) 86.2 84.5 83.7 85.8
HLE-Verified 54.9 53.6 54.4 54.5
OSWorld-2.0(计算机操作) 59.0 50.6 75.4 62.6
LABBench2(真实生物研究) 86.2 82.1 84.2 82.1

相比 3.7 Flash,几乎每一栏都涨了,BioMysteryBench 里那个”人类也觉得难”的子集从 43.5 提到 56.5,涨幅最大。HLE-Verified 那一行则是三家挤在一起:54.9、54.5、54.4,这个差距落在噪声里,谁第一没有意义。

两个版本号,两个结论

Gemini 3.8 Flash 正式发布:Terminal-bench 2.1 榜首,换到 4.0 榜只有 19.1

Terminal-bench 这两行值得单独拎出来看。

2.1 榜上,Gemini 3.8 Flash 89.4 分,是全表最高,把 Claude Opus 5 的 89.1 压下去了。一个 Flash 档的模型,价格是 Opus 5 的十五分之一,分数还更高。

换到 4.0,它 19.1,Opus 5 是 51.8。

差了将近三倍。而且这个反转不只发生在它身上——2.1 榜上六个模型全挤在 80 到 90 分之间,最高和最低差 9 分;到了 4.0,跨度是 11.2 到 51.8。同一批模型,同一个系列的评测,换了个版本号,区分度完全是另一回事。

合理的解释是 2.1 已经被刷到饱和了,大家都能考九十分的卷子,本身就不再有区分能力。4.0 把难度拉上去之后,谁是真能扛长链条任务、谁是在熟悉的题型上跑得快,一下就分开了。

所以看到”Terminal-bench 榜首”这种说法,先问一句是哪个版本。

法律那一栏,全场都不及格

Harvey 法律智能体基准的六个数字是 10.0、8.8、6.7、5.0、2.5、0.8。这是全通过率,意思是整套复杂法律工作流从头到尾一步不错。

榜首 10%,十次里成一次。

它比 GPT-5.6 Sol 的 2.5% 高出四倍,听起来很唬人,但两个数字都在同一个区间里——离能交给客户还差得远。这一栏更像是给行业留的一个坐标:法律这类不容错的长流程,目前所有前沿模型都还在门外。

安全侧有一处回退

模型卡里的安全对比是四项。文本安全比 3.7 Flash 降了 0.4 个百分点,语气改善 0.2 个百分点,不合理拒答上升 1.1 个百分点,这三项都在小幅波动的范围内。

多语言安全回退了 5.4 个百分点,是四项里最大的一个。

官方没有展开说是哪些语种、哪类场景。对中文用户来说这条得记一下,非英语环境本来就是各家安全对齐做得最薄的地方,出现五个多点的回退不算小事。

社区先跑了什么

模型卡挂出来之前,论坛上已经有人在 Antigravity 里一次性生成了 SVG 动画:一只鹈鹕骑自行车,还有一套太阳系。都是一条提示词出图,没有反复调。底下评论对前端能力的评价挺一致,”Gemini 前端比其它模型都要高一档”、”更便宜更快,写前端很好用”。

质疑也有。有人直接问”偷懒问题有没有改善”——指的是前几代在长任务里中途放弃、只做一半就交差的毛病。这个问题官方数字回答不了,得等更多人用几天。还有人在抱怨周限额白天就快烧完了,而且不按流量重置。

分发上目前覆盖 Gemini 应用、Gemini 企业智能体平台、Google AI Studio、Gemini API、AI Mode 和 Antigravity。各渠道推进速度不一样,有人客户端里已经能选,有人还只能看到 3.7。

官方评测方法学页面在 deepmind.google,跑分的完整口径都在那儿。

© 版权声明

相关文章

Gemini 3.8 Flash 正式发布:Terminal-bench 2.1 榜首,换到 4.0 榜只有 19.1 暂无评论

none
暂无评论...