Decision-1、Jev、Clef:三个只做选择题的模型,微软把价格定得和Jev一分不差

AI资讯21分钟前发布 Bramble
772 0

微软10月9日发布Decision-1的当天,X上有人在转发它的成绩图时问了一句:比了一圈,为什么偏偏没比大家最关心的那几个?

这句话不是抬杠。微软在附录里列出的对照组是Quyet-1.0-Large、Surogate Rune 26B-A4B、GPT-6 Luna Decisions、deck-31B、H2O-Lightning-4B和Strands-Decider 2B。Jev在主图里出现了,Cloudflare 10月1日发布、权重直接放在Hugging Face上的Clef,一个字都没提。

而Clef恰好是这三家里自己报出来延迟最低的那个。

所以这篇就把三个“只做选择题”的模型摆在一起:TypeSafe的Jev、Cloudflare的Clef系列、微软的Decision-1。它们都不生成文字,你给一组固定选项,它给每个选项一个概率。用途是智能体流程里的路由、分类、审核、打分,这些活以前大多是拿聊天模型硬干的。

微软的价目表,和Jev一分不差

Decision-1的定价是每百万输入token 0.042美元,输出不收钱。

Jev的定价也是每百万输入token 0.042美元,输出不收钱。TypeSafe官网首页的写法是“每十亿输入token 42美元”,没有单独的价格页,也没有公开分档,量大的要找销售。

9月15日Jev发布,三周后微软给出一个完全相同的数字。我更愿意把这理解为一种表态:微软不打算在价格上跟Jev拉开差距,它要比的是速度、准确率和Foundry这套企业分发渠道。对TypeSafe来说压力不小,这家公司刚拿到8.7亿美元A轮、估值75亿美元,卖点之一就是便宜。

Cloudflare反而是三家里最贵的。按目前公开的价目,Clef每百万输入token 0.24美元,是另外两家的近6倍;Clef-flash是0.09美元,约为2.1倍。输出同样不计费。Workers AI用“神经元”计量,每天有1万个免费神经元,超出部分每1000个0.011美元,Clef折算下来每百万输入token约21818个神经元。

但Clef的权重是Apache 2.0开源的。量真跑上去之后,自己找卡部署,API价格就不再是你的成本项。另外两家都不给权重。

Jev(TypeSafe) Clef / Clef-flash(Cloudflare) Decision-1(微软)
发布 2026-09-15 2026-10-01 2026-10-09
输入价(每百万token) 0.042美元 0.24 / 0.09美元 0.042美元
输出价 免费 免费 免费
权重 不开放 Apache 2.0开源 不开放
底座 未公开 Qwen系列(具体版本各方说法不一) Qwen3.5-9B后训练
上下文 未公开 Clef-flash 24k 约33K(OpenRouter标注)

“最快”的说法,要看比的是谁

微软给的数字:36项基准、将近15万道训练时没见过的题,准确率83.5%,延迟85毫秒;P50延迟比GPT-6 Sol快35倍,比第二名H2O-Lightning-4B快2.5倍。

有意思的是,不同报道里“第二名”不是同一个。微软官方博客写的是H2O-Lightning-4B,另有报道写成比Quyet-1.0-Large快4.5倍。这类差异通常是图表口径不同造成的,但说明连“快几倍”这种最基本的数字,外界也还在各自转述。

Cloudflare那边的自测数字是:Clef-flash中位延迟38.8毫秒,同一套测试里Jev是524.1毫秒。

38.8和85不能直接相减。硬件不同、请求长度不同、测试集不同,三组数字全是厂商自报。能确定的只有一点:微软宣称“最快”的那张图里,没有放进这个自称38.8毫秒的对手。

Jev的“校准”,被社区拿去复测了

决策模型最核心的卖点是校准:模型说90%有把握,就应该十次里对九次。TypeSafe为此专门用了一种叫RLCD(面向校准决策的强化学习)的训练方法。

独立测试的结果是两种声音。

有人在一组任务上验证过,Jev落在0.9到1.0置信区间的50个回答,对了98%,判错的样本最高置信度只有0.785,看起来很守规矩。可Reddit上另一位用户拿人工标注做对照,算出来的校准误差是:是非题上Jev 5.0、Gemini 3.8 Flash只有2.0;单选题上Jev 9.8、DeepSeek V4.1 Flash只有2.8。他的帖子标题直接写着,校准量出来了,赢的是大语言模型。

两组测试规模都不大,任务也不同,谁都推翻不了谁。但至少说明“专用决策模型天然比聊天模型校准得好”这个前提,在部分任务上不成立。JevBench的维护者也提醒过,Jev在不同任务上的准确率能从62.6%跨到95.4%。

Decision-1在这方面给的东西更少。微软只说90%的预测在代表性场景下应当十次对九次,没有公布任何校准指标。它倒是给了一个鲁棒性数字:八类扰动下平均只有1.3%的判断会翻转,选项改写措辞、颠倒或打乱顺序时一次都没翻。

各自的硬伤

Jev的问题是“先发但不领先”。JevBench v1.3.0里Jev 1.13.0综合分74.4,校准82.7,智能85.7,每1000次决策成本0.0399美元,排第一。但另一组厂商口径的数据里,Jev 75.3、SemIF 75.1、DJev 74.3,前三名挤在一分之内。Cloudflare在BANKING77意图分类上报出Clef的宏F1为94.20,Jev是79.74。三周时间,开源小模型就把它的打法学走了,这是融资新闻里不会写的部分。

Clef的短板在知识类题目。连Cloudflare自己整理的对比都承认,知识类基准Jev明显领先,Clef赢在工具调用和意图识别。再加上Clef-flash把上下文压到了24k,分类一封邮件够用,判断一份长合同就不够。

Decision-1最大的坑在接入方式。

它不走OpenAI兼容的Chat Completions接口,在OpenRouter上用的是单独的Decisions API,请求和返回的结构都是专门设计的,原来那套聊天SDK直接调不通。OpenRouter上它只有微软一家托管,没有备用供应商。微软还说之后会把它换到MAI和OpenAI的模型上重新训练,也就是说你今天调好的阈值,底座一换可能要重来。

微软内部用出来的数字

微软给了几个内部案例。Xbox研究团队用它处理了1万多条开放式玩家反馈,质量和GPT-6 Sol相当,速度快14倍以上,成本低200倍。Copilot团队拿它做聊天和智能体回复的质检,质量与GPT-5.6 Luna相当,快100倍。

这两组对比的参照物都是旗舰聊天模型,不是另外两家决策模型。省钱是真的,但省的是“不该用大模型干的活”那部分钱,换成Jev或Clef也能省下大头。

按你的处境挑

已经在Azure和Foundry体系里、需要企业合规和统一采购的团队,Decision-1最省事,价格也压到了最低档。

要自己部署、数据不能出机房,或者调用量大到API费用开始显眼的,只有Clef能选。它还能吃图片,一次最多4张,做内容审核比另外两家多一条路。

Jev现在的处境最尴尬。价格被微软追平,速度被Cloudflare点名,校准优势被社区复测打了折扣。它剩下的筹码是先发积累的客户和JevBench这个事实上的行业标准,连微软发布Decision-1时都要拿JevBench来跑分。

三家的成绩几乎都来自自家测试。真要上生产,拿自己业务里两三百条带人工标注的样本跑一遍,比看任何一张对比图都管用。

相关对比:《Claude Haiku 5.5、GPT-6 Luna、Gemini 3.8 Flash:标价一样的0.10美元,10万token那道线画在不同地方》|《Gemini 4 Argon、Claude Opus 5.5、GPT-6.1 Sol:和 Sol 标价相同的 Argon,每道题贵出 2.7 倍,多数人还调不出来》

© 版权声明

相关文章

Decision-1、Jev、Clef:三个只做选择题的模型,微软把价格定得和Jev一分不差 暂无评论

none
暂无评论...