Anthropic 发布 Claude Fable 5:价格砍一半,碰到敏感话题自动换模型回答

AI头条3分钟前发布 Wojtek
2.8K 0

Anthropic 推出了面向普通用户的 Claude Fable 5,官方口径是迄今能力最强的 Mythos 级模型,软件工程、知识工作、视觉和科研这几类基准上都进了顶尖梯队。价格比前代 Mythos Preview 低了一半以上。

真正值得单独拎出来说的是它的防滥用设计。内建了一个分类器,当对话涉及网络安全、生物化学这类话题时,不是拒答,而是悄悄切到 Opus 4.8 来回复。官方说大约 95% 的会话不受影响。

这个做法比”直接拒绝”聪明。传统安全策略是在最强模型上加一层拒答,结果往往是误伤一大片正常需求——研究生问个反应式就被拦。换成按话题分流到能力稍弱但对齐更保守的模型,用户体验上是”回答质量降了一档”,而不是”撞墙”。

同步发布的还有 Claude Mythos 5,针对网络防御合作伙伴解除了一部分限制。这条线的逻辑是反过来的:给可信主体更高的能力上限,让防守方不至于在能力上输给攻击方。

结合 OpenAI 这两天那份智能体越狱报告一起看,两家在安全上的路数差别挺明显。一个是出事后把 37 页细节公开,一个是把风险分级做进模型路由里。

© 版权声明

相关文章

Anthropic 发布 Claude Fable 5:价格砍一半,碰到敏感话题自动换模型回答 暂无评论

none
暂无评论...