SemiAnalysis实测:同一个开源模型,AMD卡的每美元性能落后B200最多42倍

AI资讯24分钟前发布 xiomara
1.4K 0

CUDA vLLM 支持 DeepSeek V4.1 Flash 两天后,AMD 才发布自己那份镜像。

功能上没问题,即开即用。问题出在性价比。SemiAnalysis 的实测结论是:每美元性能比 H200 差最多 14.8 倍,比 B200 和 B300 差最多 42 倍。

42 倍不是”慢一点”,是不在同一个价格区间里。

差距的来源不是硬件参数。SemiAnalysis 的解释是 NVIDIA 和 600 万开发者的生态在第一天就把优化做完了——新模型架构一出来,算子、调度、量化路径同时有人在动手,等 AMD 这边的镜像发布时,CUDA 侧已经跑过好几轮调优。

这就是 CUDA 护城河的实际形态:它不体现在峰值算力上,体现在”新模型发布到充分优化”这段时间差上。硬件追平容易,把这段时间差抹掉很难,因为它是六百万人日常工作的副产品。

对买卡的人来说,这个结论有个直接推论:如果你的负载是跑固定的成熟模型,AMD 的账可能算得过来;如果你要第一时间跟进新架构,这个时间差就是纯成本。

AI 芯片的竞争已经不在芯片本身了,很久了。

© 版权声明

相关文章

SemiAnalysis实测:同一个开源模型,AMD卡的每美元性能落后B200最多42倍 暂无评论

none
暂无评论...