寒序科技把模型权重放进MRAM里算,首代芯片片内带宽设计值24TB/s

AI资讯49分钟前发布 emberly
1.8K 0

寒序科技公布了 uHBM 与 uLPU 推理计算架构,首代 uHBM 的片内读带宽设计值是 24 TB/s。作为参照,小米刚发的 AI 加速芯片玄戒 O100 是 1.22 TB/s。

差二十倍,是因为这两个数字说的不是一回事。

寒序的路子是 MRAM 磁计算——把模型权重常驻在 Persistent MRAM 阵列里,在同一片上完成矩阵-向量运算。传统架构下,推理的大部分时间和功耗都花在把权重从显存搬到计算单元这件事上,搬一次算一次。权重不动,搬运就没了,带宽自然是另一个量级。

uLPU 面向 4B 多模态模型,提出的目标是 Decode 阶段超过 2000 tokens/s。这个数字如果能落地,端侧小模型的交互体验会完全不同。

验证芯片 SpinPU-ED01 已经通过第三方检测和 24 小时稳定运行验证。产品路线从芯片一路铺到 2U Tray 和 Rack,说明目标是进机房,不是只做演示。

存内计算这条路上摔过很多公司。MRAM 的良率、写入寿命、工艺成熟度都是老问题,而且模型结构一变,专用架构的适配成本就上来了。

但方向本身没错。推理成本里搬运权重占的比例太高了,谁能把这块砍掉,谁就绕开了 HBM 的产能瓶颈。24 TB/s 现在还只是设计值,真正的考验在流片之后。

© 版权声明

相关文章

寒序科技把模型权重放进MRAM里算,首代芯片片内带宽设计值24TB/s 暂无评论

none
暂无评论...