这次数博会最让人眼前一亮的,当属中科曙光带来的 Power K 存算协同方案。
此前圈内就一直在讨论这款面向大模型时代的存算方案,今天完整看完后,只能说真没白来,这绝对是今年国产存储领域的一件大事。
为啥说它戳中了大模型的痛处?
不少开发者都吐槽,买了一堆高端显卡,结果大半算力都浪费在重复计算上,明明硬件够了,却跑不出想要的速度。
模型只能反复重新计算历史内容,相当于买了一堆显卡,却天天让它们重复做同一道题,大把时间都耗在这上面。
四级缓存池到底有多厉害?
中科曙光的 PileCache 直接把 GPU HBM、CPU 内存、本地 SSD 和分布式共享存储整合成四级缓存池。
热数据留在显存,温数据放进内存,冷数据转到 SSD 和分布式存储,KV 缓存还能长时间留存,新请求过来,已经算过的内容直接复用,只需要计算新增部分。
这就好比过去每个 GPU 都守着自己的小本本,现在曙光给整个集群建了一座共享记忆库。
同样一批显卡,过去被重复计算拖住,现在能接更多请求,产出更多 Token,像智能客服、知识库、代码助手这类需要共享大量背景资料的业务,这笔账算下来太值了。
更难得的是,PyTorch 原生兼容主流的 LM cache,原来的推理技术栈不用大改,毕竟迁移一次伤筋动骨,能平滑接入才是真正懂落地。
中科曙光在存储领域本来就有硬实力,此前 PolarDB 刚包揽 RO500 全球生产型全节点、时节点两项第一,现在又把存储能力延伸到推理赛道,相当于把存储从数据仓库,改成了 Token 生产线上的加速器。
以后再看 AI 基础设施,不能只数显卡数量了,谁能让显卡少做废活,多产 Token,谁才真正握住了推理时代的效率密码。
声明:个人原创,仅供参考


登录后才可以发布评论哦
打开小程序可以发布评论哦