News
硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!
1 min read
Source: zhidx.com
智东西 作者 | 李水青 编辑 | 漠影 2.8万亿参数的大模型,究竟要怎么跑快? 近日,海内外团队盯上了全球最大参数量的开源模型—— Kimi K3 。K3凭借2.8万亿总参数、104B激活参数,刷新了开源模型的性能上限。但 普通的AI服务器难以承载这么大参数量的模型 ,Kimi官方推荐64卡甚至更大规模的AI服务器才能装得下。有业内人士表示,一般未经优化的超节点跑Kimi K3,初始性能可能仅在 10 tokens/s左右。 面对如何让2.8万亿参数的Kimi K3跑得更快这一难题,国内外团队几乎同时交出了答卷。 9月21日, 浪潮信息 在AICC 2026发布 元脑SD200 Ultra超节点AI服务器 ,通过紧耦合128芯本土AI芯片,单机承载2.8万亿参数Kimi K3,Token生成时延首破 5.85毫秒。 9月23日,海外TPU推理优化团队 Inferact 开源 tpu-megakernels ,用16颗谷歌TPU v7芯片把整个K3装进一个kernel(内核),配合DSpark投机解码,低并发Decode(解码)吞吐达到 709 tokens/s。 一个用本土芯片做商业化超节点,一个用Google TPU做开源推理项目, 指向了同一个技术思路:打破算子边界,把大模型推理的计算过程融合到极致。 大模型推理的竞争,正从模型算法层,深入到系统软件、芯片互联和内存管理层。 一、万亿MoE太难跑,海内外团队同时盯上算子融合 万亿参数大模型推理为什么慢? 很多人以为是算力不够,而实际瓶颈更在于 数据搬运 和 内存带宽。 据知名半导体行研机构SemiAnalysis分析,K