新闻
一文看懂昇腾超节点:AI Infra已进入系统工程阶段
1 分钟阅读
来源:zhidx.com
智东西 作者 | 陈骏达 编辑 | 漠影 AI大模型竞赛,正在进入新的量级。海外,十万亿参数的大模型已经逐步变成现实;国内,数万亿参数的大模型也在加速追赶。为了训出真正的SOTA模型,算力集群从万卡走向10万卡已成为标配。 然而,一个尴尬的现实是: 卡越堆越多,真正被利用起来的算力,却没有同步增长。 华为的仿真数据显示,在10万卡集群中,卡间通信可能 消耗了40%以上的训练时间 ,算力利用率(MFU)往往 不到30% 。也就是说,大量昂贵的算力,并没有真正用于计算。 对于训练周期以月计算的前沿大模型而言,MFU每提升几个百分点,都可能意味着数天的训练时间差,以及数千万元甚至上亿元的算力成本变化。 为解决这一挑战,有越来越多的厂商把目光投向一种新的算力组织方式——超节点。与传统集群把计算卡分散在大量服务器中不同,超节点试图通过更紧密的互联、统一的内存空间和更低的通信时延,把数千张卡组织成一个逻辑上的整体。 日前发布的昇腾960超节点,正是这样一套面向10万卡时代的超节点工程化方案。 一、 超节点成必然选择 ,统一内存编址是关键 从去年开始,“超节点”成为AI算力领域热度快速攀升的概念。华为昇腾910C超节点等方案率先引发行业讨论,此后,国内算力、服务器等厂商也相继推出相关产品。一时间,超节点几乎成了新一代AI算力基础设施的代名词。 在上周的HC2026大会上,华为副董事长、轮值董事长汪涛更是判断, 随着大模型迈向10T级参数规模,超节点是AI基础设施建设的必然选择。 但随着产品不断涌现,一个更基础的问题也随之而来: 到底什么才是真正的超节点? 如果只是把更多服务器放在一起,再通过