9月17日 ,华为全联接大会在上海启幕 。会上,华为发布了新一代AI算力基础设施昇腾960超节点。这款算力设施比较多 搭载的算力卡数量从上一代的1024卡升级到4096卡,并且首次采用一项名为“NPO(近封装光学)”的关键技术 ,可用于匹配10万亿参数模型训练和推理的需求。

如果说数据是AI的燃料,那么算力就是AI的引擎 。近年来,算力集群从万卡向10万卡乃至更大规模迈进 ,卡与卡之间的通信代价越来越高,超节点成为超大规模AI基础设施建设的必然选取 。据介绍,华为超节点的核心思路 ,是通过灵衢高速互联协议将成百上千张算力卡融为一体,实现“像一台计算机一样协同工作 ”的效果。
“我们聚焦在算力这个领域,将持续通过系统架构创新,满足国内AI训练和推理上的爆发式增长需求 。”华为副董事长 、轮值董事长汪涛说 ,昇腾960芯片研发超预期,昇腾960风冷超节点和液冷超节点分别将于明年第二季度和第三季度上市。
汪涛表示,华为AI战略的核心是算力 ,坚持硬件变现,围绕“超节点+集群”,通过系统架构创新构建竞争力 ,坚持构建开源开放的算力生态,支持主流大模型基于昇腾原生训练、积极拥抱“百模千态 ”。截至近来 ,昇腾910C超节点累计部署超1000套 ,昇腾950超节点也已实现商用 。
NPO是昇腾960超节点的一项关键技术。传统的大规模算力系统内部主要依赖铜缆进行电互联,近封装光学技术可在算力卡边缘几厘米的距离实现电转光,突破铜缆传输距离与带宽的物理极限 ,降低互联功耗与延迟,并解决高密度算力系统下的布线与散热难题。
据了解,华为研发了新一代NPO形态的光互联产品——Hi-ONE,这是业界首个量产的NPO产品 ,是近来 行业最大传输能力的NPO产品,容量高达7.2T,也是唯一实现内置光源的NPO产品。昇腾960超节点用5500个Hi-ONE模块 ,替代原本需要的4.8万颗800G光模块,功耗降低超550千瓦,系统无故障运行时间提升一倍 ,系统可用度达到99.8% 。这款产品把“高带宽、高可靠”与“低时延 、低功耗”融为一体,与灵衢高速互联协议一起构建可规模扩展的超节点互联系统。
“人工智能带来的变革之深、之广、之快,远超想象 ,没有任何一家公司能独自支撑整个智能世界。 ”汪涛表示,华为聚焦AI基础设施,坚持打造硅基黑土地 ,让算力触手可及;坚持软件开源开放,让开发者释放潜能;坚持拥抱百模千态,让价值多元释放;坚持合作共赢,让客户成功 、伙伴成长 。
国研新经济研究院创始院长、智能经济首席专家朱克力表示 ,算力的竞争,不只是芯片的竞争,更是系统架构、软件生态和产业统筹的综合较量。昇腾960超节点的发布 ,标志着国产算力竞争从单纯比拼单芯片性能,转向芯片-互联-存储-整机一体化的系统级创新。它通过近封装光学互联技术,实现数千卡规模的高效协同 ,解决大规模AI集群通信时延高 、成本高、可靠性不足的痛点 。
“华为发布新一代AI算力基础设施,一方面为国内大模型训练提供可落地的国产化底座,带动光通信、液冷等上下游配套产业升级;另一方面 ,通过开放互联规范,有利于减少国内算力生态碎片化,推动国产算力集群工程化落地。”朱克力表示。
全球计算联盟秘书处首席技术官苗福友表示 ,中国在人工智能基础设施方面最大的优势是全产业链能力,从芯片、部件到整机再到供电 、散热等机电产品全面覆盖,并且每个领域的发展都非常快,这和中国制造业的优势和强大的工程能力是分不开的 。从技术的角度看 ,连接技术是中国比较突出的优势领域,这对于超节点和算力集群的可扩展性和整体效率提升起着关键作用。
(文章来源:经济借鉴 报)