移动通信网 赵哲超
7月17日,2026世界人工智能大会(WAIC)在上海世博中心揭幕,华为正式线下展出业界最大规模的昇腾950超节点真机。当前,人工智能正向Agentic AI阶段演进,更大规模的混合专家模型与超长上下文序列对底层通信与计算架构提出严苛要求。传统单机算力集群面临内存墙与通信瓶颈,无法满足十万亿级参数模型的高效训练需求。昇腾950超节点基于灵衢互联协议进行系统级架构重构,单集群规模达到1024卡,并提供1 EFLOPS FP8与2 EFLOPS FP4的峰值算力输出。该架构通过跨物理节点的统一内存编址技术,彻底打破单台服务器的物理资源隔离限制,将分散的计算与存储单元融合为单一计算平面,为应对万亿参数规模模型的高并发推理与高频数据调用提供了底层硬件支撑。
【关键数据】
[1] 2 EFLOPS FP4(集群总算力)
[2] 3微秒(节点间通信往返时延RTT)
[3] 256TB(全局统一内存编址空间)
[4] 1244万行(CANN开源代码量)
[5] 750多套(昇腾384超节点商用落地数量)
昇腾950超节点的核心技术突破在于底层互联架构与数据调度机制的重构。该真机系统实现了256TB全局统一内存编址空间,使1024张NPU计算卡能够以单一内存地址空间进行直接寻址读写。在数据传输通道上,系统依托TB级NPU互联超大带宽,将节点间数据交互的网络往返时延(RTT)极致压缩至3微秒。这种超大带宽与超低时延的组合,消除了传统分布式训练中跨节点数据同步产生的通信等待空隙。在处理MoE模型时,算法需要频繁调用分布在全网的专家网络参数,昇腾950的全局内存技术允许各个计算核心直接访问远端显存,将通信延迟转化为后台执行时间。同时,通过全量支持FP8与FP4等低精度计算格式,该架构在确保模型收敛精度的前提下,将显存占用量降低50%以上,从物理层面大幅提升了单周期内的数据处理吞吐量。
在AI基础架构市场,超大集群的规模化部署能力直接决定了供应商的市场份额。英伟达的GB200 NVL72集群通过集成72张Blackwell芯片提供720 PFLOPS的FP4算力,而昇腾950超节点通过1024卡规模化互联,将单集群FP4总算力推高至2 EFLOPS,在绝对算力密度上构建了显著优势。在部署规模上,前代昇腾384超节点已在国内实现750多套的商用落地,广泛应用于通信运营商、金融机构与核心制造企业,成为国内唯一成功训练出SOTA大模型的国产超节点系统。华为通过将Atlas 950与现有主流生态深度耦合,已联合3000多家行业合作伙伴孵化了7000多套行业解决方案,直接服务超过2000家政企核心客户。这种硬件规模化交付能力与本地化生态网络,使其在与传统国际算力巨头的市场竞争中占据了关键的本土市场主导地位。
针对传统数据中心向智算中心升级过程中的高成本痛点,华为在此次大会上同步展出了Atlas 850E风冷超节点方案。传统液冷智算中心需要重构机房制冷基建与供配电系统,单机柜改造周期长且基础设施改造成本高昂。Atlas 850E依托自研VCE相变散热技术与灵衢互联协议,无需对传统标准IDC机房进行液冷化改造,即可直接进行标准机柜的上架部署。在部署密度上,单个风冷超节点支持无缝扩展至96卡商用部署规模。在处理能力上,该节点原生覆盖FP8、mxFP8、HiF8、INT8、mxFP4全量低精度数据格式,并搭配4.0 TB/s的高速内存带宽。在支撑Agent应用的多轮对话场景中,系统可稳定维持10毫秒级别的推理时延,从容应对高频KV缓存读写负载,在传统风冷机房内实现了池化计算资源与超长上下文处理的高效协同。
算力硬件的商业化生命周期高度依赖于基础软件栈的迭代速度与代码开源深度。昇腾在软件侧执行全量开源战略,于2025年底正式完成CANN架构与Mind系列底层软件的代码开放。截至目前,CANN开源社区已累计上线67个核心功能项目,开放底层代码超1244万行。这一开源矩阵直接降低了算法开发者的硬件适配门槛,开源社区月活跃开发者数量突破3500人,日均代码下载请求量达到6万次。通过联合90多个第三方开源社区进行算子级融合优化,昇腾平台原生适配了PyTorch、MindSpore等主流框架的底层接口。在KV Cache内存管理与计算图编译优化环节,软件栈能自动将大模型计算流切分为细粒度张量,精准映射至950超节点的物理NPU集群中,实现了复杂硬件架构下的“开箱即用”,极大提升了AI应用模型从实验室环境向现网环境迁移的开发效率。
底层软硬件架构的协同优化直接加速了AI技术在千行万业的实体商业落地进程。本次WAIC展会上,华为集中展示了20多个基于昇腾超节点架构的行业标杆落地案例,覆盖了自动驾驶数据闭环、医疗影像基因测序、交通路网实时调度等60多种真实业务场景。在自动驾驶领域,昇腾超节点为车企处理PB级路采数据,将感知大模型训练收敛周期从数周压缩至数天。在医疗诊断环节,基于统一内存编址与低精度计算格式,大型医疗中心能够实现百万级高分辨率病理切片的毫秒级并发推理筛查。算力底座的升级驱动了AI从单点感知实验走向多模态智能体执行阶段,规模化部署的超大集群正将庞大的参数优势转化为真实的商业生产效率。硬件集群规模、软件代码开源程度与落地场景数量构成了AI基础设施的三大核心评估指标,数据的持续运算与反哺正在不断重塑各行业的业务处理流程。
