移动通信网 林知远
9月28日,国务院新闻办公室举行“开局起步‘十五五’”系列主题新闻发布会,国务院国有资产监督管理委员会副主任、新闻发言人庞骁刚在会上披露,中央企业已累计建成投产6个国产万卡智算集群,全部采用国产AI加速芯片组网。这是官方首次系统公布国产大规模算力基础设施的建设成果。所谓万卡集群,是指单一集群内部互联的AI加速卡数量达到一万张以上,其并行调度难度、网络互联带宽和故障容错要求均比千卡集群高出数个量级。当前全球范围内能够稳定运行万卡级训练集群的企业屈指可数,美国OpenAI、谷歌、Meta等公司依托英伟达H100/B200和自研TPU构建了万卡乃至十万卡规模集群,而我国在高端GPU进口受限的条件下,依托昇腾、寒武纪等国产芯片实现万卡集群的批量落地,标志着国产AI算力体系从单点突破进入规模化部署阶段。“十五五”规划前期,算力基础设施已被明确列为国家战略性公共基础设施,央企成为建设主力军。
【关键数据】
[1] 累计建成投产6个国产万卡智算集群(个)
[2] 2024年中国智能算力规模超1000 EFLOPS,同比增长约70%
[3] 国产AI芯片在中国AI服务器市场份额从不足10%提升至约20%(2024年)
[4] 单座万卡集群投资规模30亿至50亿元,满载功耗约25兆瓦
[5] 中国移动2025年算力资本开支预算约373亿元
从技术原理看,万卡集群的核心挑战不在于芯片堆叠,而在于大规模互联与协同调度。以昇腾910B为例,单卡算力约376 TFLOPS(FP16),构建万卡集群需要通过200G/400G RoCE无损以太网或全光交换网络实现卡间互联,集群对分带宽和链路时延直接决定大模型训练的线性加速比。国内已建成的万卡集群普遍采用“对等架构+参数面/样本面/数据面三网分离”设计,通信库层面通过自研集合通信库优化AllReduce效率,将大规模张量并行与流水线并行的通信开销控制在总训练时间的15%以内。故障处理方面,万卡集群在训练千亿参数模型时平均每天可能发生数十次硬件异常,国产集群通过分钟级故障检测、checkpoint自动回滚和冗余算力热备,将有效训练时长占比提升至98%以上。对比英伟达NVL72方案基于NVLink 900GB/s互联的封闭体系,国产方案以开放以太网生态换取供应链自主,代价是互联成本占比高出约10至15个百分点。
市场规模层面,据中国信息通信研究院数据,2024年我国智能算力规模已超过1000 EFLOPS,同比增长约70%,预计2025年智能算力规模将突破1500 EFLOPS。全球对比来看,IDC数据显示2024年中国AI服务器市场规模约550亿美元,其中国产芯片份额从2023年的不足10%提升至2024年的约20%。竞争格局上,中国电信、中国移动、中国联通三大运营商均已建成智算中心并部署万卡级集群:中国电信京津冀智算中心率先实现全国首个全自主研发万卡集群投产,中国移动智算中心(呼和浩特)部署约2万张AI加速卡,中国联通则在上海、东莞等地布局。设备侧,华为昇腾、寒武纪思元590、海光深算三号构成国产训练芯片主力阵营,其中昇腾生态通过CANN工具链兼容PyTorch,已支撑超过50个大模型的训练与推理需求。
产业链角度分析,万卡智算集群拉动了从芯片制造、服务器整机、光模块到液冷散热的全链条需求。上游芯片制造依托中芯国际N+2工艺及先进封装产能,国产AI加速芯片2024年出货量估计超过30万片;中游服务器环节,浪潮信息、中科曙光、新华三等厂商的AI服务器订单中,国产化机型占比已超过50%。光模块方面,万卡集群单集群需部署数万只800G光模块,中际旭创、新易盛等厂商2024年800G产品出货量同比增长超过200%,全球市场份额合计超过40%。成本结构上,万卡集群单座投资通常在30亿元至50亿元之间,其中AI加速卡占比约60%,网络设备占比约15%,电力与散热基础设施占比约15%。液冷技术渗透率快速提升,数据中心液冷方案可将PUE降至1.15以下,相比传统风冷节省电费约20%,已在新建智算中心成为标配。
商业化进展方面,6个万卡集群已实际承载多个大模型训练任务。中国电信星海智云平台接入的万卡集群支撑了TeleChat系列大模型训练,参数规模达千亿级;中国移动“九天”基座大模型依托呼和浩特智算中心完成训练迭代;此外,科大讯飞星火大模型依托昇腾万卡集群实现全栈国产化训练,讯飞披露其训练效率达到同等规模英伟达集群的80%以上。应用场景已从通用大模型延伸至气象、药物研发、工业质检等领域:国家气象局的盘古气象大模型在国产算力上完成升级,预报时效延长至10天;中国航发等央企利用智算集群开展航空发动机叶片气动仿真,单次仿真周期从两周缩短至两天。商业模式上,运营商通过MaaS(模型即服务)和裸金属租赁两种方式对外提供算力,公开报价显示,国产单卡月租价格已从2024年初的约7万元降至目前约5万元,降幅接近30%,算力普惠化趋势明显。
行业趋势层面,“十五五”期间算力网络建设将进一步提速。国务院国资委明确将智算中心纳入央企“六张网”(算力网、电力网等)统筹布局,要求到2030年建成全国一体化算力调度体系。企业动向方面,华为计划将昇腾集群方案从万卡向十万卡规模演进,新一代CloudMatrix 384超节点已实现384卡全互联,互联带宽较上代提升超过50%;三大运营商2025年资本开支计划中,算力投资占比均提升至25%以上,中国移动全年算力资本开支预算约373亿元。国际对比方面,美国"星际之门"计划拟投资5000亿美元建设超大规模数据中心,倒逼我国加速自主算力体系扩建。电力供给成为新的约束条件,单座万卡集群满载功耗约25兆瓦,智算中心选址正向内蒙古、宁夏、贵州等绿电富集地区集中,绿电直供比例预计从目前的30%提升至2030年的60%以上,算力与电力的协同布局正在重塑区域产业版图。
