移动通信网 赵哲超
9月7日,工业和信息化部正式印发《信息通信行业发展“十五五”规划》,其中在算力基础设施领域释放出强烈的政策信号。规划明确提出“有序部署万卡、十万卡及以上智算集群”,这是国家级规划文件中首次将“十万卡集群”写入部署目标,标志着我国智算基础设施建设进入超大规模集群时代。规划提出构建“枢纽-区域-边缘”多层次算力设施体系,加快全国一体化算力网建设,并要求面向场景按需部署推理算力设施。从产业背景看,大模型参数规模正从千亿级向万亿级演进,训练单个前沿模型的算力需求已从数千卡攀升至数万卡量级,GPT-4级别模型训练消耗约2.5万张A100等效算力,谷歌Gemini Ultra训练算力估算超过5万张TPU。国内方面,中国移动、中国电信等运营商已在呼和浩特、贵安等地建成多个万卡级智算中心,此次规划将集群规模上限提升至十万卡,为后续两至三年的国家级算力工程预留了政策空间,同时明确“加大力度适配国产算力芯片”,释放出供应链自主化的清晰导向。
【关键数据】
[1] 十万卡及以上智算集群(规划部署目标)
[2] 截至2024年底我国在用算力总规模280 EFLOPS
[3] 万卡级智算中心总投资30亿至50亿元,GPU采购占比60%至70%
[4] 十万卡集群满载功耗150MW至200MW,年耗电超10亿千瓦时
[5] 城域“毫秒用算”专项行动,算力访问时延压缩至毫秒级
从技术角度看,万卡乃至十万卡集群的核心挑战在于大规模互联与稳定性。以英伟达H100集群为例,单个万卡集群通常采用InfiniBand NDR 400Gbps网络互联,Fat-tree或轨道优化(rail-optimized)拓扑下,网络设备成本占比可达集群总投入的15%至20%。十万卡规模下,故障率管理成为关键瓶颈——业界数据显示,万卡集群在54天周期内平均发生数百次GPU故障,任务中断率随规模呈非线性上升,因此规划特别强调“深化算力自动化监测与供需匹配,提高算力资源利用率”。规划还提出“深入实施城域‘毫秒用算’专项行动”,将城市内算力访问时延压缩至毫秒级,这要求算力设施间互联网络架构向400G/800G高性能网络演进。值得关注的还有“探索太空算力技术前瞻研究及生态培育”的表述,即在天基平台部署数据处理能力,通过星上预处理降低回传带宽压力,我国“三体计算星座”已规划发射上千颗搭载算力载荷的卫星,单星算力最高达744 TOPS,太空算力从概念走向工程验证阶段。
从市场规模与竞争格局看,我国算力产业已形成庞大基数。工信部数据显示,截至2024年底我国在用算力总规模达280 EFLOPS,其中智能算力占比持续提升至三成以上,智算规模年增速超过70%。IDC预测,中国智能算力规模2025年将达到1037.3 EFLOPS,2028年有望突破2197 EFLOPS,五年复合增长率约46.2%。超大规模集群建设的主力阵营包括三大运营商、阿里云、腾讯云、百度智能云以及华为系的地方智算项目:中国移动智算规模已超29 EFLOPS,呼和浩特智算中心部署约2万张AI加速卡;阿里云在张北、乌兰察布的自建集群规模同样达到万卡级。芯片层面,竞争格局正在重塑,英伟达H20/B30系列受出口管制影响供给受限,华为昇腾910B单卡算力约376 TFLOPS(FP16),寒武纪思元590、海光DCU等国产方案加速上量。规划中“加大力度适配国产算力芯片”的表述,直接对应国产AI芯片在集群生态、CUDA迁移工具链上的补短板需求。
超大规模智算集群对产业链的拉动效应显著。成本结构方面,一个万卡级智算中心总投资通常在30亿元至50亿元区间,其中GPU/AI加速卡采购占比约60%至70%,服务器整机约15%,网络设备与存储各占8%至10%,土建与配套电力设施占比约10%。十万卡集群意味着单体项目投资规模将达300亿元量级,对上游芯片、服务器、光模块、液冷设备形成强需求。光模块层面,800G产品2025年出货量预计大幅放量,1.6T光模块已进入测试阶段,中际旭创、新易盛等厂商深度受益;液冷方面,单机柜功率密度从风冷的15kW跃升至液冷的100kW以上,英维克、高澜股份等温控厂商订单能见度延伸至2026年。电力约束更为突出,十万卡集群满载功耗可达150MW至200MW,年耗电量超过10亿千瓦时,规划因此提出“推进算力电力协同发展,鼓励绿电直连、源网荷储、高效储能等建设模式”,推动智算中心向内蒙古、贵州、甘肃等绿电富集区域布局,PUE指标普遍要求控制在1.2以下。
商业化落地层面,规划提出“推进中国算力平台全面贯通”和“构建全国统一算力服务市场”,指向当前算力市场碎片化、供需错配的痛点。国家枢纽节点“算力互联网”建设已取得阶段性进展,中国移动打造“N+1+X”算力网络架构,实现跨区域算力调度;北京、上海等地发放算力券补贴中小企业用算成本,上海2024年算力券补贴额度达1亿元量级。“普惠算力赋能中小企业发展专项行动”直指中小企业用算贵的问题——目前国内智算服务公开报价中,单张A800等效卡月租约1.5万元至2万元,8卡服务器月成本超15万元,对AI初创企业构成显著负担。应用场景上,推理算力需求正快速超越训练算力,规划明确“面向场景按需部署推理算力设施”,对应大模型API调用量爆发式增长,国产大模型日均tokens调用量已突破数万亿量级。典型案例包括贵安华为云智算集群支撑盘古大模型行业落地、乌兰察布阿里云基地服务电商与金融推理业务,算力供需匹配正从粗放供给转向场景化精配。
从行业趋势与企业动向看,“十五五”规划勾勒出清晰的算力演进路径。其一,集群规模竞赛升级,工信部此前印发的算力强基揭榜行动已围绕超大规模集群组网、高性能传输等方向组织攻关,中国电信2025年资本开支计划中产业数字化投资占比超35%,智算投资超百亿元;其二,国产化替代提速,中国信通院数据显示国产AI芯片在新增智算项目中的中标份额明显上升,适配华为CANN、寒武纪Neuware等软件栈的迁移工具成为竞争焦点;其三,算电协同与绿色低碳成为硬约束,规划要求的算电协同调度将推动智算中心参与电网需求侧响应,绿电直连模式在内蒙古、宁夏先行先试;其四,太空算力开辟新赛道,国星宇航“星算”计划首批组网卫星已发射,规划将其纳入前瞻布局,预示未来五年天地一体化算力网络或进入工程实施阶段。对产业链企业而言,从光模块、液冷到国产GPU、算力调度平台,超大规模集群建设带来的订单周期将贯穿整个“十五五”,规划落地节奏与项目招标进展将成为后续观察的核心指标。
