中科曙光发布ParaCache词元加速方案:等待时间最高降98.5%,吞吐量提升27倍

移动通信网 林知远

8月28日,2026中国国际大数据产业博览会期间,中科曙光正式发布新一代词元加速方案ParaCache,直指大模型推理环节长期存在的“又慢又贵”难题。过去两年,“性能不够、硬件来凑”是国内AI基建的主导思路,GPU采购潮持续升温。但在真实推理业务中,重复计算吞噬算力、GPU高速显存HBM容量不足且价格高昂、跨节点缓存无法共享等问题集中暴露,企业手握大量GPU却跑不出理想业务效果,TCO(总拥有成本)居高不下成为规模化落地的核心障碍。中科曙光分布式存储产品部总经理石静在发布会后接受工信智媒(通信世界)记者专访时表示,AI算力重心已从训练转向推理,单纯堆砌GPU芯片无法解决推理场景的结构性痛点,行业需要从“拼算力”转向“算存协同”的完整方案。ParaCache正是在这一逻辑下推出,试图以存储层优化释放GPU算力,重构推理成本模型。

【关键数据】

[1] 高并发场景下每秒处理词元量最高提升至原来的27倍

[2] 输入约12万词元时单轮对话等待时间最多降低98.5%至0.4秒

[3] 连续20轮对话等待时间由43.1秒降至4.9秒,降幅超80%

[4] 适配场景下内存、SSD硬件采购可节约约三分之一

[5] 头部互联网企业落地案例平均等待时间降低50%以上


从技术原理看,大模型推理分为Prefill预填充和Decode解码两个环节,Prefill阶段计算生成KV Cache(键值缓存)。在多轮对话中,用户提问与历史上下文大量重复,若每次都重新计算全部历史内容,将产生海量无效计算。业界通过KV Cache技术以存储空间换计算资源,但随即遭遇“显存墙”——HBM显存容量有限且价格极其昂贵,长文本、几十轮连续对话场景下KV Cache迅速占满显存,即使GPU计算单元尚有富余,也无法接入更多用户请求,直接导致回复卡顿、请求排队。ParaCache基于中科曙光自研ParaStor分布式存储底座,融合FlashNexus集中式全闪存储,构建四层缓存架构:L1层GPU HBM显存、L2层CPU DRAM内存、L3层SSD(首次将FlashNexus Neo集中式存储纳入缓存池,供多计算节点共享)、L4层POSIX协议分布式存储。方案实现L2、L3、L4三层资源池化,L4层可完整参与缓存卸载、回迁、淘汰、预取动态调度,并支持L1显存与L4分布式存储直接互通,跳过中间环节减少数据搬运开销。尤为关键的是自研XDS技术,其功能类似英伟达GDS,但可兼容国产AI加速卡,实现国产算力硬件直连分布式存储完成缓存读写,这是方案大规模落地的基础。

性能数据是ParaCache最直接的竞争力。实测结果显示,“多”体现在高并发场景下系统每秒处理词元量最高达到原来的27倍;“快”体现在输入约12万词元时,单轮对话首字等待时间最多降低98.5%至0.4秒,连续20轮对话中该时间降低80%以上,由43.1秒降至4.9秒;“好”体现在兼容主流推理框架和国产AI加速卡,可在现有系统基础上接入,降低部署迁移成本;“省”体现在高频内容保留显存、其余下沉至低成本存储设备。横向对比,市面上现有方案存在明显短板:开源LMCache只能实现单机内部缓存隔离,无法跨GPU、跨节点共享,仅适合小规模单机场景;传统分布式存储受分布式锁和IO开销拖累,延迟居高不下,只能充当冷数据仓库,难以参与推理过程中的缓存读写。大规模集群环境下,现有方案缺少全局统一视图,陷入“元数据迷雾”,调度效率大打折扣。ParaCache的全层级池化加全局管理设计,正是针对这些空白形成差异化。石静同时坦承,成本收益高度取决于业务形态,在适配场景下内存、SSD硬件采购可节约约三分之一,但若业务上下文复用度很低,收益则有限。

从产业链角度分析,ParaCache的价值在于重构推理基础设施的成本结构。当前企业应对长上下文、高并发业务的常规路径是采购更大显存的高端GPU,硬件成本持续攀升,且多轮对话、智能体场景下GPU仍在做大量无效计算,算力利用率难以提升。ParaCache将“冷”KV Cache下沉至内存、SSD和分布式存储,使昂贵HBM显存聚焦高频数据,直接降低对高成本显存和新增硬件的依赖——这实质上把存储厂商推入了AI推理价值链的核心环节。方案本身也整合了多条产品线:ParaStor分布式存储、FlashNexus集中式全闪存储,并联合多家主流第三方KV管理厂商定制开发,形成从存储硬件到缓存调度的完整栈。对上游而言,国产AI加速卡借助XDS技术获得直连分布式存储的能力,缩小了与英伟达GDS生态的差距;对下游而言,企业可在不更换现有系统和国产算力底座的前提下接入,部署门槛显著降低。石静提出的“从存数据到存智能”概念,即把计算完毕的KV Cache作为可反复使用的数据资产管理,为存储行业开辟了新的增长维度——存储不再只承载原始文档,而直接参与推理计算流程。

商业化进展方面,ParaCache已完成生产级验证,并精准适配长文本对话、知识库问答、智能客服、智能体及高并发推理等场景。目前已在国内某头部互联网企业在线推理业务中落地,模型开始回答前的平均等待时间降低50%以上,同等硬件条件下系统可承载的业务请求提升数倍。石静强调,ParaCache并非提升单张GPU的性能,而是通过减少重复计算,把更多算力用于处理新任务。不同行业诉求差异显著:大模型训推混合场景看重带宽、低时延与综合成本;教育AI场景知识库多、小文件多、并发波动大;医疗行业堆积大量影像和病理病历,长病历RAG推理需求旺盛,对缓存下沉的需求更为迫切。这些场景的共同特征是上下文重复度高、对话轮次长,正是KV Cache复用机制收益最大化的业务形态。对于已投入重金采购GPU的企业而言,ParaCache提供的是在不新增算力投资前提下提升服务能力的路径;对于计划建设智算中心的机构,方案则意味着算力、存力的配比规划需要重新测算。

行业层面看,AI推理架构范式正在发生实质变化。石静的判断是:以前GPU是整套架构的绝对中心,KV Cache只是临时中间产物;现在KV Cache已成为一类重要数据资产,GPU更多围绕这份资产完成计算,管好KV Cache将直接影响推理服务的成本、响应速度和AI智能体的扩展能力。这一判断指向两个方向:其一,算力芯片迭代提升的是单卡性能天花板,而缓存、存储层优化目标是把现有GPU算力真正用透,两者构成互补而非替代关系;其二,未来智算中心建设将从单一算力指标转向算力、存力、网络、缓存调度的一体化规划,这为国产存储厂商切入AI基础设施主战场打开了空间。当前国内存储厂商在分布式存储领域已有成熟积累,叠加国产AI加速卡生态的适配需求,“算存协同”路线下的确定性机会正在形成。对企业用户而言,少一次重复计算意味着少一段等待、少一份算力消耗,在GPU采购成本高企的现实约束下,存力优化的边际收益正在超越单纯堆卡的边际收益,这一变量将重塑AI推理基础设施的投资决策逻辑。


微信扫描分享本文到朋友圈
扫码关注5G通信官方公众号,免费领取以下5G精品资料
  • 1、回复“YD5GAI”免费领取《中国移动:5G网络AI应用典型场景技术解决方案白皮书》
  • 2、回复“5G6G”免费领取《5G_6G毫米波测试技术白皮书-2022_03-21》
  • 3、回复“YD6G”免费领取《中国移动:6G至简无线接入网白皮书》
  • 4、回复“LTBPS”免费领取《《中国联通5G终端白皮书》》
  • 5、回复“ZGDX”免费领取《中国电信5GNTN技术白皮书》
  • 6、回复“TXSB”免费领取《通信设备安装工程施工工艺图解》
  • 7、回复“YDSL”免费领取《中国移动算力并网白皮书》
  • 8、回复“5GX3”免费领取《R1623501-g605G的系统架构1》
  • 本周热点本月热点

     

      最热通信招聘

      最新招聘信息

    最新技术文章

    最新论坛贴子