移动通信网 程然
2026年9月22日,2026骁龙峰会期间,高通技术公司宣布与阶跃星辰、无量火及江波龙达成四方合作,基于第六代骁龙8超级至尊版移动平台,完成阶跃StepEdge-Omni 30B-MoE(混合专家)模型的端侧深度适配与推理优化,并在峰会现场基于高通参考设计完成实机演示,跑通了从邮件理解、行程规划、日历同步到航班酒店推荐、行程分享、邮件草拟的全链路自主办公流程,全程本地完成,无需云端调用。阶跃副总裁、端侧模型负责人俞刚确认,该模型是目前市面上规模最大的手机端侧模型,也是首个在第六代骁龙8超级至尊版平台上完成跑通和验证的MoE模型。端侧智能体AI当前面临的核心矛盾在于模型规模与终端算力、内存之间的错配,30B参数级别模型此前基本只能在云端部署,此次四方合作通过芯片、模型、推理引擎与存储的协同设计,首次将该量级MoE模型在智能手机上实现持续稳定运行,为智能体AI体验脱离云端依赖、规模化覆盖消费终端提供了可复制的工程范式,标志着端侧大模型竞赛从参数规模比拼转入系统工程能力比拼阶段。
【关键数据】
[1] 端侧运行模型规模达30B参数(StepEdge-Omni 30B-MoE)
[2] 运行内存需求相比行业常规方案降低超50%
[3] 预填充吞吐性能超330 Token/s,较仅用NPU方案提升超30%
[4] 解码吞吐性能超28 Token/s,首个词元生成达毫秒级
[5] 定制Oryon CPU峰值频率5GHz,Hexagon NPU共享内存扩容50%
从技术原理看,MoE架构与Dense稠密模型存在本质差异:Dense模型每次推理需激活全部参数,而MoE模型仅按任务需要激活部分专家模块,在保持大模型容量与能力的同时显著降低计算量和内存带宽需求,这也是30B规模模型能够下沉到手机端的前提。硬件层面,第六代骁龙8超级至尊版搭载定制Qualcomm Oryon CPU,峰值频率高达5GHz,并引入可扩展缓存架构Oryon FlexCache,强化智能体多任务处理与系统规划;Adreno GPU引入面向AI负载的Adreno Matrix Cores,并支持Adreno Neural Fusion特性,将AI与图形处理深度耦合;Hexagon NPU针对智能体AI的Transformer工作负载新增Element Accelerator,大容量共享内存扩容50%,平台同时配备LPDDR6内存与高速存储通道。软件层面,无量火自研的Ember推理引擎与Ember Kernel端侧编排内核,通过XCompute异构调度实现跨CPU、GPU、NPU的统一高性能编排,在不修改模型结构、不损失推理精度的前提下,将30B-MoE模型的运行内存需求相比行业常规方案降低超50%,这是整套方案中最关键的工程突破。
性能数据方面,得益于NPU与GPU双引擎协同,模型预填充吞吐性能超过330 Token/s,对比仅使用NPU的通用推理方案提升超过30%;解码吞吐性能超过28 Token/s,且能保持持续稳定运行;首个词元生成速率达到毫秒级,对比云端API调用快数倍至数十倍,直接消除了端侧推理在响应速度上相对云端的短板。存储环节,江波龙提供端侧AI存储解决方案,模型权重可从端侧闪存高效加载,通过存储与计算协同减少大模型对运行内存的持续占用,其行业独有的iSA存储智能体已率先适配该平台,解决大模型推理的存储瓶颈。从竞争格局看,端侧大模型赛道上苹果、联发科均已推动自有或合作模型上机,但目前已公开披露的端侧模型多集中在3B至10B级别,30B级别MoE模型在手机端跑通属行业首例。高通技术公司高级副总裁兼手机业务总经理Chris Patrick表示,此次合作展现了硬件、软件、内存和AI模型多领域技术进步如何推动复杂AI工作负载直接在移动终端上运行,这些成果将有助于推动更快速响应、更注重隐私保护的AI体验落地智能手机。
从产业链视角分析,此次四方合作覆盖了端侧AI落地的完整链条:高通提供SoC算力底座与完整软件栈,阶跃星辰输出30B级MoE基础模型,无量火贡献推理引擎的异构调度与内存优化能力,江波龙补齐存储加载环节。这种“芯片+模型+引擎+存储”的分工模式,与此前手机厂商主导的自研端侧小模型路径形成对照——前者强调专业分工下的工程极限优化,后者强调生态闭环。成本结构上,MoE架构按需激活专家模块的特性,意味着推理阶段的算力开销与被激活参数量而非总参数量挂钩,配合内存需求降低超50%的优化成果,手机厂商无需为运行30B模型堆叠超大运行内存,可在现有12GB至16GB内存配置基础上实现部署,显著降低了旗舰机型的BOM成本压力。江波龙副总裁、嵌入式存储事业部总经理黄强指出,端侧AI的规模化落地离不开算力与存储的深度协同,通过存算协同可释放平台算力价值,突破端侧大模型推理存储瓶颈,这一定位将存储厂商从配角推向端侧AI价值链的核心环节。
商业化进展方面,此次合作已从概念验证推进到参考设计层面的现场演示阶段,演示的智能体助手覆盖办公场景全链路:从邮件理解到行程规划、日历同步、航班酒店推荐、行程分享再到邮件草拟,均由模型自主完成并全程本地运行,无云端调用。这一演示形态表明方案已具备向商用机型迁移的成熟度,按照行业惯例,参考设计验证完成后,搭载该方案的商用旗舰手机通常可在半年至一年内面世。应用场景层面,低时延、高隐私的端侧智能体具备天然优势:毫秒级首字响应适合实时交互场景,本地推理适合涉及个人邮件、日程、位置等敏感数据的任务,离线可用性则适合差旅等弱网环境——演示选择的行程规划场景恰好同时命中上述三类需求。无量火CEO王瑜琨表示,Ember推理引擎将大模型内存需求降低超50%,让手机即可流畅运行30B级MoE模型,下一步将推动手机进化为真正懂用户的个人智能终端。
行业趋势层面,端侧AI正在经历三个方向的同步演进:模型架构上,MoE正取代Dense成为云端大模型向终端迁移的主流路径,此次30B-MoE跑通验证了该路径在手机端的可行性;硬件架构上,NPU、GPU、CPU异构协同取代单NPU推理成为性能挖掘方向,NPU+GPU双引擎带来超30%的预填充吞吐提升即是直接证据;存储架构上,存算协同成为新变量,闪存直接承载模型权重加载正在改写端侧内存配置的逻辑。对企业动向的影响而言,高通通过开放平台聚合阶跃、无量火、江波龙等生态伙伴,强化了其在安卓阵营端侧AI底座的话语权;阶跃星辰借端侧合作开辟了区别于云端模型价格战的第二增长曲线;江波龙则借iSA存储智能体卡位端侧AI存储新赛道。对消费者而言,首代端侧智能体手机的实际体验将取决于商用机型的功耗控制、发热表现与内存配置策略,这些工程细节将成为2027年旗舰机竞争的分水岭,端侧AI的规模化扩展已从技术问题转变为产品定义问题。
