随着大模型参数规模持续增长,算力竞争已从单颗芯片性能转向系统协同效率。华为常务董事杨超斌指出,传统架构下十万卡集群实际模型算力利用率仅约20%,大量资源消耗在通信等待上。
华为提出以灵衢互联为核心的新计算架构,将CPU、NPU、内存、存储等十余种协议统一,互联带宽从百GB级提升至TB级,通信时延压缩至2微秒,实现超节点内全局内存统一编址与资源池化。
针对Agentic AI场景,华为推出AF分离部署,将Attention与FFN解耦到不同算力单元,CPU与NPU可按需灵活配比。同时通过分级存储与全局池化,让DDR成为NPU的“第二内存”,降低对单卡HBM的容量依赖。
灵衢已扩展为覆盖柜内、跨柜和集群的三级互联系统,支持从单柜到百万卡集群的弹性扩展。华为同步发布Agentic AI超节点集群及系列化一体机,中小企业也能本地运行万亿参数大模型。
生态方面,灵衢开源社区月活开发者超5200人,累计合入超428万行代码,CANN社区跃居中国开源项目活跃度第一。华为表示将坚持系统级创新,联合伙伴共建算力生态。
