AI大模型竞赛迈向10万卡集群,但华为仿真显示卡间通信消耗超40%训练时间,算力利用率(MFU)常不足30%,超节点通过高效互联与统一内存编址将数千张卡逻辑上组织成“一台计算机”。
昇腾960超节点基于“灵衢+Hi-ONE”打造,最多扩展至4096卡,提供8EFLOPS FP8算力与1PB HBM容量,RTT时延低至2微秒,较上代规模提升4倍、功耗降低超550千瓦。
华为推出业界首个量产NPO产品Hi-ONE,以7.2Tb/s带宽替代9个800G光模块,昇腾960用约5500个Hi-ONE取代4.8万个光模块,大幅减少故障点与能耗。
灵衢UnifiedBus将互联带宽从百GB级提升至TB级,最大支持51.2万卡乃至100万卡集群,并打通CPU、NPU、内存与存储边界,鲲鹏超节点可形成256TB统一内存池。
