新芒xAI 9月20日消息,华为在华为全联接大会2026上发布昇腾960超节点,单个系统可扩展至4096张算力卡,采用近封装光学(NPO)光引擎、正交架构与全液冷设计,面向十万亿参数规模模型的训练和推理。
关键要点
华为披露,昇腾960超节点基于灵衢实现内存统一编址,可提供8 EFLOPS FP8和16 EFLOPS FP4算力。系统使用5500个Hi-ONE光引擎,替代传统方案所需的4.8万颗800G光模块,官方称可降低超过550千瓦功耗。
Hi-ONE单引擎总容量为7.2T,采用内置光源。华为还称系统无故障运行时间较上一代提升一倍,可用度达到99.8%。以上性能、能耗与可靠性数据均为厂商发布口径,仍需在不同模型和真实集群负载下验证。
多个昇腾960超节点可通过灵衢网络或RoCE组成更大集群。华为同时推进CANN常态化开源社区运营,以改善模型适配与开发工具生态。
新芒xAI评论
对大模型团队而言,4096卡规模的价值不只在卡数量,而在于通信、内存与故障管理能否把算力转化为有效训练时间。超大模型训练中,单点故障和跨节点通信开销会直接影响成本与交付周期。
对国产算力生态而言,NPO和统一编址试图从系统层面弥补单芯片差距。但客户仍需关注模型迁移成本、算子覆盖、工具成熟度、供应能力和长期运维,而不能只根据峰值算力指标采购。
这次发布为大型训练和推理提供了新的基础设施选择,真正的竞争力将由可持续利用率决定。后续应观察第三方实测、规模部署案例、能耗成本和主流模型原生适配情况。