摘要:华为发布 Peerium 全新计算架构与昇腾 960 超节点:灵衢统一互联总线、Hi-ONE NPO 光引擎,单超节点 4096 卡、集群可扩至百万卡;昇腾正式进入 PyTorch 官网可直接安装。

9 月 17 日的华为全联接大会 2026,本周仍在持续发酵,因为它指向的不是一颗芯片,而是一整套"把百万颗芯片连成一个大脑"的计算体系。华为发布 Peerium 全新计算架构,核心是用自研"灵衢"高速互联总线,把上百万颗处理器从一堆各自独立的机器,变成逻辑上的一台计算机——所有处理器地位对等,配合统一内存寻址,任意一颗芯片都能直接读取其他芯片的内存,不需要额外中转。

落地的产品是昇腾 960 超节点。它采用正交架构与全液冷设计,基于灵衢实现内存统一编址,单节点 4096 卡规模,最大提供 8E FLOPS FP8(16E FP4)算力、1PB HBM 容量。光互联用上业界首个量产、内置光源的 NPO 产品 Hi-ONE,单引擎 7.2T 传输容量,系统内 5500 个 Hi-ONE 替代原本需要的 4.8 万颗 800G 光模块,功耗降低超过 550 千瓦,系统可用度达 99.8%。集群层面通过二层 CLOS 四平面组网,最大可支持 100 万卡昇腾超节点集群。

02-华为Peerium架构与昇腾960百万芯片大脑.jpg

这套打法的底层逻辑,是国内算力在先进制程受限制约下的"换道"选择。华为自己也说得很直白:算力的瓶颈很多时候不是单芯片算得慢,而是芯片之间沟通太慢。传统冯·诺依曼主从架构里,总管(主机)一旦成为瓶颈,集群越大效率越低。Peerium 把主从逻辑推翻,换成嵌套并行的递归任务拆分,让海量芯片协同干活、减少通信损耗。这不是否定先进制程,而是把竞争主战场从"单芯片纳米数"切换到"系统架构与互联技术"。

生态侧的进展同样关键。CANN 进入常态化开源社区运作,外部开发者占比达 61%,首次超过内部;社区月活突破 5200 名,基于昇腾+CANN 的原生训练模型已超 40 个;昇腾更成为 PyTorch 官网可直接安装的算力平台——这是首个来自中国的算力平台获得这种地位。对国内 AI 企业,这意味着训练万亿参数以上大模型,不必完全绑定海外高端芯片。

值得补充的是,这套架构对软件栈的冲击可能比硬件本身更深。过去国内大模型训练高度依赖 CUDA 生态,迁移成本高;昇腾这次把 CANN 推成常态化开源社区、外部开发者占比超 6 成,并进入 PyTorch 官网直接安装,等于在“编译层”抢到了一个事实标准的位置。对开发者而言,写一份能在昇腾上跑的代码,不再需要先吃透一套私有工具链,迁移摩擦大幅下降。当然,生态成熟度仍和 CUDA 有代差,但“可在官网一键装”这个动作,本身就是从 0 到 1 的门槛跨越。

我的判断:华为这次发布的真正分量,不是某个跑分数字,而是"算力的上限不再完全绑定光刻机"这个命题被工程化了。Atlas 950 集群已经落地、昇腾 960 完成测试,它不是纸上概念。但也要清醒:百万卡完整集群的部署、运维、软件生态仍有漫长优化路。对采购方最实用的启示是——评估国产算力,重心要从"单卡算力"转到"集群交付与互联带宽",这两项的权重正在超过晶体管密度。