7月31日,华为正式兑现了今年6月在HDC 2026开发者大会上的承诺——开源盘古5050亿参数的openPangu-2.0-Pro模型,同步开放模型权重、基础推理代码及技术报告。这是继6月30日开源92B参数的openPangu-2.0-Flash之后,华为在开源大模型领域的又一次重磅落子。

5050亿总参数,512K超长上下文

openPangu-2.0-Pro是基于昇腾NPU训练的大规模混合专家(MoE)语言模型。总参数规模约505B(5050亿),每Token激活参数约18B,支持512K上下文长度,训练数据总量约34T Tokens。后训练阶段完成了快慢合一微调(SFT)、多专项强化学习(RL),并通过在线蒸馏(OPD)完成能力合一。

openPangu-2.0系列提供Pro和Flash两个版本,均采用MoE混合专家架构。Pro版总参数量5050亿、激活参数量180亿;Flash版总参数量920亿、激活参数量60亿,主要面向轻量化部署场景。两个版本统一支持512K超长上下文窗口,能够一次性处理数十万字内容。

架构全面升级:DSA+SWA混合架构+MTP自投机

openPangu-2.0-Pro在模型架构上实现了多项升级:

Attention架构沿用高效MLA,并采用DSA+SWA独立分层混合架构,层配比为1:2。SWA层负责局部窗口建模,DSA层负责稀疏全局聚合,在保持精度的同时显著降低长序列推理的计算、显存与访存开销。

拓扑架构将传统残差连接升级为4支流mHC架构,提升表征多样性与泛化能力。

自投机模块采用3头MTP架构,一次额外预测3个token,显著提升模型的推理速度。

训练优化采用Muon优化器,获得更快的收敛速度。

瞄准Agent时代:专为长上下文智能体任务打造

技术报告披露,openPangu-2.0-Pro专为长上下文智能体任务打造。智能体应用要求模型能够执行长程任务、精准调用外部工具、在长时间运行时保持认知一致性。研究发现,底层性能强劲的基础推理能力能够直接支撑复杂智能体行为运行,而智能体的持续运行又会反向迭代优化模型的多阶任务规划能力与长轨迹上下文处理水平。openPangu-2.0系列模型在通用能力、逻辑推理、智能体相关主流评测基准中均具备出众的对标实力。

算力有限为何仍坚持开源?

对于openPangu-2.0-Pro总参数“仅”505B,余承东曾解释:算力大量支持了国内其他企业需求,华为自己留的数量有限;此外,AI算力成本非常高,华为更聚焦时延和吞吐率的提升。在算力受限的情况下依然坚持开源5050亿参数模型,这一动作本身释放的信号比参数数字更值得关注——华为正在通过昇腾原生训练与推理技术,为业界用好昇腾提供最佳实践参考。

开源地址与体验方式

openPangu-2.0-Pro模型的模型权重、基础推理代码及技术报告已正式开源上线:

Hugging Face:https://huggingface.co/openpangu/openPangu-2.0-Pro

AtomGit(Ascend Tribe开源社区) :https://gitcode.com/ascend-tribe

技术报告:https://huggingface.co/openpangu/openPangu-2.0-Pro/blob/main/openPangu-2.0%20Tech%20Report.pdf

开发者还可访问华为云MaaS模型即服务平台在线体验。

从6月承诺到7月兑现,华为用一个月时间完成了从Flash到Pro的开源拼图。当一家硬件公司把5050亿参数的模型权重和推理代码全部开放,它在赌的不是一个模型的成功,而是一整个生态的成长。