智东西
作者 | 程茜
编辑 | 李水青
7月31日,华为正式开源了基于昇腾NPU训练的盘古MoE模型——openPangu-2.0-Pro。
作为openPangu-2.0系列的最新成员,该模型总参数量达到5050亿,激活参数为180亿,支持512K超长上下文,训练数据涵盖约34T tokens。此前,轻量化版本openPangu-2.0-Flash已于6月12日先行开源,其参数量为92亿,其中激活参数仅占6亿。
回顾今年6月12日的华为开发者大会,华为常务董事、产品投资评审委员会主任兼终端BG董事长余承东在现场发布了openPangu-2.0-Flash,并预告了Pro版。当时他放话要将盘古大模型推向世界第一。此次Pro版的开源,正是这一豪言后的首次重磅落地。
虽然技术报告未公开与第三方模型的直接对比数据,但明确指出,openPangu-2.0系列在通用能力、逻辑推理及智能体相关的主流评测基准中,均展现出强劲的对标实力。
在架构层面,openPangu-2.0-Pro进行了全面重构:
注意力机制方面,延续高效MLA设计,引入DSA+SWA独立分层混合架构,层级配置比例为1:2。其中,SWA层专注局部窗口建模,DSA层负责稀疏全局聚合,此举在维持精度的同时,大幅削减了长序列推理所需的计算、显存及访存开销。
拓扑结构上,传统残差连接被升级为4支流mHC架构,有效增强了表征多样性与泛化潜力。
自投机模块采用3头MTP架构,单次额外预测3个token,从而提升推理效率。
优化器选用Muon,使模型训练收敛速度更快。
研究团队还发现一种正向协同反馈机制:底层扎实的基础推理能力可直接支撑复杂智能体行为;反之,智能体的持续运行也会反向迭代优化模型的多阶任务规划能力及长轨迹上下文处理水平。
目前,openPangu-2.0-Pro的模型权重、基础推理代码及技术报告均已开源上线。
开源地址:
技术报告:https://huggingface.co/openpangu/openPangu-2.0-Pro/blob/main/openPangu-2.0%20Tech%20Report.pdf
一、聚焦长上下文智能体任务,软件工程领域仍有差距
智能体应用对模型提出了更高要求:需执行长程任务、精准调用外部工具,并在长时间运行中保持认知一致性。
但在实际部署中,问题随之浮现。现有通用框架往往带来不必要的推理资源损耗,上下文拉长更会拖累表现;此外,传统对齐手段稳定性欠佳,导致长周期任务常出现时间逻辑或层级结构的推理偏差。
为此,openPangu-2.0系列融合自研硬件内核、整机系统架构以及训推一体化的智能体强化学习算法,配合专属推理加速方案,构建起一套软硬件协同体系,专为长上下文智能体任务而生。
该系列包含新开源的openPangu-2.0-Pro,以及6月12日发布的轻量化模型openPangu-2.0-Flash(92亿参数,含6亿激活参数)。
发布Flash时,余承东指出,从算法架构到训练推理,盘古模型针对昇腾算力进行了深度优化,且开源程度更深。昇腾原生训练效率提升30%,这也是业界首个采用DSA+SWA独立分层混合架构的模型。他强调,这是首个开源预训练代码、后训练代码及训推算子的模型。
据Hugging Face数据,上月本地离线模型openPangu-2.0-Flash GGUF下载量达39935次。
此外,华为还推出了一款面向资源受限环境优化的30亿参数模型,其中2亿为激活参数。
研究人员利用多个公开基准测试评估了openPangu-2.0的性能。尽管技术报告未披露与第三方模型的详细对比,但确认其在通用能力、推理任务及智能体测试中表现优异。不过在处理复杂的现实世界软件工程任务时,与顶尖模型相比仍存在明显短板。
通用能力测试显示,openPangu-2.0-Flash和Pro在上下文学习、指令遵循及多轮理解等方面均表现不俗。在世界知识与事实可靠性测试中,Pro的表现远超Flash。
华为内部实验表明,为模型夯实基础知识与推理能力,有助于其掌握更复杂的智能体行为和编程技能。相反,在复杂智能体环境中训练,能显著提升模型的基本能力,如指令遵循、长轨迹上下文处理、多步推理及程序规划等。
同时,在训练期间及结束后,持续提供高质量、多样化的长轨迹智能体数据及互动环境极具优势,这将成为未来模型升级的核心策略之一。
二、核心在于分层混合注意力机制,预训练语料达34T tokens
openPangu-2.0系列的核心架构通过分层混合注意力机制实现上下文计算解耦:滑动窗口注意力(SWA)用于处理稠密局部上下文,深度稀疏注意力则负责全局稀疏信息检索。
为实现推理加速,模型搭载了三头多Token预测(MTP)模块,并将流形约束超连接(mHC)与Muon优化器结合,在固定数据投入下提升收敛速度。
▲openPangu-2.0模型架构
针对MoE负载均衡、mHC结构稳定性、MTP训练策略及Muon参数分组,研究人员设计了专属优化方案,以保障端到端训练的稳定性。
当模型扩展至512K上下文窗口,叠加mHC、Muon、MTP等多重复杂架构单元时,通信开销与显存占用瓶颈凸显。
为此,研发人员搭建了一套系统化协同优化框架:融合无冗余混合上下文并行(CP)、面向MTP的轻量化点对点数据传输、适配Muon优化器的分布式计算通信重叠机制及混合重计算策略;依托Ascend C专用语言定制融合内核,对mHC、参数化注意力汇点(PAS)、模块化注意力(ModAttn)模块进行深度加速。
▲Muon通信与计算重叠情况
为释放CloudMatrix 384超节点集群的整体算力,落地了一套精简且感知网络拓扑的硬件亲和调度策略,将高带宽数据流限制在超节点内部交互,最大限度减少跨节点传输开销,打破集群运行瓶颈,实现硬件资源利用率最大化。
预训练阶段,openPangu-2.0语料库包含约34T tokens。为优化学习过程,预训练分为三个阶段,各阶段采用特定数据配方和选择策略逐步提升模型能力:
第一阶段为通用领域(25T tokens),旨在建立扎实的通用知识和广泛的语言基础。
第二阶段聚焦推理能力培养(8T tokens),提升深度推理、逻辑思维及高级编程技能。
第三阶段进行退火处理(1.4T tokens),优化模型行为及智能体能力。研究人员特意保留较长文档和复杂轨迹数据,以在此阶段最大限度提升模型的自主任务处理能力。
预训练语料库汇集了网页、书籍、PDF文件、多语言文本、代码库等数据。
后训练阶段分为三级流水线:监督微调(SFT)、并行强化学习专家训练、多专家在线策略蒸馏(OPD)。
▲监督式微调
完成统一监督微调后,系统并行训练多组强化学习专家模型。各组专家依托独立数据集与专属奖励函数,分别针对逻辑推理、通用问答、智能体交互、代码生成四大领域优化策略,消除强化学习过程中的跨领域任务干扰。
最后借助在线策略蒸馏完成各路专家能力的融合聚合。
推理加速方面,华为自研昇腾原生推理框架,实现硬件执行逻辑与模型运行时动态行为的耦合。
该架构自研多款融合算子,包括面向推理场景优化的mHC算子、专用集合通信原语,配套Felix上下文并行、单核多流执行等并行策略。
▲Felix流水并行(CP)方案完整前向计算流程
为提升推理吞吐,框架搭配定制量化方案与算子感知式保精度量化机制;集成混合KV缓存管理、无损并行分词(LoPT),基于模块化注意力(ModAttn)原生适配自动前缀缓存(APC)与MTP技术。
在128K上下文长度下,这套框架在昇腾NPU硬件上的长上下文推理性能表现为:openPangu-2.0-Flash版本最低TPOT时延可达5.63ms,在TPOT为15ms工况下单卡NPU生成吞吐1846 token/s;openPangu-2.0-Pro版本最低TPOT时延9.55ms,TPOT 20ms条件下单卡吞吐1326 token/s。
结语:华为欲借openPangu打造端侧智能体生态
基于Ascend平台的软硬协同设计方法,openPangu-2.0模型解决了大模型训练、长上下文对齐及推理效率方面的关键瓶颈。
此外,华为在技术报告中强调,目标不止于静态基准测试的性能,更看重实际系统的实用性。openPangu在战略上占据有利地位,有望成为智能设备、汽车等领域智能体应用的核心竞争力。
华为正积极扩展基于边缘计算的能力,利用麒麟处理器架构突破设备智能化极限。为实现这一变革,将以昇腾硬件生态系统为基础,进一步扩展基于沙盒的仿真流程,在复杂且开放的场景中生成大量高保真度执行数据集。
未来几个月,研究人员将持续迭代该模型,目标是在编程和复杂智能体任务方面,系统地提升openPangu的核心能力。








