nh1

超智融合新范式:清程极智基于“灵晟”超算实现纯CPU MoE模型分布式推理

栏目:行业   作者:苏秦    发布时间:2026-07-31 20:24   阅读量:8481   会员投稿

在高性能计算(HPC)与人工智能深度融合的浪潮下,构建“超智一体”基础设施已成为产业升级的核心诉求。如今,“灵晟”国产超算依托超智融合体系架构创新,登顶全球超算TOP500,并联合清程极智打造纯CPU MoE模型分布式推理方案,“灵晟”成功打破HPC与AI算力壁垒:既坐稳了科学计算的头把交椅,也在AI大模型推理中展现出卓越性能。它正在重新定义何为“好用、易用”的超智融合算力平台。

架构革新:“灵晟”筑就AI大模型推理新基石

为何要在超算上跑AI?产业需求揭示了两大核心动因:一是方法融合,科学计算物理模型与数据驱动的AI深度结合,催生颠覆性科研成果;二是效能提升,超算平台通过错峰运行AI任务,最大化利用算力资源。以此为视角审视“灵晟”,其最大的亮点在于架构层面的原生超智融合。

●算力侧:不同于单纯堆砌专用加速卡的传统路径,“灵晟”在自研的LX2 CPU中引入矩阵加速单元并支持多精度,实现片上HPC算力与AI算力的深度融合。尤为关键的是,CPU集成了片上内存(高带宽内存),可提供TB级带宽,相较传统CPU实现了十倍跃升,为大模型推理中的大批量并发处理提供了充足的带宽保障。

●网络侧:自研的“灵启”网络支持μs级低时延传输,具备可扩展至200万端口、10万节点的超大规模组网能力。这种极低时延、极高扩展性的互联特性,有效消除了分布式推理中的通信瓶颈。

硬件创新只是第一步。“灵晟”LX2 CPU与GPU/NPU架构存在本质差异,要将大模型从“专卡”平滑迁移至“通卡”,必须攻克软件层面的重重难关。

软硬协同:释放超智融合澎湃算力

HPC与AI虽属不同计算范式,但在核心优化思路上却一脉相承——均依赖算子优化、计算与访存重叠、流水线并行及多级并行等手段,以充分释放硬件性能。结合“灵晟”平台硬件特性及自研软件,清程极智从多个技术维度对大模型推理进行了深度加速。

1. 面向“灵晟”LX2 CPU的算子开发与优化

针对“灵晟”自研软硬件,清程极智完成了算子的重构:基于LX2 CPU的矩阵运算指令集,结合OpenMP与自研编译器实现计算算子;基于自研通信库构建通信算子。借助自研统一并行加速库——该库具备计算图语义扩展、共享内存通信加速、多线程调度优化及硬件特性抽象等核心能力,清程极智实施精细化的指令序列控制,应用计算掩藏访存、异步流水线调度等优化策略。针对无依赖关系的多个算子,团队切分线程池,分布线程并行度,让少数线程负责并行度低的算子,多数线程负责并行度高的算子。例如Shared expert与EP通信同时进行,实测显示,MoE推理时延1440μs大幅降低至980μs。

2. 面向“灵晟”集群的多层次并行推理优化

LX2 CPU采用NUMA架构并集成片上内存,结合“灵启”网络的强劲互联能力,与DeepSeek大EP(Expert Parallelism,专家并行)架构天然契合,具备极佳的集群扩展性。基于此,清程极智实施了多维度的并行策略优化:灵活配置张量并行(TP)、流水线并行(PP)、专家并行(EP)及数据并行(DP),构建多层次混合并行推理方案。在DeepSeek部署上,团队采用EP256的大规模专家并行配置,专家权重的全量分散部署,节点内TP16,节点间DP16,并针对Attention模块,设计了定制化混合并行策略,充分释放了LX2平台的算力密度与通信能力。

3. MTP(Multi-Token Prediction)技术加持

在上述优化基础上,清程极智引入了DeepSeek MTP加速技术,一次推理产生多个token,再并行验证每个token否正确,显著提升了单请求的输出速率。团队还深入探究了不同并发规模下MTP加速比与预测深度的相关性,持续调优以实现最佳推理效果。

打破边界:引领超智融合新范式

基于“灵晟”多样性算力架构的创新与清程极智的AI推理加速技术,成功实现了DeepSeek模型的高效部署,率先实现纯CPU MoE模型分布式推理,16节点即可流畅运行DeepSeek-V3/R1-671B模型,在batch_size=2048时,输出吞吐量与80张主流GPU集群相当。

针对规模化部署DeepSeek场景,“灵晟”研发团队正在基于SGLang推理引擎进行深度优化,最新测试数据显示,在64节点规模下处理长文本摘要任务时,TPOT(每输出token时延)在55ms内,单CPU Decode吞吐达586.8 TPS;节点规模从64节点扩容至8192节点时,并行效率超过74%,印证了“灵晟”系统极强的可扩展性

这意味着,“灵晟”不仅能同时支撑HPC与AI工作负载,更兼具卓越的性能表现与极高的经济性,这不仅从技术底层重塑了超智融合范式,更将以此为支点,为各行业复杂场景提供精准、高效的计算支撑,全面释放超智算力潜能,加速科研与产业数智化升级。

ad