新闻中心

EEPW首页 > 网络与存储 > 编辑观点 > 纯CPU超算灵晟登顶算力榜 英伟达与GPU面临严峻挑战

纯CPU超算灵晟登顶算力榜 英伟达与GPU面临严峻挑战

作者: 时间:2026-07-21 来源: 收藏

与CUDA生态长期垄断AI训练、科学仿真领域的行业背景下,以LineShine(为代表的全新算力体系登上了TOP500榜首,印证了矩阵增强型CPU 正在重构高性能计算底层硬件标准。近日,杰克・唐加拉、松冈聪、托尔斯滕・赫夫勒三位 高性能计算的权威学者联合发布论文《Do We Still Need s? Rethinking AI and Scientific Computing on Matrix-Enhanced CPUs》,完整拆解了无 同构的四层核心技术体系,分别为处理器指令集硬件加速、统一 HBM 高带宽内存架构、全精度混合运算单元、原生高速互联网络。

无GPU矩阵增强型CPU算力体系

早期 GPU 能够替代传统 CPU 的核心优势,是独立硬件承载大规模张量、稠密矩阵运算,而新一代通用 CPU 通过架构改造,将 GPU 的核心算力单元集成至处理器内核,从硬件层面消除算力代差。当前主流商用架构分为三条技术路线:

  1. ARM 架构 SVE/SME 向量矩阵扩展:ArmV8.2-A 引入 SVE 可伸缩向量指令,ArmV9 系列迭代 SVE2 向量单元与 SME 矩阵运算引擎,Arm9.4-A 升级 SME2,支持任意位宽向量运算与批量矩阵乘加。LineShine 搭载国产 LX2 Armv9 服务器 CPU,完整落地 SME2 硬件单元,依靠单芯片矩阵算力实现万亿参数大模型推理,对标富士通富岳 A64FX 处理器的初代 SVE 方案,双精度浮点吞吐量实现显著提升。受 7nm 工艺功耗约束,LX2 主频锁定 1.55GHz、单芯片功耗 650W,若采用 3nm 工艺流片,理论峰值算力不变前提下芯片数量可减半、整机功耗从      42.2MW 降至 25MW,能效从      52.1Gflops/W 提升至 87Gflops/W,超越当前 Grace+H100 异构系统 70Gflops/W 的能效水平。

  2. 英特尔 X86 AVX+AMX 加速单元:AVX-512 向量单元自至强融核时代落地,2020 年推出 AMX 矩阵单元,蓝宝石 Rapids 至强芯片将硬件加速标准化,极光超算全线采用该架构,兼顾传统科学计算 FP64 高精度与 AI 低精度张量运算。

  3. IBM Power 异构矩阵方案:Power10/11、z16/z17 大型机芯片是最早量产矩阵运算单元的通用处理器,分双路线设计:内核内置 MMA 矩阵单元,同时提供 PCIe 外接 Spyre 独立矩阵加速卡;独有原生十进制高精度运算硬件,规避金融仿真舍入误差,主打 AI 推理场景。

AMD EPYC 架构具备集成矩阵单元的硬件潜力,但现阶段未完成商用落地,成为其纯 CPU 算力方案的短板。所有矩阵增强型 CPU 均遵循统一设计逻辑:不再将数值运算作为附加功能,而是将张量、向量流水线作为处理器核心通路,实现 “通用 CPU + 加速器级数值硬件” 一体化设计。 

传统 CPU+GPU 异构架构存在难以根治的内存墙缺陷:CPU 主存与 GPU 显存物理隔离,程序运行时需要频繁跨设备传输张量、仿真网格数据,产生额外延迟、能耗与代码适配成本。即便 Grace-Blackwell、Vera-Rubin 超级芯片搭载 NVLink 高速互联、大容量 HBM,多套独立内存空间的底层矛盾无法根除,大量算力长期处于数据等待状态。

纯 CPU 架构采用单芯片统一内存空间,处理器直连 HBM 堆叠高带宽内存与大容量 DRAM,构建全局统一寻址内存池。LineShine LX2 芯片封装集成 HBM,所有向量、矩阵运算、操作系统调度、MPI 分布式通信、文件 IO、稀疏求解全部在同一内存域完成,无需拆分程序、无需编写跨设备数据迁移逻辑。该设计同时适配两类核心负载:科学计算所需的超大仿真数据集、大模型长上下文推理海量张量存储,解决独立 GPU 显存容量受限的行业痛点。 

GPU 的核心优势之一是原生支持 FP4/FP8/FP16 低精度张量运算,而传统 CPU 仅优化 FP32/FP64 高精度浮点,无法适配深度学习。新一代矩阵增强 CPU 在硬件流水线内置多精度转换电路,完整覆盖 FP4、FP16、BF16、FP32、FP64、INT8、分块缩放 FP8 全精度规格,硬件层面完成精度切换:低精度完成大规模矩阵训练 / 推理,高精度负责误差累加、科学仿真核心求解,兼顾两类负载需求。论文明确指出,低精度矩阵运算并非 GPU 专属硬件能力,CPU 仅需配套矩阵单元即可实现同等精度调度能力。

图片.png 

图1 LineShine的Arm LX2处理器与SME和SVE引擎的示意图(图片来源于 Jack Dongarra 的《中国 LineShine 系统报告》) 

纯 CPU 超算依托处理器内置互联控制器,搭配专用高速互连网络实现千万级核心分布式调度。日本理研富岳、京超算采用富士通自研 Tofu 六维网格环形互联,LineShine配套国产灵启高速互连系统,节点间带宽、端口规模支撑百万级节点并行。相比异构系统,同构 CPU 集群通信逻辑更简洁,不存在 CPU-GPU、GPU-GPU 多层互联协议栈,MPI 并行规约、多尺度耦合仿真、全局数据同步的通信效率显著提升。 

传统 GPU 加速方案要求开发者拆分程序:串行控制逻辑、文件 IO、自适应网格、稀疏计算运行在 CPU,稠密张量、矩阵运算卸载至 GPU,需要单独管理两套内存地址空间,优化线程占用、分支发散、数据排布,开发周期长、代码维护成本极高。市场现有 CUDA 迁移工具(HIPIFY、SYCLomatic、ZLUDA)仅能缓解移植压力,无法消除底层异构架构的编程复杂度。

矩阵增强型 CPU 架构下,开发者仅面向单一通用处理器编程,无需区分主机与加速设备,原生适配不规则负载、动态控制流、自适应算法、稀疏矩阵、图神经网络、多物理场耦合仿真等 GPU 低效场景。论文提到,科学计算大量长尾任务(粒子仿真、自适应网格、不规则内存访问)天然适配 CPU 分支调度优势,叠加高性能稠密矩阵单元后,一套代码可同时完成仿真、数据同化、AI 训练、不确定性量化全耦合工作流,大幅降低科研人员代码开发与迭代时间。

搭建 GPU 异构超算需要双重硬件投入:高性能 CPU 主板、高价 GPU 加速卡、配套 HBM 显存;同时长期承担 CUDA 软件生态授权、专用加速库运维成本。纯 CPU 集群无需采购独立加速器,省去显卡硬件采购支出;消除跨设备数据传输能耗,整机供电、液冷散热运维成本下降;不依赖英伟达 CUDA、cuDNN、cuTENSOR 等专用闭源库,开发者可基于通用 C/C++、OpenMP、标准向量矩阵指令开发,硬件选型不受单一厂商约束。

未来科研主流工作流不再割裂仿真与 AI,而是仿真、机器学习、优化算法、代理模型深度耦合。异构系统需要在 CPU 与 GPU 之间反复切换任务、传输仿真数据,耦合场景效率损耗严重;纯 CPU 统一架构可在单芯片内完成仿真迭代、AI 模型微调、误差修正,数据局部性优势显著,在推理、小模型微调、科学机器学习、图神经网络、仿真内嵌 AI 模块场景性能优于 GPU 异构方案。虽然万亿参数前沿大模型训练仍依赖 GPU 极致张量吞吐,但推理、中小型训练、全耦合科研任务已完全可由矩阵增强 CPU 承载。

GPU 异构集群存在扩展瓶颈:多节点分布式场景下,GPU 算力过剩但内存带宽、互联通信成为瓶颈,大量硬件算力闲置;同时 GPU 数量增加会放大数据传输开销,扩展效率持续衰减。纯 CPU 集群算力、内存、通信资源均衡配比,所有节点硬件规格统一,分布式并行无设备异构带来的调度损耗,千万级核心规模下并行扩展效率保持稳定。

图片.png

图2 FLOPs的增速已经超过了带宽(来源:Gholami等人的《AI与内存墙》) 

无 GPU 高性能计算体系面临的核心技术挑战

(一)超大稠密张量训练峰值算力短板,前沿大模型训练存在性能差距

矩阵增强 CPU 虽集成矩阵硬件单元,但单芯片张量并行规模、低精度算力密度仍低于专用 GPU。对于万亿参数前沿大模型完整训练,CPU 集群需要部署数倍于 GPU 集群的处理器核心,芯片数量、整机占地面积大幅提升;即便依靠 HBM 补足带宽,单位硬件成本下的原始张量吞吐量仍不及英伟达 H200、AMD MI300 系列 GPU,是纯 CPU 架构最核心的技术短板。论文也明确承认,前沿大模型训练场景 CPU 架构门槛极高,短期内 GPU 仍具备不可替代的原始算力优势。

(二)处理器芯片工艺与功耗约束限制单芯片算力上限

以 LineShine LX2 处理器为例,7nm 工艺下芯片面积巨大,必须将主频限制至 1.55GHz 才能控制 650W 功耗上限,单芯片算力释放受限;若切换 3nm 先进工艺,流片成本、制造产能约束会大幅抬升处理器采购单价,抵消能效提升带来的运维节约。相比之下,GPU 芯片工艺迭代路线成熟,单卡功耗控制、算力密度优化经过十余年迭代,单位功耗下低精度算力仍领先 CPU。同时 IBM、ARM、英特尔矩阵单元硬件规格不统一,跨平台程序移植仍需适配不同指令集(SME/AMX/MMA),标准化生态尚未成型。

(三)专用 AI 加速软件库生态成熟度不足

CUDA 经过二十年迭代,形成 cuDNN、cuTENSOR、cuDF、TensorRT 等全套高度优化专用库,覆盖深度学习、张量运算、大数据处理全场景;而矩阵增强 CPU 的配套软件栈仍处于发展初期,ARM SVE/SME、英特尔 AMX 优化库碎片化,缺少统一、高度调优的底层算子库。科研人员若切换至纯 CPU 集群,部分高度依赖 CUDA 专用算子的成熟模型需要重新优化,短期迁移成本较高。

(四)行业软硬件协同设计体系滞后

深度学习整套技术体系长期围绕 GPU 架构协同设计,主流框架 PyTorch、TensorFlow 原生优先适配 CUDA;针对 SME、AMX 矩阵单元的深度优化版本普及度较低,编译器、自动微分工具、算子调度器适配不完善。GPU 生态完成长达二十年软硬件协同迭代,而矩阵增强 CPU 的软硬件协同设计仍处于起步阶段,需要长期投入完善工具链、框架适配。

对英伟达和GPU长期格局的影响

论文核心观点并非否定 GPU 价值,而是重构算力市场分层逻辑。英伟达体系的高昂成本以及各种局限性,让无GPU的矩阵增强型CPU算力体系成为诸多厂商的新选择。这种算力体系未来的普及,必然让GPU产业出现明显市场分化。

  1. GPU 保留超大模型训练高端市场:万亿参数基础大模型、超大规模稠密张量训练场景,GPU 凭借极致低精度算力密度、成熟软件生态维持主导地位,超算中心、头部 AI      企业仍会采购 GPU 异构集群用于基础模型预训练。

  2. 中低端推理、科学仿真、耦合 AI 场景市场被矩阵增强 CPU 持续侵蚀:AI 微调、长上下文推理、科学仿真、多物理场耦合、稀疏计算、图神经网络等负载,纯 CPU 架构凭借编程简洁、综合成本更低、无数据传输损耗的优势,逐步替代      GPU,TOP500 榜单纯 CPU 超算占比将持续提升。

  3. 英伟达主动向 CPU 集成张量硬件妥协:行业趋势倒逼英伟达调整硬件路线,未来其自研 ARM      Grace 服务器 CPU 将集成与 GPU 同源的 Tensor Core 张量单元,打造统一 CUDA X 软件栈,实现 CPU 与 GPU 硬件指令互通,应对矩阵增强 CPU 的竞争压力。

  4. 算力采购多元化,厂商锁定效应弱化:过去机构算力采购只能选择英伟达 GPU,如今可根据负载灵活选择纯 CPU 同构集群、GPU 异构集群,硬件厂商议价能力下降,行业加速摆脱单一硬件生态垄断。 

不过,很多人都认为英伟达真正核心的优势不是GPU性能,而是CUDA体系。CUDA 占据全球 80% 高性能计算开发工具市场,是英伟达最坚固的商业护城河,依托硬件 - 软件 - 开发者深度绑定形成厂商锁定。 

不过这个商业护城河同样出现了挑战者。2018 年成立的 Spectral Compute 推出 SCALE 编译器,基于 LLVM/Clang 架构实现 NVCC 即插即用替代,能够不修改源码直接编译 CUDA 代码,运行于 AMD GPU、第三方 AI 加速器、矩阵增强型 ARM CPU,从软件层面瓦解 CUDA 封闭生态,给英伟达带来多重核心挑战。

图片.png

图3 SCALE编译器致力于将CUDA与英伟达硬件解绑 

首先,SCALE 打破 CUDA 与英伟达硬件的强制绑定,大幅降低开发者跨硬件迁移成本。现有迁移工具 HIPIFY 不支持 PTX 底层汇编、SYCLomatic 仅自动转换 90% 代码、ZLUDA 二进制中转损耗性能,而 SCALE 采用洁净室独立编译实现,完整兼容 PTX 指令集,在 AMD GPU 上性能较 HIPIFY 提升 6 倍,同时兼容英伟达 GPU 并提供额外软件优化,科研机构、企业无需重写 CUDA 代码即可切换至 AMD、国产 ARM CPU 集群,直接削弱英伟达硬件销量基本盘。

其次,CUDA 生态付费与硬件溢价逻辑失效。英伟达依靠 CUDA 软件垄断,GPU 硬件长期具备显著溢价,客户为避免代码重构只能持续采购英伟达加速卡;SCALE 面向高校、非营利机构免费开放,商业企业仅收取低廉授权费,客户可自由选择性价比更高的非英伟达硬件,英伟达硬件定价权持续下滑。同时 SCALE 正在适配 PyTorch 框架、补齐 cuDNN、cuTENSOR 等专用库支持,主流 AI 开发全链路脱离 CUDA 原生工具链成为可能。

最后,行业生态中立化加速,英伟达生态壁垒持续松动。Spectral 已加入英伟达 Inception 初创计划,同时与 AMD、全球超算实验室深度合作,技术中立定位获得全行业认可;其工具已部署于橡树岭国家实验室 Frontier 百亿亿次超算,覆盖全球科研算力场景。长期来看,SCALE 与矩阵增强型 CPU 形成双重冲击:硬件端纯 CPU 架构减少 GPU 采购需求,软件端跨平台编译器消除 CUDA 代码锁定,英伟达依靠 CUDA 构筑的长期垄断格局将进入持续弱化周期,倒逼英伟达开放软件生态、加速 CPU 张量硬件布局以应对竞争。


评论


相关推荐

技术专区

关闭