AI计算的未来不会只依靠单一类型芯片
核心要点:
计算集群存在多种并行范式:张量并行、数据并行、上下文并行、流水线并行,每一种范式对网络拓扑的要求各不相同。
推理解聚合:一套集群专门负责预填充阶段,另一套负责解码阶段,还有一套完整计算集群承担 AI 智能体的任务执行;集群之间通常通过以太网互连,同时也可采用其他协议完成拼接协同。
从训练转向推理场景时,异构集群环境有助于降低 Token 成本。当不存在单一厂商掌控端到端全流程时,软件就成为挖掘异构硬件能力、完成跨集群优化的关键。
圆桌嘉宾:《Semiconductor Engineering》组织圆桌研讨 AI 数据中心架构变革。参会嘉宾包括 Arm 云与 AI 基础设施硅芯片全球负责人 Satadal Bhattacharjee;Axiomise 首席执行官 Ashish Darbari;楷登电子(Cadence)杰出工程师 Moshiko Emmer;Expedera 首席科学家 Sharad Chole;西门子 EDA 高性能计算开发负责人 Cameron Brunner;新思科技(Synopsys)战略营销总监 Sumit Vishwakarma。以下为圆桌访谈节选。本文是该系列第三篇,第一篇:《计算集群走出国家实验室,支撑 AI 规模化》,第二篇:《集群面临横向扩展与纵向扩展的多重挑战》。
SE:由多颗处理器组成、对外表现为一台整机的计算集群,在网络、热管理、供电等层面存在大量设计难题。哪些企业正在推动技术创新,让这类方案走向可用?
Brunner:硬件厂商与大型系统集成商正在研发集群网络组网方案。软件则负责调度工作负载,最大化利用互连资源。超大规模云服务商已经把这类理念做了大量落地实践,能够搭建出对应的运行环境。多数云厂商都有放置组(placement group)的概念,把虚拟机集中部署,让虚拟机之间享有高速互连。 但跨机器扩展依然是巨大难题。当应用跨多台服务器运行,想要获得接近线性的性能扩展,实现难度很高。
Chole:很大程度取决于工作负载本身。我长期从事 NPU 与 AI 领域,随着模型规模持续膨胀,内存已经成为和计算绑定的核心瓶颈。HBM 的成本与利用效率,也就成为 GPU 的关键影响因素。 模型分为静态参数部分,还有动态的上下文部分。内存缓存的上下文大小、处理数据量,直接关联并发请求数量。边缘场景相对简单,同一时间只有少量请求;但在数据中心,需要在 API 层面追求整机利用率,核心指标变成每秒处理请求数。 综合以上因素,就催生出不同并行模式:张量并行、数据并行、上下文并行、流水线并行,每种模式对网络拓扑要求不一样。流水线并行是点对点传输;张量并行依赖全归约运算,之后再做广播。在集群规划阶段必须充分考虑这些差异。正因如此,如果要做张量并行规模扩展,NVLink 就至关重要;存储、内存传输也面临类似约束。
再看 CPU 的利用:工具调用、CPU 上的工具执行逻辑,会改变智能体的工作负载特征,理解工具的执行模式十分关键。 如果数据中心运行完整的智能体工作流,就必须做好编排调度。智能体工作流在很大程度上已经演变为云管理问题:需要部署工具应用、保障 MCP(模型上下文协议)服务的响应能力。当 API 调用量足够大,对集群做专项优化就能产生收益。 因此我们需要兼顾各类并行策略实现规模扩展。如何从单 GPU 扩展到 8 卡,同时接近 8 倍性能,始终是行业难题。
Bhattacharjee:确实如此。英伟达率先带动的一大趋势,就是推理流水线解聚合。推理包含多个阶段:第一阶段为预填充,输入提示词,解析用户指令,为后续执行做准备,预填充计算强度极高。近期英伟达宣布 Groq 3 语言处理单元(LPU)用于预填充集群,这也证明部分任务已经不能仅依靠 GPU 完成。 第二阶段是解码,生成输出回复内容。引入智能体之后,新增工具调用与任务执行环节,例如调用网约车、预订酒店。
推理解聚合之后,就会出现分工集群:一套软硬组合专门做预填充;一套集群负责解码;另一套完整计算集群执行智能体任务。各集群之间完成拼接协同,目前大多采用以太网通信;每一类集群都搭配适配自身业务的软硬件组合,发挥各自专长。 这会成为未来常态。过去所有 AI 任务都用 GPU 解决,而行业逐渐意识到,不能一把锤子敲所有钉子。GPU 擅长数学运算,但推理的工作负载特征完全不同,需要更多元的硬件,也就是异构集群。同时软件必须理解异构集群架构。 这里存在巨大软件挑战:各类硬件往往来自不同厂商,软件要做到无缝调度每一类硬件,发挥各自优势。新兴云厂商已经在实践,例如 DigitalOcean 推出五层推理架构,底层专门面向异构集群,同时兼容 AMD、英伟达硬件,并计划持续接入新硬件。该趋势的目标就是提升效率、压低 Token 成本。
Darbari:集群把设计命题从 “打造一台高性能机器” 转变为 “设计一套协同分布式系统”。单台服务器主要关注本地计算、内存、I/O 的平衡;集群性能高度取决于工作负载切分、通信模式,以及互连能否高效完成同步与数据搬运。 同时集群具备通信层级。最底层是芯片间互连,包含封装内部裸片、板卡上加速器、单节点内部器件。UCIe 等行业标准正在兴起,提升不同厂商裸片接口的互操作性与可预测性,对基于多芯粒构建大一致性节点至关重要。
SE:在 AI 数据中心,CPU 承担智能体 AI、推理复杂推理循环、维护上下文、分支指令路由等大量难以并行化的繁重任务。当 CPU 接管一部分负载,GPU 除矩阵运算之外还需要承担哪些新任务?
Bhattacharjee:推理流程中的推理环节,需要基于提示词确定后续动作,推理步骤计算压力巨大,需要各类加速器(不一定是 GPU,可以是完成推理的定制 ASIC)。模型推理需要大量矩阵运算,这正是加速器的强项。 而编排调度、工具调用,也就是智能体的动作执行,可以跑在 CPU 之上。系统需要严格管控工作负载分配,区分哪些跑在 CPU、哪些跑在 NPU,软件在此起到决定性作用。
Emmer:面向智能体、重推理的推理场景,加速器的重要性并没有下降,而是流水线被切分得更细。部分步骤强控制、带状态、大量分支跳转;另一些步骤依旧是大规模张量并行运算。混合架构天然适配该特征:把不同计算引擎、内存结构组合成一套完整系统,而不是强迫单一计算单元低效包揽全部任务。
Brunner:集群内部异构化趋势会持续增强。我们在评估部分场景,未来还会接入量子计算设备。集群会成为统一互联平台,围绕业务目标服务,充分利用现有硬件资源,为业务与用户拿到最优结果。业务需求会驱动硬件高效利用的解决方案持续迭代。
SE:集群与集群之间,主流互连方案会选择哪一种?
Brunner:以太网的主要竞争者是 HPE 的 Slingshot(基于以太网的高速网络)以及 InfiniBand。Top500 超算榜单可以看到 100Gbps 以太网与 InfiniBand 的分布,Slingshot 性能表现最优。 以太网作为标准互连已经发展多年。历史上不断出现各类专用协议,想要实现以太网无法完成的能力,但最终反而倒逼以太网持续迭代升级。专有技术性能会略占优势,但需要做取舍。Slingshot 是 HPE Cray 超算体系的产品;以太网生态更加广泛,最终选型取决于业务希望融入哪套生态。
Bhattacharjee:物理层层面,目前大量部署 InfiniBand,铜缆完成机架之间互连。而谷歌 TPU 已经采用光互连,用光信号替代铜缆。未来几年光互连会越来越多,满足爆发式带宽需求。
Vishwakarma:光互连的优势很突出,光子对比电子:无电阻,几乎无能量损耗。AI 集群散热压力巨大,冷却拉高整体运营成本。当前不管节点间,甚至芯片内部,全部是电信号。共封装光学是重点研究方向,目标把光互连向芯片内部、芯片近处迁移。 与之相伴的就是异构计算。智能体工作流、推理业务增长,推动架构走向异构,适配多样化负载。但异构计算本身设计难度很高,需要整合 GPU、加速器、NPU、CPU、高带宽内存,封装复杂度急剧上升。 多物理效应成为一大课题。封装内部有多颗高速裸片;多裸片 HBM 可能因为高温、翘曲发生失效,波及整个节点乃至上层 AI 集群。电迁移引发信号完整性问题,最终也会降低集群性能。
Emmer:互连可以划分为三层架构:第一层是芯粒‑封装互连,追求极高本地带宽;第二层是主机与加速器之间的节点级(半)一致性互连;第三层集群交换网络,面向规模、覆盖范围、拓扑做优化。标准化至关重要,每一次协议边界转换都会引入时延、功耗与设计复杂度。我们不需要一套万能交换网络,而是多套匹配良好、阻抗尽量匹配的互连体系。光互连可以带来变革,但前提是真正解决系统瓶颈,而不是停留在技术实验。
SE:系统多层级都存在大量数据搬运,依靠什么软件或 AI 完成全局管控?虚拟机能否适配五花八门的处理器行为?整套系统如何管理?
Brunner:虚拟机适合上层管理。以 Slingshot 网络举例,可以在其上虚拟集群。Slingshot 支持按工作负载配置服务质量、管控数据流量、做最优部署,规避多业务之间的资源争抢。短距离采用铜缆兼顾功耗,长距离采用光纤,同时支持 100Gbps 以太网。长链路走光纤,结合软件定义集群,配置网络 QoS 保障应用,规避异常业务行为。
Chole:软件栈层面,小规模集群会用虚拟机做虚拟化,现在容器(Docker)已经大范围普及。为了 GPU 驱动工具链的可复现、稳定性,容器成为主流部署方式。AI 领域基本都采用容器作为基础平台,但容器只是底座;上层还包含运行时、编排、调度、队列、API 网关、推理服务平台,组件之间必须协同。不同应用拥有各自软件栈,行业针对各类栈做专项优化。随着智能体开发兴起,更便于做定制化开发,而非强行改造旧方案。
Bhattacharjee:英伟达的护城河已经不完全是硬件,而是过去二十多年构建的软件生态。虽然是硬件厂商,但英伟达在软件上投入巨大,深度调优,这也是用户采购英伟达产品的核心原因 —— 软硬一体、可扩展的完整方案。 从训练转向推理,行业迫切希望借助异构环境压低 Token 成本。当不存在单一厂商掌控端到端全链路,软件就成为挖掘异构硬件能力、完成跨集群优化的关键。 苹果生态是软硬深度自研;而现实场景中,加速器来自 A 厂商、CPU 来自 B 厂商,服务器由 OEM/ODM 组装,再搭配网络设备,全部组件拼接在一起。软件首先要识别异构特征,发挥不同硬件的特长,把任务调度到最合适的硬件执行。
Gimlet Labs、Together AI 等新兴厂商,定位就是异构硬件之上的软件层,适配推理解聚合架构,优化预填充集群、解码集群、智能体计算集群,负责软件编排,对接多家硬件企业。 谷歌这类顶级超大规模厂商可以自研 TPU 集群,但绝大多数企业做不到。DigitalOcean、CoreWeave、Lambda AI、Verda 等新一代云服务商都会面临同样挑战:希望硬件更多元,在不牺牲性能前提下降低 Token 成本,摆脱单一厂商绑定。 该领域还处在早期阶段,问题完全解决尚需时间,但行业正在集中力量打造配套优化软件的异构集群,摆脱当下大家排队采购英伟达设备的现状 —— 毕竟目前只有英伟达体系经过大规模落地验证。
Emmer:同时软件编排想要高效运转,硬件必须暴露合适的控制接口与遥测抽象。如果系统无法清晰描述数据局部性、带宽等级、热状态、引擎能力,调度器本质上只能猜。这就使得软硬件协同设计必不可少。
SE:那么集群的核心设计命题,就是英伟达的市场主导地位与功耗问题,这两点我们在前两部分已经讨论过。这样总结是否准确?
Bhattacharjee:宏观来看,功耗毫无疑问排在第一位,没有供电一切无从谈起。第二大挑战是 Token 效率,需要依靠异构架构与各类创新共同实现。














评论