新闻中心

EEPW首页 > 嵌入式系统 > 业界动态 > 英特尔 Diamond Rapids:以硅基实现至强处理器的纵向、横向与深度演进

英特尔 Diamond Rapids:以硅基实现至强处理器的纵向、横向与深度演进

作者: 时间:2026-08-28 来源: 收藏

下一代至强(Xeon)处理器。该芯片的设计理念为:超大规模算力的性能,越来越取决于数据搬移、处理与防护的效率,其重要性不亚于指令执行效率。该架构摒弃传统的单片式网状互连,采用扇出式互联架构,将模块化计算单元与集中式互联中心节点相连。这种功能划分方式,把可扩展核心资源与内存、输入输出、加速单元、一致性服务进行解耦,让可以实现算力扩容,而无需把全部子系统都集成到单颗巨型裸片上。

该设计延续技术演进路线:从环形总线、平面网状架构,经过分片式、模块化网状架构,进一步演进至三维网状架构。设计目标是实现均衡的系统吞吐:更强的单线程执行能力、更高的每瓦性能、集成 AI 与基础设施加速能力、可横向扩展的互联能力,以及具备高可靠 RAS(可靠性、可用性、可维护性)能力的分层安全机制。

每一个计算单元由基础分片(base tile)搭配最多 4 个核心芯粒(core chiplet)组成。一颗核心芯粒最多包含 16 颗性能核以及私有二级缓存;三维交叉开关将这些核心连接至基础分片中的共享末级缓存。缓存代理与侦听过滤器负责维护计算单元内部的数据一致性。 集成 4 组计算单元、16 颗核心芯粒与 4 个基础分片,最高可实现 256 核,总末级缓存(LLC)容量达 1.28GB。

封装体系融合 2.5D 与 3D 集成技术。核心芯粒通过 Foveros 3D Direct 混合键合工艺与基础分片互连;4 个基础分片、2 个互联中心分片,则借助 UCIe‑S 铜链路,在封装基板上完成通信。这种结构既可以垂直扩展计算密度,又能对带宽密集型系统功能做横向扩展。处理器采用英特尔 18A‑P 增强工艺,该工艺提供双触点低电阻 PowerBoost 选项、额外阈值电压选型、更严苛的工艺偏差约束,同时降低热阻与通孔电阻。

互联中心实现内存与 I/O 的集中管理。统一内存互联架构支持 16 通道,DDR5 速率最高 8000MT/s,MRDIMM 内存最高可达 12800MT/s,总带宽接近 1.6TB/s。内存控制器提供 ECC 纠错、行锤防护以及电源管理功能。内存功能组件支持 CXL 内存的单级模式、Flat 2LM 模式以及镜像功能;加密引擎可为 DDR 或 CXL 内存提供加密保护。将目录状态从 DRAM 迁移至片上本地侦听过滤器,既保留完整 ECC 能力,又降低查询延迟与一致性交互流量,简化内存架构。

Flexbus I/O 互联架构中,每个互联中心可输出 4 组、每组 16 条高速链路。每组 x16 链路可配置为 PCIe 6.0、CXL 3.0、UPI 3,或是上述协议的兼容组合。单颗处理器可提供 128 条高速链路,双向带宽最高 2TB/s;另外配备 8 条 PCIe 4.0 链路用于平台基础设施。最高 16MB 的 I/O 缓存与片上过滤器,保障一致性数据传输。每个互联中心还集成两套加速复合体,整合 QuickAssist 高速加密压缩技术、数据流加速器、内存内分析加速器引擎。

电源管理同样遵循功能分区思路。核心、计算单元非核心逻辑、I/O、内存分别拥有独立的电压‑频率动态调节域。全新休眠状态可保留二级缓存数据,减少唤醒恢复开销;优先级核心睿频技术,将频率余量优先分配给对延迟敏感的任务。基于 MR4 的内存温控、UXI 与 PCIe 链路 L0p 低功耗模式、面向工作负载的智能功耗调度,进一步提升能效。

指令集层面, 支持英特尔高级性能扩展指令集(APX)。APX 新增 16 个通用寄存器,通用寄存器总数达到 32 个;引入带新目标寄存器形式的三操作数指令、条件运算、标志位屏蔽、64 位绝对跳转以及 XSAVE 状态保存支持。现有 x86 二进制程序可直接兼容,重新编译后则可充分利用扩展寄存器。AI 算力加速依靠 AMX 与 AVX 10.2,支持 FP8、FP16、BF16 数据格式。

安全与可靠性属于架构级硬性要求,而非附加功能。英特尔 TDX、TDX Connect 以及 SGX 提供多重隔离机制;内存加密、片上一致性目录、增强遥测以及全套 RAS 特性,为大型系统提供防护。Diamond Rapids 依托模块化技术实现至强平台升级:高密度 3D 计算、集中式一致性互联、超高内存与 I/O 带宽、专用加速单元、独立功耗管控,共同构筑面向智能体 AI 与数据密集型基础设施的硬件平台。


评论


相关推荐

技术专区

关闭