Hot‑Chips:面向人工智能持续演进的内存架构
AI 性能越来越受内存制约,而非算术运算吞吐量。缩放定律表明,当参数量、训练数据与算力同步增长时,模型质量会提升;但如果处理器无法快速获取运算数据,这套平衡就会被打破。当前 AI 加速器的浮点运算能力大约每两年提升 3 倍,而高带宽内存的带宽增速不到 2 倍。二者之间持续拉大的差距催生内存墙:昂贵的计算单元陷入等待,利用率下滑,系统大量能耗消耗在数据搬运,而非执行有效运算。
高带宽内存(HBM)依靠架构并行设计与紧密物理集成来解决上述失衡问题。与传统 DDR 双列直插内存模组不同,HBM 将垂直堆叠的 DRAM 与 GPU / 加速器放置在同一个系统级封装内部。硅通孔(TSV)把各层 DRAM 连接到底座裸片;中介层上细密且短的布线再将底座裸片连接到主芯片。该拓扑可以支持数千路相对低频的数据通路,无需完全依赖高功耗串行信号,就能实现极高的总吞吐。

各代产品迭代可以直观体现这套思路。
HBM1:1024 个数据 I/O,标称带宽约 128 GB/s;
HBM3E:保持 1024 个 I/O,通过提升信号速率、通道划分、存储体数量与堆叠容量,单堆叠带宽达到约 1 TB/s;
HBM4:接口 I/O 数量翻倍至 2048 个,扩展为 32 个通道、64 个伪通道,目标带宽约 2.8 TB/s。
每一代产品在提升传输速率的同时,访问粒度更精细、密度更高,改善持续带宽,同时提升可用于存放模型参数、键‑值缓存、激活值、训练状态的存储容量。
屋顶线模型可以解释该性能变化效果。运算强度衡量每传输一字节数据所能完成的运算量。落在倾斜带宽上限下方的工作负载属于内存受限型,再增加算力也无法加速任务。提升 HBM 带宽可以抬高这条上限,让注意力算子、嵌入算子、稀疏算子以及大量数据搬运类内核,在碰到带宽瓶颈之前完成更多运算。 从系统规模看,8 颗 HBM3 堆叠理论总带宽约 5.3 TB/s;而 8 通道 DDR5 服务器配置仅约 307 GB/s。DDR 总容量大得多,但 HBM 在加速器近侧具备一个数量级的带宽优势。
高性能的背后是高昂实现成本。HBM3E 相比 DDR5 需要多得多的存储体与接口电路;受架构、封装、制造条件制约,同等有效容量下,它消耗的硅面积大约是 DDR5 的三倍。堆叠层数更高、工作活跃度提升还会增大热流密度。硅、焊料、塑封材料、中介层、基板之间热膨胀系数不匹配,带来芯片‑封装相互作用的风险。更高堆叠高度让散热、供电、机械可靠性、测试覆盖都变得复杂。因此,液冷、优化热通路、混合键合、玻璃基板、大尺寸中介层不再是锦上添花,而是必备支撑技术。
可靠性需要跟带宽同步提升。自 HBM3 开始采用两级保护机制:面向系统的元数据,支持每次访问的 CRC 循环冗余校验或者 ECC 错误校验;片内基于符号的里德‑所罗门(Reed‑Solomon)纠错,保护存储阵列与片内传输。这些机制必须与故障隔离、修复、遥测、可维护性协同,防止单颗内存缺陷就导致大型加速器集群整体故障。
容量依旧十分关键,模型、上下文、缓存会不断扩大工作集。因此设计人员必须综合评估有效带宽、数据局部性、访问冲突、刷新开销与容错能力。只有控制器、存储体、软件能够在真实访问模式下充分释放并行度,标称接口速率才有实际意义。
意义解读
未来内存系统需要对 DRAM 工艺、底座裸片逻辑、裸片‑裸片 PHY、中介层、基板、散热、供电、固件、任务调度做协同优化。增强型底座裸片可以集成定制控制、数据搬运甚至处理功能,减轻受限接口的数据流量。共封装光学可以把带宽延伸到封装之外;融合工艺与混合键合可以提升垂直互连密度,降低每比特传输能耗。
设计的核心目标不再只追求极致算力,而是带宽、容量、可靠性与能效的均衡交付。HBM 充当快速迭代的加速器与现代 AI 数据密集型负载之间的桥梁;内存架构,成为决定每瓦、每封装、每美元能够实现多少 AI 智能算力的核心因素。













评论