一句话定义:HBM4(High Bandwidth Memory 4,第四代高带宽内存)是 JEDEC 制定的新一代 AI 加速器专用内存标准,把多层 DRAM 芯片垂直堆叠、用超宽接口与 GPU/NPU 封在一起;HBM4E 是它在同一代内的增强版本,类似 HBM3E 之于 HBM3。
原理:把仓库搬进车间
普通内存像城郊仓库,货车(内存总线)一趟趟往工厂拉货,车道数量有限,路还长。GPU 算得再快,货没到就只能干等。
HBM 的做法是:把仓库直接盖在车间旁边,甚至盖成高楼。多层 DRAM 垂直堆叠,通过硅中介层(interposer)和先进封装与计算芯片贴在一起,中间是成千上万个微凸块直连。楼层越多,容量越大;车道越宽,单位时间搬的货越多。
HBM4 的两个关键变化:
1. 接口位宽从 1024 位翻倍到 2048 位。这相当于把单条高速路从 8 车道拓到 16 车道,单堆栈带宽相比上一代有明显跃升(大约翻倍量级)。
2. 基础裸片(base die)可改用逻辑代工工艺制造。过去它和 DRAM 用同一套工艺,现在可以把控制电路交给更擅长逻辑的晶圆厂做,能效更好、也留出定制空间——这直接改变了存储厂与代工厂的分工格局。
HBM4E 则是在此基础上继续拉高引脚速率和容量上限。具体参数以 JEDEC 标准和各厂商官方页面为准。
| 维度 | HBM3E | HBM4 | HBM4E |
|---|---|---|---|
| 接口位宽 | 1024 位 | 2048 位 | 2048 位 |
| 单堆栈带宽 | 当前主力水平 | 明显提升 | 进一步提升 |
| 容量上限 | 较低 | 更高 | 最高 |
| 生命周期位置 | 现役 | 新一代主力 | 中后期高配 |
和相邻概念的区别
GDDR 位宽窄、频率高、便宜,适合消费级显卡;LPDDR 主打低功耗,用在手机和边缘设备;HBM 走的是"极宽位宽 + 近封装 + 高能效",代价是贵、工艺复杂、产能爬坡慢。它不是 DDR 插条的升级版,而是另一个物种。
为什么它是瓶颈
大模型推理是访存密集型任务:每生成一个 token,都要把模型权重从内存搬进计算单元。这几年算力涨得比带宽快,于是出现"内存墙"——GPU 不是算不动,是喂不饱,算力利用率打折。所以 AI 加速器贵、缺货,很大一块原因在内存。
对从业者和普通人的意义
- 从业者:评估部署方案时,先算带宽预算,别只看标称算力。带宽决定了你的 token/s 上限和并发能力,也决定了推理成本。
- 产业侧:HBM 是 AI 芯片物料成本的大头,良率与产能直接决定 GPU 出货量。三星等存储厂扩产、多供应商通过验证,会增加供给、缓解短缺,并让价格更有谈判空间。但先进封装产能同样是卡点,这不是单点能解决的问题。
- 普通人:AI 服务能不能更便宜、少排队,和内存产能有关。存储厂把产能倾斜给 HBM,也可能挤压普通 DRAM 供给,间接影响消费级内存行情。
