跳到主内容
快讯直播
AI智模界
AI 词典

HBM4 / HBM4E:AI 芯片的带宽瓶颈在哪

一句话定义:HBM4(High Bandwidth Memory 4,第四代高带宽内存)是 JEDEC 制定的新一代 AI 加速器专用内存标准,把多层 DRAM 芯片垂直堆叠、用超宽接口与 GPU/NPU 封在一起;HBM4E 是它在同一代内的增强版本,类似 HBM3E 之于 HBM3。

原理:把仓库搬进车间

普通内存像城郊仓库,货车(内存总线)一趟趟往工厂拉货,车道数量有限,路还长。GPU 算得再快,货没到就只能干等。

HBM 的做法是:把仓库直接盖在车间旁边,甚至盖成高楼。多层 DRAM 垂直堆叠,通过硅中介层(interposer)和先进封装与计算芯片贴在一起,中间是成千上万个微凸块直连。楼层越多,容量越大;车道越宽,单位时间搬的货越多。

HBM4 的两个关键变化:

1. 接口位宽从 1024 位翻倍到 2048 位。这相当于把单条高速路从 8 车道拓到 16 车道,单堆栈带宽相比上一代有明显跃升(大约翻倍量级)。

2. 基础裸片(base die)可改用逻辑代工工艺制造。过去它和 DRAM 用同一套工艺,现在可以把控制电路交给更擅长逻辑的晶圆厂做,能效更好、也留出定制空间——这直接改变了存储厂与代工厂的分工格局。

HBM4E 则是在此基础上继续拉高引脚速率和容量上限。具体参数以 JEDEC 标准和各厂商官方页面为准。

维度HBM3EHBM4HBM4E
接口位宽1024 位2048 位2048 位
单堆栈带宽当前主力水平明显提升进一步提升
容量上限较低更高最高
生命周期位置现役新一代主力中后期高配

和相邻概念的区别

GDDR 位宽窄、频率高、便宜,适合消费级显卡;LPDDR 主打低功耗,用在手机和边缘设备;HBM 走的是"极宽位宽 + 近封装 + 高能效",代价是贵、工艺复杂、产能爬坡慢。它不是 DDR 插条的升级版,而是另一个物种。

为什么它是瓶颈

大模型推理是访存密集型任务:每生成一个 token,都要把模型权重从内存搬进计算单元。这几年算力涨得比带宽快,于是出现"内存墙"——GPU 不是算不动,是喂不饱,算力利用率打折。所以 AI 加速器贵、缺货,很大一块原因在内存。

对从业者和普通人的意义

  • 从业者:评估部署方案时,先算带宽预算,别只看标称算力。带宽决定了你的 token/s 上限和并发能力,也决定了推理成本。
  • 产业侧:HBM 是 AI 芯片物料成本的大头,良率与产能直接决定 GPU 出货量。三星等存储厂扩产、多供应商通过验证,会增加供给、缓解短缺,并让价格更有谈判空间。但先进封装产能同样是卡点,这不是单点能解决的问题。
  • 普通人:AI 服务能不能更便宜、少排队,和内存产能有关。存储厂把产能倾斜给 HBM,也可能挤压普通 DRAM 供给,间接影响消费级内存行情。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。