跳到主内容
快讯直播
AI智模界
AI 词典

张量核心:GPU 里的矩阵乘法专用引擎

一句话定义:张量核心(Tensor Core)是 GPU 里专门用来做矩阵乘加运算的硬件单元,它把“乘一下、加一下”这类重复动作批量打包,一次算一小块矩阵。

要理解它为什么存在,得先看深度学习在算什么。神经网络的计算,绝大多数最终都能化成矩阵乘法——全连接层是,卷积可以转成,注意力机制里也是。训练和推理的每一步,本质上都在反复做同一件事:把输入和权重拼成的两个矩阵相乘,再累加到结果里。如果让通用计算核心一个元素一个元素地乘、再加,指令条数多,数据搬来搬去,速度就卡住了。张量核心的思路很直接:既然形状固定、动作重复,不如把这套动作直接做成电路。它一次接收一小块矩阵,完成“相乘并累加”,相当于把一道几十次乘加的算术题一口气交卷。

打个比方:普通计算核心像一名会计,拿计算器一笔一笔算;张量核心像一台专门处理报表的机器,你把两张表格递进去,它吐出一张结果表。前者什么都能干,后者只干这一件事,但干得极快。代价是数据必须按它喜欢的排布喂进去,形状对不上、尺寸太小,它就可能闲置。

和相邻概念的区别,可以看这张表:

通用计算核心(如 CUDA 核心)张量核心(Tensor Core)
擅长逐元素运算、控制流、地址计算小矩阵乘加
灵活性高,什么都能算低,只吃特定形状与精度
效率矩阵乘法效率一般矩阵乘法吞吐高
类比什么都会修的多面手只拧一种螺丝的电动扳手

另外,TPU 这类 AI 加速器是整块芯片都为矩阵运算设计,张量核心则是 GPU 内部的“专用车间”,不是独立芯片。

对从业者的实际意义:训练速度的天花板,很大程度由它决定。想让张量核心不空转,矩阵维度要能对上硬件分块,批量大小要够,算子最好交给厂商的成熟数学库或编译器去调度;否则它可能一直等数据,瓶颈又回到显存带宽上。做AI 词典:混合精度训练">混合精度训练时,前向反向用低精度、主权重用高精度,也是为了让它跑得更划算。普通人听得懂的版本是:大模型能不能训得动、推理成本高不高,跟这块硬件直接相关。具体支持哪些精度格式、每周期能算多少次,各家各代不同,以官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。