跳到主内容
快讯直播
AI智模界
AI 词典

PCIe 通信重构:PCIe 显卡集群的通信翻身仗

一句话定义:PCIe 通信重构(PCIe communication refactoring)不是 PCIe 官方规范里的术语,而是工程实践:在只有 PCIe 互联的 GPU 集群里,重新设计 GPU 之间的通信路径、算子与调度,让数据少绕路、少等待。

打个比方:PCIe 像城市主干道,什么车都能走,但红绿灯多、车道有限;NVLink 像两栋楼之间私建的高速专线,快,但只服务特定硬件。PCIe 通信重构不是把主干道扩成高速,而是重新规划路线:把大件拆小、错峰发车、让装卸和运输并行、减少进出收费站的次数。落到技术上,就是做拓扑感知的卡间配对、通信算子重写、通信与计算重叠,以及“内核补齐”——通用通信库没为某些 PCIe 拓扑准备最优内核时,补上专用内核,让 all-reduce、all-to-all 等集合通信按实际链路走。

对 DeepSeek 这类 MoE 推理,多卡常要做张量并行和专家并行,卡间要频繁交换激活值或专家结果。PCIe 带宽和延迟不如 NVLink,默认通信容易让 GPU 空等。通信重构后,小消息合并、大消息切块、通信躲进计算阴影里,单位时间能吐出更多 token,推理吞吐随之提高。它不改变模型,而是把通信瓶颈压下去。

与 NVLink 的边界可用一张表看清:

维度PCIe 通信重构NVLink
本质软件与系统工程优化硬件高速互联
硬件依赖通用 PCIe 插槽/交换NVIDIA 专用互联
带宽延迟较低,受拓扑影响大更高、更低延迟
适合场景存量 PCIe 集群、多品牌、成本敏感、推理或中小规模并行大规模训练、强通信、预算充足
局限突破不了物理带宽,通信占比极高时收益有限生态与硬件绑定,跨节点仍需网络

对从业者:先判断瓶颈是否在通信,再做拓扑感知、算子融合和通信重叠。对普通人:云上大模型推理更便宜、更稳,可能就来自这类“把路重新修一遍”的优化。具体支持情况以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。