跳到主内容
快讯直播
AI智模界
芯片

PCIe显卡被低估:DeepSeek推理吞吐翻近7倍

在AI推理领域,PCIe显卡长期被视为“二等公民”。由于PCIe互联带宽远低于NVLink等专用高速互联,多卡推理时通信往往成为瓶颈,导致其在大模型部署中的价值被低估。但量子位一篇文章指出,通过内核补齐与通信重构,PCIe显卡在DeepSeek推理上的吞吐量提升了近7倍。

这一结果的关键在于软件栈的优化,而非硬件互联的升级。文章标题将原因归结为“内核补齐+通信重构”:一方面补齐了PCIe显卡在推理所需内核层面的缺失,另一方面对通信路径进行了重构,从而减少了多卡协同中的等待与开销。对于DeepSeek这类大模型而言,推理吞吐直接关系到服务成本与响应效率,近7倍的提升意味着同等硬件条件下可承载的请求量大幅增加。

长期以来,业界在讨论大模型推理硬件时,常将注意力集中在GPU互联带宽与显存规格上,PCIe显卡则被认为难以胜任高吞吐场景。此次结果提供了一个不同的视角:当软件栈足够完善、通信效率被充分挖掘时,PCIe显卡的推理潜力可能远超预期。这并不意味着PCIe互联的物理限制消失,但说明在推理场景中,互联并非唯一决定因素,内核与通信的协同优化同样能带来数量级变化。

对于AI从业者与关注者而言,这一进展值得注意的地方在于,它提示了存量PCIe显卡在推理任务中的再利用空间,也为低成本部署DeepSeek等模型提供了新的优化方向。后续若相关方案进一步开放,可能会影响推理硬件的选型逻辑。在算力成本高企的当下,任何能提升现有硬件吞吐的工程优化,都具有实际意义。

(来源:量子位)

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。