大模型推理中的流水线并行(Pipeline Parallelism)深度解析:从 PP 切分原理到 vLLM 多卡流水线部署与气泡优化实战
当大模型参数量突破单卡显存上限时,工程师首先想到的是张量并行(Tensor Parallelism, TP)——把每一层的权重切分到多张卡上,所有卡同时计算同一层的不同部分。但 TP 有一个致命瓶颈:每层都需要 All-Reduce 通信,...
当大模型参数量突破单卡显存上限时,工程师首先想到的是张量并行(Tensor Parallelism, TP)——把每一层的权重切分到多张卡上,所有卡同时计算同一层的不同部分。但 TP 有一个致命瓶颈:每层都需要 All-Reduce 通信,...

引言:为什么梯度累积是大模型训练的”隐形基础设施” 在 ChatGPT 横空出世的三年后,大模型训练的”显学”似乎已经从单卡微调转移到了千卡预训练。各类技术文章铺天盖地讨论着 3D 并行、Ze...