
PD分离架构(Prefill-Decode Disaggregation)实战详解:原理拆解、vLLM/SGLang部署与多卡推理性能调优全攻略
为什么大模型推理需要 PD 分离架构 在大模型推理服务化的实际工程中,我们经常会遇到一个让人头疼的现象:当一个长上下文请求(比如 8K tokens 的 Prefill)和一批短上下文的 Decode 请求混在一起时,整体吞吐和延迟都会急剧...

为什么大模型推理需要 PD 分离架构 在大模型推理服务化的实际工程中,我们经常会遇到一个让人头疼的现象:当一个长上下文请求(比如 8K tokens 的 Prefill)和一批短上下文的 Decode 请求混在一起时,整体吞吐和延迟都会急剧...
当大模型参数量突破单卡显存上限时,工程师首先想到的是张量并行(Tensor Parallelism, TP)——把每一层的权重切分到多张卡上,所有卡同时计算同一层的不同部分。但 TP 有一个致命瓶颈:每层都需要 All-Reduce 通信,...

引言:长上下文为什么是大模型落地的关键瓶颈 2024年以来,主流大模型的上下文窗口从4K、8K快速扩展到128K、256K甚至百万级Token。GPT-4 Turbo支持128K,Claude 3支持200K,Gemini 1.5 Pro更...