
大模型推理显存占用拆解与 HBM 带宽瓶颈诊断实战:从 VRAM 精确测算到 Roofline 模型优化的完整指南
在大模型推理工程实践中,很多人把注意力放在算力(TFLOPS)上,却忽略了另一个同等关键、甚至往往是真正瓶颈的资源——显存带宽。Llama 3 70B 这类模型在 Decode 阶段每生成一个 token 就要读取全部权重,70B 参数 ×...

在大模型推理工程实践中,很多人把注意力放在算力(TFLOPS)上,却忽略了另一个同等关键、甚至往往是真正瓶颈的资源——显存带宽。Llama 3 70B 这类模型在 Decode 阶段每生成一个 token 就要读取全部权重,70B 参数 ×...

为什么大模型推理需要 PD 分离架构 在大模型推理服务化的实际工程中,我们经常会遇到一个让人头疼的现象:当一个长上下文请求(比如 8K tokens 的 Prefill)和一批短上下文的 Decode 请求混在一起时,整体吞吐和延迟都会急剧...

在大模型推理国产化替代的浪潮中,海光DCU、摩尔线程、华为昇腾和寒武纪是四条最常被提及的技术路线。然而,很多团队在选型时只关注硬件算力参数(TFLOPS、显存容量),却忽略了决定实际推理性能的软件栈成熟度和CUDA迁移成本。本文将从软件生态...

在大模型推理部署中,GPU 利用率不等于性能最优。很多团队部署完 vLLM 或 TensorRT-LLM 后,发现吞吐量远低于预期,却不知道瓶颈到底在显存带宽、计算单元、还是数据传输。NVIDIA Nsight Systems(简称 Nsi...

在大模型推理部署中,Decode阶段的自回归特性决定了每个token生成都需要一次完整的前向传播,这导致推理吞吐量被GPU计算效率严重制约。即使使用了PagedAttention和Continuous Batching等优化技术,Decod...
在大模型推理的整个生命周期中,Decode 阶段往往是性能瓶颈所在。Prefill 阶段虽然计算量大,但可以通过大规模矩阵乘法充分利用 GPU 的并行能力;而 Decode 阶段逐 token 生成,每次只处理一个 query token ...

在国产GPU替代的大背景下,摩尔线程(Moore Threads)作为国内GPU厂商之一,其MUSA(Moore Threads Unified System Architecture)软件栈正在被越来越多的AI团队纳入技术选型。与华为昇腾...
当大模型参数量突破单卡显存上限时,工程师首先想到的是张量并行(Tensor Parallelism, TP)——把每一层的权重切分到多张卡上,所有卡同时计算同一层的不同部分。但 TP 有一个致命瓶颈:每层都需要 All-Reduce 通信,...

在国产化替代的大背景下,海光DCU(Deep Computing Unit)已成为国内AI推理和训练场景中重要的GPU替代方案。海光DCU基于AMD GPU架构,使用ROCm作为底层软件栈,并在此基础上封装了DTK(DeepLook Too...

在大模型推理的 Decode 阶段,每一个 token 的生成都需要访问之前所有 token 的 Key 和 Value 向量——这就是 KV Cache。一个 70B 参数的模型在 4K 上下文下,单请求的 KV Cache 就可能占用超...