
大模型推理显存占用拆解与 HBM 带宽瓶颈诊断实战:从 VRAM 精确测算到 Roofline 模型优化的完整指南
在大模型推理工程实践中,很多人把注意力放在算力(TFLOPS)上,却忽略了另一个同等关键、甚至往往是真正瓶颈的资源——显存带宽。Llama 3 70B 这类模型在 Decode 阶段每生成一个 token 就要读取全部权重,70B 参数 ×...

在大模型推理工程实践中,很多人把注意力放在算力(TFLOPS)上,却忽略了另一个同等关键、甚至往往是真正瓶颈的资源——显存带宽。Llama 3 70B 这类模型在 Decode 阶段每生成一个 token 就要读取全部权重,70B 参数 ×...