
NVIDIA Nsight Systems 实战详解:大模型推理 GPU 性能瓶颈诊断与 TFLOPS 算力计算全攻略
在大模型推理部署中,GPU 利用率不等于性能最优。很多团队部署完 vLLM 或 TensorRT-LLM 后,发现吞吐量远低于预期,却不知道瓶颈到底在显存带宽、计算单元、还是数据传输。NVIDIA Nsight Systems(简称 Nsi...

在大模型推理部署中,GPU 利用率不等于性能最优。很多团队部署完 vLLM 或 TensorRT-LLM 后,发现吞吐量远低于预期,却不知道瓶颈到底在显存带宽、计算单元、还是数据传输。NVIDIA Nsight Systems(简称 Nsi...

为什么需要量化KV Cache? 在大语言模型(LLM)的推理过程中,KV Cache(Key-Value Cache)是一个绕不开的核心组件。当模型以自回归方式逐Token生成文本时,对于Decoder-only架构的Transforme...

在深度学习模型训练中,batch size 的选择直接影响模型的收敛速度和最终精度。研究表明,较大的 batch size 能让梯度估计更加稳定,有助于模型跳出局部最优,同时充分利用 GPU 的并行计算能力。然而,受限于显存容量,很多开发者...