
张量并行(Tensor Parallelism)推理部署实战:从 Megatron-LM 切分原理到 vLLM 多卡配置与性能调优
当大语言模型的参数量从 7B 一路攀升到 70B 甚至 405B 时,单张 GPU 的显存早已无法容纳完整模型。以 Llama-3-70B 为例,仅 FP16 权重就需要约 140GB 显存,远超单张 A100-80G 的容量上限。此时,将...

当大语言模型的参数量从 7B 一路攀升到 70B 甚至 405B 时,单张 GPU 的显存早已无法容纳完整模型。以 Llama-3-70B 为例,仅 FP16 权重就需要约 140GB 显存,远超单张 A100-80G 的容量上限。此时,将...

引言:为什么梯度累积是大模型训练的”隐形基础设施” 在 ChatGPT 横空出世的三年后,大模型训练的”显学”似乎已经从单卡微调转移到了千卡预训练。各类技术文章铺天盖地讨论着 3D 并行、Ze...