
大模型训练中的梯度累积深度解析:从数学原理到 Megatron-LM 流水线并行的工程实现
引言:为什么梯度累积是大模型训练的”隐形基础设施” 在 ChatGPT 横空出世的三年后,大模型训练的”显学”似乎已经从单卡微调转移到了千卡预训练。各类技术文章铺天盖地讨论着 3D 并行、Ze...

引言:为什么梯度累积是大模型训练的”隐形基础设施” 在 ChatGPT 横空出世的三年后,大模型训练的”显学”似乎已经从单卡微调转移到了千卡预训练。各类技术文章铺天盖地讨论着 3D 并行、Ze...

引言:为什么大模型训练需要 FP8? 随着大语言模型的参数量从数十亿迈向数千亿,训练过程中的显存消耗和计算吞吐成为核心瓶颈。以 Llama 3 405B 为例,使用 BF16 精度训练仅模型参数就需要约 810GB 显存,加上梯度、优化器状...

一、引言:当模型参数放不进单卡显存时 随着大语言模型规模的不断膨胀,从 BERT-base 的 1.1 亿参数到 Llama 3 的 4050 亿参数,单张 GPU 的显存早已无法承载完整的模型训练。即便是拥有 80GB HBM3 显存的 ...

在过去的几年中,Transformer 架构已经成为深度学习领域最核心的基石,从 NLP 到 CV 再到多模态大模型,几乎无处不在。而注意力机制(Attention)作为 Transformer 的核心组件,其计算复杂度随序列长度呈二次增长...