
大模型训练中的梯度累积深度解析:从数学原理到 Megatron-LM 流水线并行的工程实现
引言:为什么梯度累积是大模型训练的”隐形基础设施” 在 ChatGPT 横空出世的三年后,大模型训练的”显学”似乎已经从单卡微调转移到了千卡预训练。各类技术文章铺天盖地讨论着 3D 并行、Ze...

引言:为什么梯度累积是大模型训练的”隐形基础设施” 在 ChatGPT 横空出世的三年后,大模型训练的”显学”似乎已经从单卡微调转移到了千卡预训练。各类技术文章铺天盖地讨论着 3D 并行、Ze...

在 TensorFlow 2.x 的即时执行模式下, 1tf.GradientTape 是实现自动微分的核心工具。大多数教程只涉及最基础的”前向传播 → 计算损失 → 反向传播”流程,但在真实生产场景中,我们经常需要...

在深度学习模型训练中,batch size 的选择直接影响模型的收敛速度和最终精度。研究表明,较大的 batch size 能让梯度估计更加稳定,有助于模型跳出局部最优,同时充分利用 GPU 的并行计算能力。然而,受限于显存容量,很多开发者...