
大模型对齐训练三阶段演进:从RLHF到DPO再到GRPO的算法原理与工程化实现
大模型的对齐(Alignment)训练是让预训练基座模型从「续写文本」变为「遵循人类意图」的关键环节。从2022年ChatGPT采用RLHF(Reinforcement Learning from Human Feedback)一鸣惊人,到...

大模型的对齐(Alignment)训练是让预训练基座模型从「续写文本」变为「遵循人类意图」的关键环节。从2022年ChatGPT采用RLHF(Reinforcement Learning from Human Feedback)一鸣惊人,到...

引言:为什么梯度累积是大模型训练的”隐形基础设施” 在 ChatGPT 横空出世的三年后,大模型训练的”显学”似乎已经从单卡微调转移到了千卡预训练。各类技术文章铺天盖地讨论着 3D 并行、Ze...

引言:为什么大模型训练需要 FP8? 随着大语言模型的参数量从数十亿迈向数千亿,训练过程中的显存消耗和计算吞吐成为核心瓶颈。以 Llama 3 405B 为例,使用 BF16 精度训练仅模型参数就需要约 810GB 显存,加上梯度、优化器状...

一、引言:当模型参数放不进单卡显存时 随着大语言模型规模的不断膨胀,从 BERT-base 的 1.1 亿参数到 Llama 3 的 4050 亿参数,单张 GPU 的显存早已无法承载完整的模型训练。即便是拥有 80GB HBM3 显存的 ...

在过去的几年中,Transformer 架构已经成为深度学习领域最核心的基石,从 NLP 到 CV 再到多模态大模型,几乎无处不在。而注意力机制(Attention)作为 Transformer 的核心组件,其计算复杂度随序列长度呈二次增长...