
FP8 量化训练实战:E4M3/E5M2、Transformer Engine 与 Megatron-LM
FP8 训练完整指南:理解 E4M3/E5M2、缩放策略、Transformer Engine 与 Megatron-LM 配置,并排查溢出、精度下降和性能不升问题。

FP8 训练完整指南:理解 E4M3/E5M2、缩放策略、Transformer Engine 与 Megatron-LM 配置,并排查溢出、精度下降和性能不升问题。

为什么需要关注数据管线性能 在深度学习项目中,很多人把精力花在模型架构设计和超参数调优上,却忽视了数据加载管线的优化。实际上,当 GPU 利用率长期低于 70% 时,模型训练时间可能因为数据管线的瓶颈而被拉长 2-3 倍。TensorFlo...

引言:为什么需要分布式训练? 随着深度学习模型的规模不断增长,单张GPU卡已经难以满足大多数实际生产场景的训练需求。从BERT(3.4亿参数)到GPT-3(1750亿参数),再到LLaMA系列和最近流行的DeepSeek、Qwen等大语言模...