摩尔线程 MUSA CUDA 迁移指南:环境配置、PyTorch 适配与自定义算子排错
现有 CUDA 项目如何迁移到摩尔线程 MUSA?本文覆盖环境搭建、PyTorch 代码迁移、自定义 CUDA 算子适配及性能验证。
现有 CUDA 项目如何迁移到摩尔线程 MUSA?本文覆盖环境搭建、PyTorch 代码迁移、自定义 CUDA 算子适配及性能验证。
如何利用 MUSA 运行时的显存超发机制解决大模型推理中的显存不足问题 在国产 GPU 适配的过程中,显存不足(OOM, Out of Memory)是运行大规模语言模型(LLM)时最常见的痛点。摩尔线程(Moore Threads)的 M...
如何通过 MUSA 集群进行大模型分布式训练:详解多卡互联与带宽优化 随着国产算力的崛起,摩尔线程(Moore Threads)的 MUSA 架构已成为大模型训练的重要选择。在多卡集群环境下,如何充分利用 MT-Link 互联技术并优化通信...