详解华为 CANN 架构:如何通过 AclLite 封装大幅简化昇腾推理程序的开发流程
如何通过 AclLite 封装大幅简化昇腾推理程序的开发流程 在国产昇腾(Ascend)芯片上进行 AI 推理开发时,开发者通常需要直接面对 CANN (Compute Architecture for Neural Networks) 的...
如何通过 AclLite 封装大幅简化昇腾推理程序的开发流程 在国产昇腾(Ascend)芯片上进行 AI 推理开发时,开发者通常需要直接面对 CANN (Compute Architecture for Neural Networks) 的...
前言:为什么迁移学习成为深度学习的主流范式 在深度学习领域,从头训练一个大型神经网络往往需要海量的标注数据和昂贵的计算资源。以ImageNet上训练的ResNet-152为例,使用8块V100 GPU也需要数天时间才能完成完整训练。对于大多...

从序列建模到线性复杂度:状态空间模型的前世今生 在深度学习领域,Transformer 架构凭借其强大的自注意力机制,几乎统治了自然语言处理、计算机视觉等所有主流任务。然而,Transformer 的核心——自注意力——的计算复杂度是 O(...

引言:从模型到生产服务的最后一公里 在深度学习项目的完整生命周期中,训练出高精度的模型只是第一步。真正具有挑战性的环节,是如何将训练好的模型部署为稳定、可扩展的在线推理服务。TensorFlow Serving(以下简称TF Serving...
如何利用 Apple AMX 指令集实现 4-bit 量化 LLM 的端侧加速 随着端侧大语言模型(LLM)的普及,如何在 iPhone 或 Mac 上实现毫秒级的响应速度成为了开发者面临的巨大挑战。Apple 的 A 系列及 M 系列芯片...
引言 在训练大型深度学习模型时,显存(VRAM)往往是最大的瓶颈之一。TensorFlow 2.x 引入了强大的混合精度训练(Mixed Precision Training)功能,允许我们在不牺牲模型精度的情况下,大幅减少显存占用并提高训...

引言:为什么需要 LoRA? 大语言模型(LLM)的参数量动辄数十亿甚至数千亿,传统全参数微调(Full Fine-Tuning)需要为每个下游任务保存一份完整的模型副本。以 LLaMA-65B 为例,全参数微调仅单份 checkpoint...
引言:为什么需要模型优化? 在深度学习模型落地到生产环境的过程中,一个常见的困境是:模型在GPU服务器上跑得飞快、精度出色,但一旦需要部署到移动设备、边缘计算节点或者高并发API服务中,就会发现推理速度跟不上、内存占用过高。这个问题的本质在...

引言:大模型训练的内存困境 随着GPT-4、Llama 3、Qwen等大语言模型(LLM)的参数规模突破千亿甚至万亿级别,单张GPU的显存早已无法容纳完整的模型训练。以Llama 3 70B为例,仅模型权重(FP16)就需要约140GB显存...
背景 在嵌入式设备或 Android/iOS 开发中,AI 模型的推理性能不仅取决于算法复杂度,还深受系统资源调度的影响。很多开发者会发现,ncnn 在连续推理时,由于系统底层的 malloc 和 free 导致内存碎片或内核锁竞争,从而引...