华为昇腾适配经验:在没有 CUDA 的日子里,如何利用 CANN 调优模型性能
在脱离了熟悉的 CUDA 生态后,针对华为昇腾(Ascend)硬件进行深度学习模型推理性能优化,是许多开发者需要面临的挑战。昇腾平台的核心是 CANN(Compute Architecture for Neural Networks)工具链...
在脱离了熟悉的 CUDA 生态后,针对华为昇腾(Ascend)硬件进行深度学习模型推理性能优化,是许多开发者需要面临的挑战。昇腾平台的核心是 CANN(Compute Architecture for Neural Networks)工具链...

从单体到分体:为什么大模型推理正在走向 Prefill/Decode 分离部署? 2024 年下半年以来,大模型推理架构迎来了一个新的趋势——PD 分离部署(Prefill/Decode Disaggregation)。简单来说,就是将传统...
前言 在安卓端侧推理(如使用 MNN、NCNN 或 TFLite)时,经常会遇到框架不支持某些特殊算子(如特定的激活函数、自定义的特征融合层)的情况。此时,如果回退到 CPU 执行会造成严重的性能瓶颈。本文将介绍如何编写一个 OpenGL ...

NumPy广播机制与高级索引实战:从入门到性能优化 在Python科学计算领域,NumPy是无可争议的基础库。无论是Pandas、SciPy、Scikit-learn还是TensorFlow/PyTorch,底层都依赖NumPy的数组计算能...
前言:为什么迁移学习成为深度学习的主流范式 在深度学习领域,从头训练一个大型神经网络往往需要海量的标注数据和昂贵的计算资源。以ImageNet上训练的ResNet-152为例,使用8块V100 GPU也需要数天时间才能完成完整训练。对于大多...

为什么 Reranker 是生产级 RAG 系统中不可或缺的关键组件 在构建基于向量搜索的 RAG(检索增强生成)系统时,许多开发者将大量精力投入到 Embedding 模型选型、向量数据库性能和分块策略优化上,却往往忽视了检索链路中一个至...

引言:推理引擎之争的底层逻辑 随着大语言模型(LLM)在各行各业的落地加速,模型推理效率已成为制约规模化部署的核心瓶颈。在众多开源推理框架中,vLLM 和 SGLang 是最受关注的两个项目。vLLM 由 UC Berkeley 的 Sky...

从序列建模到线性复杂度:状态空间模型的前世今生 在深度学习领域,Transformer 架构凭借其强大的自注意力机制,几乎统治了自然语言处理、计算机视觉等所有主流任务。然而,Transformer 的核心——自注意力——的计算复杂度是 O(...

在大模型应用落地的过程中,微调(Fine-tuning)是让通用模型适配特定业务场景的核心手段。然而,许多团队在微调时投入大量精力调参、选模型架构,却忽视了最关键的一环——数据。业界有句广为流传的话:”Data is the h...

引言:数据读写是Spark性能的”隐形瓶颈” 在Spark生产环境中,许多开发者把精力集中在内存调优、Shuffle优化和并行度设置上,却往往忽视了一个关键环节——数据读写。事实上,根据业界对多个Spark生产集群的...