
海光DCU开发实战全攻略:从CUDA代码迁移到ROCm/DTK适配的完整踩坑记录
在国产化替代的大背景下,海光DCU(Deep Computing Unit)已成为国内AI推理和训练场景中重要的GPU替代方案。海光DCU基于AMD GPU架构,使用ROCm作为底层软件栈,并在此基础上封装了DTK(DeepLook Too...

在国产化替代的大背景下,海光DCU(Deep Computing Unit)已成为国内AI推理和训练场景中重要的GPU替代方案。海光DCU基于AMD GPU架构,使用ROCm作为底层软件栈,并在此基础上封装了DTK(DeepLook Too...

在大模型落地应用的过程中,一个愈发普遍的需求是:同一个基座模型(如 LLaMA-3-70B),需要同时服务数千个不同的下游任务。每个任务有自己的微调权重——客服对话、代码补全、文档摘要、多语言翻译……如果为每个任务都部署一个独立模型副本,显...

为什么 Prefix Caching 成为大模型推理的必备优化? 在大模型推理服务的生产环境中,一个经常被忽视但影响巨大的现象是:大量请求共享相同的前缀。无论是系统提示词(System Prompt)、Few-shot 示例,还是多轮对话中...

为什么 KV Cache 成了大模型推理的命门? 在 Transformer 架构的大语言模型中,自回归生成(autoregressive generation)是推理阶段的核心模式——每生成一个新 token,模型都需要关注之前所有已生成...

引言:Prefill 阶段的”独木桥”困境 在大模型推理的工程实践中,我们常常遇到这样一个矛盾场景:当请求队列中有一个长文本(比如 32K tokens 的法律文档)正在进行 Prefill 处理时,后面排队等候的短...
引言:为什么 Batching 策略决定了推理服务的天花板 在大模型推理服务的工程实践中,有一个经常被低估却至关重要的设计决策:如何将并发的用户请求组织成批次(Batch)送入 GPU 执行。这个看似简单的调度问题,实际上直接决定了服务的吞...

系统讲解大模型 PD 分离部署:Prefill 与 Decode 的资源差异、KV Cache 传输、调度策略、网络要求,以及 vLLM 和 SGLang 的选型方法。

SGLang 和 vLLM 怎么选?从 PagedAttention、RadixAttention、调度、吞吐、显存、结构化输出和生产成熟度进行系统对比。

为什么大模型生产环境需要专业的GPU监控? 在AI基础设施(AI Infra)的日常运维中,GPU监控与可观测性往往是最容易被忽视的一环。很多团队在部署大模型推理服务时,只关注模型的推理延迟和吞吐量,却忽略了GPU本身的健康状态、功耗曲线、...

为什么需要量化KV Cache? 在大语言模型(LLM)的推理过程中,KV Cache(Key-Value Cache)是一个绕不开的核心组件。当模型以自回归方式逐Token生成文本时,对于Decoder-only架构的Transforme...