
SGLang 推理框架部署实战全攻略:从安装配置到高性能服务上线的完整指南
SGLang 是由 LMSYS 团队(ChatBot Arena 的创建者)开源的大语言模型推理框架,凭借 RadixAttention 前缀复用技术和结构化生成能力,在多轮对话、Agent 工作流和 JSON 结构化输出场景中展现出显著优...

SGLang 是由 LMSYS 团队(ChatBot Arena 的创建者)开源的大语言模型推理框架,凭借 RadixAttention 前缀复用技术和结构化生成能力,在多轮对话、Agent 工作流和 JSON 结构化输出场景中展现出显著优...
在众多大模型推理框架中,NVIDIA 的 TensorRT-LLM 凭借对 GPU 硬件的深度优化,一直是吞吐量和延迟性能的天花板级选手。然而,它陡峭的学习曲线和复杂的模型转换流程让不少工程师望而却步——你需要理解 checkpoint 转...

在大模型推理部署中,vLLM 凭借 PagedAttention、Continuous Batching 等核心技术成为了最流行的推理框架之一。然而,很多开发者在部署 vLLM 时仅仅使用了默认参数,并没有深入理解每个启动参数对吞吐量、延迟...

大模型推理框架的选型是每一个 AI Infra 工程师绕不开的话题。当前主流的开源推理框架——vLLM、SGLang、TensorRT-LLM 和 HuggingFace TGI——各有特色,但到底哪个更适合你的业务场景?本文将通过真实的基...

当大语言模型的参数量从 7B 一路攀升到 70B 甚至 405B 时,单张 GPU 的显存早已无法容纳完整模型。以 Llama-3-70B 为例,仅 FP16 权重就需要约 140GB 显存,远超单张 A100-80G 的容量上限。此时,将...

在大模型推理框架的赛道上,vLLM 和 SGLang 风头正劲,TensorRT-LLM 凭借 NVIDIA 官方加持占据高端市场,但 HuggingFace 推出的 TGI(Text Generation Inference)依然是很多团...
在大模型推理的工程实践中,KV Cache 是一把双刃剑:它通过缓存历史 Token 的 Key 和 Value 向量避免了重复计算,是自回归推理加速的基石;但它同时也是显存消耗的”头号杀手”。以一个 70B 参数模...

在大模型落地应用的过程中,一个愈发普遍的需求是:同一个基座模型(如 LLaMA-3-70B),需要同时服务数千个不同的下游任务。每个任务有自己的微调权重——客服对话、代码补全、文档摘要、多语言翻译……如果为每个任务都部署一个独立模型副本,显...

为什么 Prefix Caching 成为大模型推理的必备优化? 在大模型推理服务的生产环境中,一个经常被忽视但影响巨大的现象是:大量请求共享相同的前缀。无论是系统提示词(System Prompt)、Few-shot 示例,还是多轮对话中...

引言:为什么梯度累积是大模型训练的”隐形基础设施” 在 ChatGPT 横空出世的三年后,大模型训练的”显学”似乎已经从单卡微调转移到了千卡预训练。各类技术文章铺天盖地讨论着 3D 并行、Ze...