
TGI(Text Generation Inference)部署与调优实战:HuggingFace 推理框架架构解析与性能基准测试
在大模型推理框架的赛道上,vLLM 和 SGLang 风头正劲,TensorRT-LLM 凭借 NVIDIA 官方加持占据高端市场,但 HuggingFace 推出的 TGI(Text Generation Inference)依然是很多团...

在大模型推理框架的赛道上,vLLM 和 SGLang 风头正劲,TensorRT-LLM 凭借 NVIDIA 官方加持占据高端市场,但 HuggingFace 推出的 TGI(Text Generation Inference)依然是很多团...
引言:LLM 推理服务的吞吐量困局 当我们将一个大语言模型部署到生产环境时,最核心的挑战往往不是模型本身的精度,而是如何高效地利用 GPU 算力服务海量并发请求。一个 7B 参数的模型在单张 A100 上串行推理,每个请求可能需要数百毫秒到...
引言:为什么 Batching 策略决定了推理服务的天花板 在大模型推理服务的工程实践中,有一个经常被低估却至关重要的设计决策:如何将并发的用户请求组织成批次(Batch)送入 GPU 执行。这个看似简单的调度问题,实际上直接决定了服务的吞...

系统讲解大模型 PD 分离部署:Prefill 与 Decode 的资源差异、KV Cache 传输、调度策略、网络要求,以及 vLLM 和 SGLang 的选型方法。