
vLLM 推理参数调优全攻略:从 gpu_memory_utilization 到 max_num_batched_tokens 的性能优化实战
在大模型推理部署中,vLLM 凭借 PagedAttention、Continuous Batching 等核心技术成为了最流行的推理框架之一。然而,很多开发者在部署 vLLM 时仅仅使用了默认参数,并没有深入理解每个启动参数对吞吐量、延迟...

在大模型推理部署中,vLLM 凭借 PagedAttention、Continuous Batching 等核心技术成为了最流行的推理框架之一。然而,很多开发者在部署 vLLM 时仅仅使用了默认参数,并没有深入理解每个启动参数对吞吐量、延迟...

引言:Prefill 阶段的”独木桥”困境 在大模型推理的工程实践中,我们常常遇到这样一个矛盾场景:当请求队列中有一个长文本(比如 32K tokens 的法律文档)正在进行 Prefill 处理时,后面排队等候的短...