FlashDecoding 与 FlashInfer 深度解析:大模型推理 Decode 阶段 Attention 并行加速从原理到实战
在大模型推理的整个生命周期中,Decode 阶段往往是性能瓶颈所在。Prefill 阶段虽然计算量大,但可以通过大规模矩阵乘法充分利用 GPU 的并行能力;而 Decode 阶段逐 token 生成,每次只处理一个 query token ...
在大模型推理的整个生命周期中,Decode 阶段往往是性能瓶颈所在。Prefill 阶段虽然计算量大,但可以通过大规模矩阵乘法充分利用 GPU 的并行能力;而 Decode 阶段逐 token 生成,每次只处理一个 query token ...