溢出 | 汤不热吧

怎样优化座舱内多模态大模型的 KV Cache：解决长对话场景下的显存占用溢出难题

2026-02-01andy阅读(72)评论(0)

在汽车智能座舱环境中，部署多模态大模型（如处理语音、视觉和文本的VLM/LLM）是提升用户体验的关键。然而，座舱系统通常对硬件资源（尤其是GPU/NPU的显存）具有严格的限制。当用户进行长时间的连续对话时，大模型用于存储历史信息的KV Ca...