部署 LLM 到生产,第一关不是训练,是推理性能。同样的 7B 模型,从 80 tok/s 到 2000 tok/s 只需 4 步:vLLM 推理引擎 + AWQ 量化 + Flash Attention + Prefix Caching + Continuous Batching。本文讲清每一步的原理、配置、实测数据与成本模型。