书籍介绍
本书以vLLM与SGLang两大主流开源推理框架为核心,系统讲解其从理论基础到生产部署的完整知识体系,是面向算法工程师与系统工程师的实战参考手册。全书共14章,分为3 部分。第1部分(第1~4章)夯实理论基础,涵盖 Transformer推理机制、KV缓存原理、连续批处理、FlashAttention、投机解码等核心算法,帮助读者建立扎实的推理优化认知体系。第2部分(第5~12章)以项目驱动的方式深入实践,内容涵盖长文档处理、结构化输出、多模态实时视频理解、多智能体协作、生产级服务部署与监控,以及基于vLLM的DeepSeek V4长上下文推理服务等典型工程场景,每章均提供可直接复用的完整工程代码。第3部分(第13~14章)聚焦进阶优化与技术前沿,系统梳理模型量化、分布式推理、软硬件协同等高阶技术路径,并对以 DeepSeek-V4为代表的新一代模型架构发展趋势与推理框架演进方向做出研判与展望。
本书注重工程严谨性,部分代码基于vLLM v0.8.x与SGLang v0.4/v0.5当前稳定版本,力求做到开卷即用、经得起生产环境的检验。无论是希望系统入门推理优化的工程师,还是寻求在生产实践中进一步提升系统性能的资深从业者,均可从本书中获得切实的启发。