🚀 推理优化 18 篇文章 · 11 个章节
模块四:推理优化
覆盖 LLM 推理基础、推理引擎核心技术、主流推理框架、量化、Speculative Decoding、PD 解耦架构,以及性能分析与端到端实战。
开始学习章节目录
掌握 PagedAttention、Continuous Batching、Prefix Cache、Chunked Prefill 与 Attention 后端及图优化五大推理引擎核心技术
深入 vLLM 的整体架构、V1 引擎设计、调度器源码与关键配置调优,并横向对比 SGLang、TensorRT-LLM
4 第4章:量化
掌握 W8A8(SmoothQuant)、INT4(GPTQ/AWQ)、KV Cache 量化和 FP8 量化的原理与选型决策
理解投机解码的核心原理(Draft + Verify)、Self-Draft 方案(Medusa/EAGLE-2)及其收益边界与限制
掌握推理场景下的张量并行、流水线并行、数据并行与专家并行,以及基于 Ray 的多节点部署
理解 P/D 混合 Batching 的问题、DistServe/Splitwise 等解耦方案、KV Cache 传输、Goodput 与 SLO 感知调度
掌握 vLLM 的结构化输出、Tool Calling、Multi-LoRA、多模态推理与采样解码算法等生产落地能力
建立完整的推理性能指标体系,掌握 vllm bench、GenAI-Perf 等压测工具和性能分析工具,制定性能回归门禁
10 第10章:生产部署与运维
掌握 vLLM 推理服务的容器化与 Kubernetes 部署、可观测性、自动扩缩容、负载均衡与容量规划
掌握推理优化选型决策树、技术叠加注意事项,完成从需求分析到上线监控的端到端 vLLM 部署实战
学习建议
前置要求
前置知识模块 + CUDA 编程基础
- LLM 推理基础章节帮助理解推理场景的独特挑战
- 量化和 Speculative Decoding 是当前最热门的推理优化方向
- 建议结合主流推理框架(如 vLLM)进行实际部署练习