推理优化
第10章:生产部署与运维
掌握 vLLM 推理服务的容器化与 Kubernetes 部署、可观测性、自动扩缩容、负载均衡与容量规划
生产部署 Kubernetes 可观测性 自动扩缩容 容量规划
本章简介
前面章节让推理服务”跑得又快又省”,本章解决”稳定地服务真实流量”的问题:如何打包、编排、观测、扩缩容和做容量规划。这是从 Demo 到生产的最后一公里,以 vLLM 部署为实例。
容器化与 Kubernetes 部署讲清如何把 vLLM 服务打成镜像并在 K8s 上编排:GPU 资源请求、就绪/存活探针(注意模型加载耗时长,探针阈值要放宽)、镜像与权重的拉取策略,以及 vLLM Production Stack、KServe 等生产部署方案。
可观测性是运维的眼睛:vLLM 暴露 Prometheus 指标端点(TTFT、TPOT、running/waiting 请求数、KV Cache 利用率、抢占次数等),配合 Grafana 看板和结构化日志,做到故障可定位、性能可追踪。
自动扩缩容与负载均衡覆盖多副本部署下的请求分发:基于 QPS / 队列长度 / KV Cache 利用率的 HPA 扩缩容,以及前缀感知(Prefix-aware)路由如何把命中同一 System Prompt 的请求导向同一副本以提升缓存命中率。
⚠️ 安全提示:vLLM 的 OpenAI 兼容服务默认不做认证,直接暴露到公网等于开放算力与数据。生产部署务必在网关层加上 API Key 校验、TLS 与网络隔离——本章会明确这一点,避免”裸奔”上线。
容量规划给出从 SLO 和峰值 QPS 反推所需 GPU 数量的方法:结合单副本压测得到的吞吐上限、显存约束和冗余系数,估算集群规模与成本。
本章小节
- 10.1 容器化与 Kubernetes 部署:镜像、GPU 调度、探针、Production Stack/KServe
- 10.2 可观测性:Prometheus 指标、Grafana 看板、日志与告警
- 10.3 自动扩缩容与负载均衡:HPA 策略、前缀感知路由、认证与安全
- 10.4 容量规划:从 SLO 与峰值 QPS 反推集群规模与成本