推理优化
第6章:分布式推理与大模型部署
掌握推理场景下的张量并行、流水线并行、数据并行与专家并行,以及基于 Ray 的多节点部署
分布式推理 张量并行 流水线并行 Expert Parallel Ray vLLM
本章简介
当模型大到单张 GPU 装不下,或吞吐要求超过单卡上限时,就必须把推理拆到多卡甚至多机上。本章讲清推理场景下的并行策略——注意它与训练并行的目标不同:训练关注梯度同步与收敛,推理关注显存装载、TTFT/TPOT 延迟和吞吐。全程以 vLLM 的分布式能力为实例。
**张量并行(Tensor Parallel, TP)**将每一层的权重矩阵按行/列切分到多卡,单次前向内部通过 AllReduce 聚合,是推理中降低单卡显存、加速单请求延迟的首选。本节分析 TP 的通信量、对 NVLink 带宽的依赖,以及为什么 TP 通常不跨节点。
**流水线并行(Pipeline Parallel, PP)**将模型按层切成多段放在不同 GPU 上,适合跨节点扩展;本节分析推理场景下 PP 的 Bubble 与 Micro-batch 组织,以及 TP×PP 的组合选择。
数据并行与专家并行(DP / EP):DP 复制多份引擎横向扩吞吐;EP 针对 MoE 模型将不同 Expert 分布到不同 GPU,通过 All-to-All 通信路由 Token,是部署超大 MoE 模型的关键。
**多节点部署(Ray 集群)**讲清 vLLM 如何借助 Ray 编排多机多卡:集群拉起、Placement Group、TP/PP 在节点内外的映射,以及常见的通信与环境排错。
vLLM 分布式部署实战:用 tensor-parallel-size / pipeline-parallel-size / data-parallel-size 部署大模型,验证多卡下的显存分布与吞吐提升。
本章小节
- 6.1 推理并行策略总览:与训练并行的目标差异,TP/PP/DP/EP 适用场景
- 6.2 张量并行推理:权重切分、AllReduce、NVLink 带宽依赖
- 6.3 流水线并行推理:跨节点扩展、Bubble 与 Micro-batch
- 6.4 数据并行与专家并行:横向扩吞吐、MoE 的 All-to-All 路由
- 6.5 多节点部署(Ray):集群编排、并行度映射、排错
- 6.6 vLLM 分布式部署实战:多卡多机启动参数与验证