跳到主要内容
推理优化

第6章:分布式推理与大模型部署

掌握推理场景下的张量并行、流水线并行、数据并行与专家并行,以及基于 Ray 的多节点部署

分布式推理张量并行流水线并行Expert ParallelRayvLLM

本章简介

当模型大到单张 GPU 装不下,或吞吐要求超过单卡上限时,就必须把推理拆到多卡甚至多机上。本章讲清推理场景下的并行策略——注意它与训练并行的目标不同:训练关注梯度同步与收敛,推理关注显存装载、TTFT/TPOT 延迟和吞吐。全程以 vLLM 的分布式能力为实例。

**张量并行(Tensor Parallel, TP)**将每一层的权重矩阵按行/列切分到多卡,单次前向内部通过 AllReduce 聚合,是推理中降低单卡显存、加速单请求延迟的首选。本节分析 TP 的通信量、对 NVLink 带宽的依赖,以及为什么 TP 通常不跨节点。

**流水线并行(Pipeline Parallel, PP)**将模型按层切成多段放在不同 GPU 上,适合跨节点扩展;本节分析推理场景下 PP 的 Bubble 与 Micro-batch 组织,以及 TP×PP 的组合选择。

数据并行与专家并行(DP / EP):DP 复制多份引擎横向扩吞吐;EP 针对 MoE 模型将不同 Expert 分布到不同 GPU,通过 All-to-All 通信路由 Token,是部署超大 MoE 模型的关键。

**多节点部署(Ray 集群)**讲清 vLLM 如何借助 Ray 编排多机多卡:集群拉起、Placement Group、TP/PP 在节点内外的映射,以及常见的通信与环境排错。

vLLM 分布式部署实战:用 tensor-parallel-size / pipeline-parallel-size / data-parallel-size 部署大模型,验证多卡下的显存分布与吞吐提升。

本章小节

  • 6.1 推理并行策略总览:与训练并行的目标差异,TP/PP/DP/EP 适用场景
  • 6.2 张量并行推理:权重切分、AllReduce、NVLink 带宽依赖
  • 6.3 流水线并行推理:跨节点扩展、Bubble 与 Micro-batch
  • 6.4 数据并行与专家并行:横向扩吞吐、MoE 的 All-to-All 路由
  • 6.5 多节点部署(Ray):集群编排、并行度映射、排错
  • 6.6 vLLM 分布式部署实战:多卡多机启动参数与验证

📝 学习提示

  • 本章各节环环相扣,建议按顺序阅读:6.1 建立策略坐标系,6.2-6.4 分别深挖 TP/PP/DP/EP 的原理,6.5 讲编排,6.6 是完整演练。
  • 读 6.2 时建议亲手算一遍第 5 节的通信账(70B/TP8 单步约 5MB),这个量级感对理解”TP 不跨节点”很有帮助。
  • 6.4 的 EP 是 MoE 时代的重点,配合 DeepSeek-V3 的实际部署(6.6 第 6 节)理解”EP 装下、DP 扩吞吐”的组合逻辑。
  • 每节结尾的”自我检验清单”可用于自查;6.6 的”全流程检查清单”建议打印出来作为实战模板。
  • 本节命令均基于 vLLM v0.26.0,参数与版本相关,遇到差异时以官方 Engine Arguments 文档为准。