跳到主要内容
推理优化

第11章:推理优化选型与端到端实战

掌握推理优化选型决策树、技术叠加注意事项,完成从需求分析到上线监控的端到端 vLLM 部署实战

推理优化选型决策端到端部署vLLM课程总结

本章简介

本章是推理优化模块的总结和实战落地,也是整个课程的收官。把前面各章的技术串成一条可执行的决策与部署链路,以 vLLM 端到端上线为最终实战。

优化选型决策树根据症状选择技术:TTFT 过高 → Chunked Prefill / Prefix Cache / GEMM 优化;TPOT 过高 → FlashAttention / Speculative Decoding;显存不够 → PagedAttention / 量化 / 并行;尾延迟失控 → P/D 解耦 / SLO 感知调度。

优化组合注意事项强调技术叠加不等于效果叠加,分析常见冲突(Speculative Decoding + 量化、Speculative Decoding + Continuous Batching),建议优化顺序:OOM → TTFT → TPOT/Throughput → 尾延迟。

端到端部署实战走通完整流程:需求分析(模型规格、SLO 要求、硬件资源)→ 方案设计(框架、量化、并行方案)→ 部署(模型转换、配置调优、压测验证)→ 上线监控(指标采集、告警、容量规划),全程用 vLLM 落地。

课程总结回顾四大模块的知识关联图、核心 trade-off 汇总表,以及持续学习建议:跟踪前沿论文、参与开源社区、积累工程经验。

本章小节

  • 11.1 优化选型决策树:按症状(TTFT/TPOT/显存/尾延迟)选择技术
  • 11.2 优化组合注意事项:技术叠加的冲突与推荐优化顺序
  • 11.3 端到端部署实战:需求分析 → 方案设计 → 部署压测 → 上线监控
  • 11.4 模块总结与持续学习:知识关联图、trade-off 汇总、学习建议

📝 学习提示

  • 本章是模块四的收官章:11.1/11.2 把第 2-10 章的技术组织成“选型地图”,11.3 是端到端总装配(智能客服案例),11.4 是知识沉淀与学习路线。建议先读 11.3 再回看 11.1/11.2(实战驱动选型),11.4 最后读。
  • 11.1 决策树与 11.3 实战强绑定:先按症状选技术(11.1),再在实战里验证(11.3 第 3 节的调优记录表)。
  • 11.2 的冲突案例(投机×量化、投机×连续批)是真实工程中最常见的坑,建议对照 5.4/5.5 回看原理。
  • 11.3 的案例数字(8 卡 H100、70B、60QPS)是演示参数,方法不变但数字要用自己的压测数据替换。
  • 11.4 的 trade-off 表是全模块的“结账清单”——复习时对照它检查每章要点。
  • 本章命令与 API 基于 vLLM v0.26.0,参数随版本变化,以官方文档为准。