跳到主要内容
推理优化

9.4 权威基准:MLPerf Inference 与 LLM 评测趋势

MLPerf Inference v6.0 解读(GPT-OSS-120B、DeepSeek-R1 Interactive、Qwen3-VL)、LoadGen++、MLPerf Endpoint、LLM-Perf 榜单与评测方法论趋势

MLPerf基准LLM-PerfLoadGen++GPT-OSSPareto

9.1-9.3 教你自己测,9.4 教你看别人测。权威基准(MLPerf Inference 是最有影响力的)的价值不是”谁第一”,而是方法论:用什么负载、什么场景、什么指标口径——这些直接决定了你怎么解读结果、怎么借用来做自己的评估。2026 年 4 月的 MLPerf Inference v6.0 是理解当前行业评测趋势的最佳样本。

📑 目录


1. MLPerf Inference 是什么:场景与规则

MLPerf(MLCommons 联盟运营)是行业标准的推理基准,每年两次发布 Datacenter 与 Edge 结果。核心设计:

  • 固定负载:每个基准绑定具体模型 + 数据集(如 GPT-OSS-120B、DeepSeek-R1)
  • 固定场景:Offline(批处理吞吐)/ Server(有到达过程的在线服务)/ Interactive(强延迟约束,v4.0 起)
  • 固定规则:Closed 组(同一模型+同一优化自由度受限)/ Open 组(允许改模型)
  • 固定指标:吞吐(Offline)或 延迟约束下的达标吞吐(Server/Interactive)

1.1 三个场景的指标口径

场景指标口径
OfflineSamples/s尽最快处理完整个测试集
Server延迟约束下的吞吐满足延迟 SLO 的请求占比 ≥ 要求
Interactive达标 token 率TTFT/TPOT 的 P99 硬约束

📌 关键点MLPerf 从来不是”跑分越高越好”的单点比赛——Server/Interactive 场景的分数必须在延迟约束内取得,这本质就是 9.1 的 Goodput 思想。看 MLPerf 结果时,先看场景与约束,再看数字。

1.2 历史 latency target 示例(Llama 2 70B Interactive)

  • TTFT ≤ 450ms(P99)
  • TPOT ≤ 40ms(P99)

这两个数字是从真实平台用户数据推出来的行业共识——你自己的 SLO 定在什么量级,这就是锚点


2. v6.0 的新基准:行业风向标

2026 年 4 月发布的 v6.0 是”最重大的一次更新”(MLCommons 官方语),11 个 datacenter 测试中 5 个是新的或大幅更新

新/更新基准内容释放的信号
GPT-OSS-120BOpenAI 开源 120B MoE 推理模型(数学/科学推理/代码)MoE 推理成为必测项
DeepSeek-R1 Interactive新增 Interactive 场景(最低 token 率要求 5 倍于 Server、TTFT 缩短 1.3 倍)投机解码等加速技术被官方允许并鼓励
Qwen3-VL-235B-A22B首个 VLM 基准(235B 总参/22B 激活,Shopify 商品目录数据)多模态进入主流评测
WAN-2.2-T2V-A14B首个文生视频基准生成式多模态扩容
DLRMv3基于 Meta HSTU 的顺序推荐模型推荐系统进入 Transformer 时代

📌 关键点:v6.0 的基准选择 = 行业共识的工作负载清单:MoE 推理、推理模型(带思考链)、多模态、生成式视频。如果你在建设推理平台,这就是”必须支持的负载类型”清单——资源规划、架构设计(第 6/7 章)都应该按这个清单验算。


3. v6.0 的关键结果与趋势

3.1 软件优化 > 硬件换代

  • NVIDIA GB300 NVL72 上 DeepSeek-R1 Server 场景 2.77× per-GPU 吞吐提升(对比半年前的 v5.1,同一硬件
  • 驱动因素:kernel fusion、Dynamo 分离式 serving(PD 分离)、Wide Expert Parallel(EP)、Multi-Token Prediction(投机解码)、KV-aware routing
  • Lambda Labs:相同 HGX B200 硬件只升级 CUDA 栈,Llama 3.1 8B 吞吐 +9%
  • 结论:已购硬件的性能不是固定值,软件栈升级能持续兑现(对应本书 4-8 章的每一章)

3.2 系统规模快速膨胀

  • 多节点提交数:v5.0(2025-04)2 个 → v5.1 → v6.0 13 个(+30% vs v5.1)
  • 最大系统:72 节点、288 加速器(上轮最大系统的 4 倍节点数)
  • 10% 的提交系统超过 10 节点(上轮 2%)
  • 结论:分布式推理(第 6 章)从”少数玩家的玩具”变成”主流能力”

3.3 生态竞争格局

  • AMD MI355X:CDNA4、288GB HBM3E、FP4/FP6;多节点 Llama 2 70B / GPT-OSS-120B 破 100 万 tok/s;9 家伙伴提交
  • Intel Arc Pro B70 + Xeon 6:120B 模型 4 卡不切分可跑;x86 生态性价比路线
  • NVIDIA:14 家伙伴(最大单平台记录)

💡 提示:解读厂商 PR 的三个过滤问题:① 什么场景什么约束?(Interactive 的 250k tok/s 和 Offline 的 2.5M tok/s 不是一回事)② 什么软件栈?(v6.0 的教训:软件差异可达 2.77×)③ 什么硬件配置?(72 节点的成绩不能外推到单机)。用 9.1 的指标体系逐个过滤


4. 评测方法论在进化:LoadGen++ 与 Endpoint 格式

4.1 LoadGen++:serving 风格的评测 harness

v6.0 引入的新评测框架:让 LLM 用生产级的 serving 软件栈(连续批处理、KV 缓存、调度器)跑基准——取代旧的”提交专用 harness”。

  • 意义:评测结果更接近真实部署(此前厂商可以用专门调优的 harness 拿到现实中拿不到的分数)
  • 对我们的启示:内部压测也应该用生产配置(9.2 的可复现配置 + 生产参数),不要用”压测专用配置”

4.2 MLPerf Endpoint:从单点分数到 Pareto 曲线

MLCommons 预告的下一个大变化:不再只报告”一个吞吐数字”,而是发布延迟-吞吐权衡曲线(trade-off curve),让采购方按自己的 SLO 在曲线上取点。

  • 本质:把 9.1 的”延迟/吞吐 trade-off”和 9.2 的”并发-延迟-吞吐曲线”变成标准交付物
  • 对我们的启示:自己的评测也应该产出曲线而不是单点——vllm bench sweep serve(9.2)正是干这个的

📌 关键点:评测方法论的两次进化(LoadGen++、Endpoint 格式)指向同一件事——评测要反映”在约束下能用多少”,而不是”峰值多高”。这与 Goodput 思想完全一致:行业正在把”达标率”变成通用语言。


5. LLM 专项榜单:LLM-Perf 与 InferenceMAX

5.1 LLM-Perf Leaderboard(Hugging Face optimum 团队)

  • 统一配置下的 vLLM/TRT-LLM/TGI 等引擎对比(社区驱动)
  • 维度:吞吐、TTFT/TPOT 延迟、显存
  • 局限:固定硬件配置、固定负载——看趋势可以,直接搬结论要谨慎

5.2 SemiAnalysis InferenceMAX(vLLM 官方合作)

  • Pareto Frontier 方法论:对每个 ISL/OSL 组合(如 1K/1K、1K/8K、8K/1K),在不同并发下测吞吐与延迟,画帕累托前沿(图 1/图 2)
  • 2025-10 结果:Blackwell vs Hopper,gpt-oss-120b 最高 4.3× 吞吐、Llama 3.3 70B(1K/8K)3.7×(同延迟水平)
  • 支持投机解码(gpt-oss-120b-Eagle3)与 DEP(Data+Expert Parallel)展望

5.3 三种评测范式的定位

范式代表适合回答
行业规范MLPerf Inference“行业平均水平/最优在哪”
引擎对比LLM-Perf“我的引擎选型对不对”
硬件前沿InferenceMAX“新硬件/新优化的上限在哪”

💡 提示InferenceMAX 的 Pareto 图是 9.2”并发-延迟-吞吐曲线”的行业级示范——自己做评测时照这个格式产出:横轴延迟(P99)、纵轴吞吐、每条曲线一个并发档位。一张图讲完整个 trade-off 故事。


6. 从权威基准学到什么:对我们自己的启示

① 负载清单 = 能力建设清单
   MoE / 推理模型 / VLM / 长输出 —— 平台能力按这个排优先级

② 场景决定指标
   Offline 看吞吐,Interactive 看达标率 —— 先定场景再定指标(9.1)

③ 软件是性能的一部分
   v6.0 的 2.77× 全是软件优化 —— 每章优化都有真实回报(4-8 章)

④ 曲线代替单点
   LoadGen++ / Endpoint / Pareto —— 自己的评测也按曲线交付

⑤ 约束内比较
   看任何榜单先问场景、约束、软件栈、硬件配置四个问题

📌 关键点:权威基准的最大价值是校准你的评估体系:用 MLPerf 的负载清单规划能力,用 Endpoint/Pareto 的方法论交付结果,用 Interactive 的 latency target 锚定 SLO。别抄数字,抄方法论


📝 总结

  • MLPerf:场景(Offline/Server/Interactive)+ 约束 + 规则(Closed/Open)决定一切
  • v6.0 信号:MoE、推理模型、VLM、视频成为主流负载;Interactive 场景允许投机解码
  • v6.0 趋势:软件优化 > 硬件换代(同硬件 2.77×);多节点提交激增(72 节点最大)
  • 方法论进化:LoadGen++(serving 栈评测)、Endpoint(Pareto 曲线交付)
  • LLM 专项:LLM-Perf(引擎对比)、InferenceMAX(硬件前沿 Pareto)
  • 启示:抄方法论不抄数字——负载清单、场景指标、曲线交付、约束内比较

🎯 自我检验清单

  • MLPerf 三个场景的指标口径分别是什么?
  • v6.0 五个新/更新基准分别释放什么行业信号?
  • 同硬件 2.77× 提升说明什么?主要驱动因素?
  • LoadGen++ 和 Endpoint 格式分别解决评测的什么问题?
  • 看厂商 PR 的四个过滤问题是什么?
  • InferenceMAX 的 Pareto 图怎么画?代表什么方法论?
  • 你的平台能力建设清单怎么从 v6.0 负载清单推导?

📚 参考资料