9.4 权威基准:MLPerf Inference 与 LLM 评测趋势
MLPerf Inference v6.0 解读(GPT-OSS-120B、DeepSeek-R1 Interactive、Qwen3-VL)、LoadGen++、MLPerf Endpoint、LLM-Perf 榜单与评测方法论趋势
9.1-9.3 教你自己测,9.4 教你看别人测。权威基准(MLPerf Inference 是最有影响力的)的价值不是”谁第一”,而是方法论:用什么负载、什么场景、什么指标口径——这些直接决定了你怎么解读结果、怎么借用来做自己的评估。2026 年 4 月的 MLPerf Inference v6.0 是理解当前行业评测趋势的最佳样本。
📑 目录
- 1. MLPerf Inference 是什么:场景与规则
- 2. v6.0 的新基准:行业风向标
- 3. v6.0 的关键结果与趋势
- 4. 评测方法论在进化:LoadGen++ 与 Endpoint 格式
- 5. LLM 专项榜单:LLM-Perf 与 InferenceMAX
- 6. 从权威基准学到什么:对我们自己的启示
- 📝 总结
- 🎯 自我检验清单
- 📚 参考资料
1. MLPerf Inference 是什么:场景与规则
MLPerf(MLCommons 联盟运营)是行业标准的推理基准,每年两次发布 Datacenter 与 Edge 结果。核心设计:
- 固定负载:每个基准绑定具体模型 + 数据集(如 GPT-OSS-120B、DeepSeek-R1)
- 固定场景:Offline(批处理吞吐)/ Server(有到达过程的在线服务)/ Interactive(强延迟约束,v4.0 起)
- 固定规则:Closed 组(同一模型+同一优化自由度受限)/ Open 组(允许改模型)
- 固定指标:吞吐(Offline)或 延迟约束下的达标吞吐(Server/Interactive)
1.1 三个场景的指标口径
| 场景 | 指标 | 口径 |
|---|---|---|
| Offline | Samples/s | 尽最快处理完整个测试集 |
| Server | 延迟约束下的吞吐 | 满足延迟 SLO 的请求占比 ≥ 要求 |
| Interactive | 达标 token 率 | TTFT/TPOT 的 P99 硬约束 |
📌 关键点:MLPerf 从来不是”跑分越高越好”的单点比赛——Server/Interactive 场景的分数必须在延迟约束内取得,这本质就是 9.1 的 Goodput 思想。看 MLPerf 结果时,先看场景与约束,再看数字。
1.2 历史 latency target 示例(Llama 2 70B Interactive)
- TTFT ≤ 450ms(P99)
- TPOT ≤ 40ms(P99)
这两个数字是从真实平台用户数据推出来的行业共识——你自己的 SLO 定在什么量级,这就是锚点。
2. v6.0 的新基准:行业风向标
2026 年 4 月发布的 v6.0 是”最重大的一次更新”(MLCommons 官方语),11 个 datacenter 测试中 5 个是新的或大幅更新:
| 新/更新基准 | 内容 | 释放的信号 |
|---|---|---|
| GPT-OSS-120B | OpenAI 开源 120B MoE 推理模型(数学/科学推理/代码) | MoE 推理成为必测项 |
| DeepSeek-R1 Interactive | 新增 Interactive 场景(最低 token 率要求 5 倍于 Server、TTFT 缩短 1.3 倍) | 投机解码等加速技术被官方允许并鼓励 |
| Qwen3-VL-235B-A22B | 首个 VLM 基准(235B 总参/22B 激活,Shopify 商品目录数据) | 多模态进入主流评测 |
| WAN-2.2-T2V-A14B | 首个文生视频基准 | 生成式多模态扩容 |
| DLRMv3 | 基于 Meta HSTU 的顺序推荐模型 | 推荐系统进入 Transformer 时代 |
📌 关键点:v6.0 的基准选择 = 行业共识的工作负载清单:MoE 推理、推理模型(带思考链)、多模态、生成式视频。如果你在建设推理平台,这就是”必须支持的负载类型”清单——资源规划、架构设计(第 6/7 章)都应该按这个清单验算。
3. v6.0 的关键结果与趋势
3.1 软件优化 > 硬件换代
- NVIDIA GB300 NVL72 上 DeepSeek-R1 Server 场景 2.77× per-GPU 吞吐提升(对比半年前的 v5.1,同一硬件)
- 驱动因素:kernel fusion、Dynamo 分离式 serving(PD 分离)、Wide Expert Parallel(EP)、Multi-Token Prediction(投机解码)、KV-aware routing
- Lambda Labs:相同 HGX B200 硬件只升级 CUDA 栈,Llama 3.1 8B 吞吐 +9%
- 结论:已购硬件的性能不是固定值,软件栈升级能持续兑现(对应本书 4-8 章的每一章)
3.2 系统规模快速膨胀
- 多节点提交数:v5.0(2025-04)2 个 → v5.1 → v6.0 13 个(+30% vs v5.1)
- 最大系统:72 节点、288 加速器(上轮最大系统的 4 倍节点数)
- 10% 的提交系统超过 10 节点(上轮 2%)
- 结论:分布式推理(第 6 章)从”少数玩家的玩具”变成”主流能力”
3.3 生态竞争格局
- AMD MI355X:CDNA4、288GB HBM3E、FP4/FP6;多节点 Llama 2 70B / GPT-OSS-120B 破 100 万 tok/s;9 家伙伴提交
- Intel Arc Pro B70 + Xeon 6:120B 模型 4 卡不切分可跑;x86 生态性价比路线
- NVIDIA:14 家伙伴(最大单平台记录)
💡 提示:解读厂商 PR 的三个过滤问题:① 什么场景什么约束?(Interactive 的 250k tok/s 和 Offline 的 2.5M tok/s 不是一回事)② 什么软件栈?(v6.0 的教训:软件差异可达 2.77×)③ 什么硬件配置?(72 节点的成绩不能外推到单机)。用 9.1 的指标体系逐个过滤。
4. 评测方法论在进化:LoadGen++ 与 Endpoint 格式
4.1 LoadGen++:serving 风格的评测 harness
v6.0 引入的新评测框架:让 LLM 用生产级的 serving 软件栈(连续批处理、KV 缓存、调度器)跑基准——取代旧的”提交专用 harness”。
- 意义:评测结果更接近真实部署(此前厂商可以用专门调优的 harness 拿到现实中拿不到的分数)
- 对我们的启示:内部压测也应该用生产配置(9.2 的可复现配置 + 生产参数),不要用”压测专用配置”
4.2 MLPerf Endpoint:从单点分数到 Pareto 曲线
MLCommons 预告的下一个大变化:不再只报告”一个吞吐数字”,而是发布延迟-吞吐权衡曲线(trade-off curve),让采购方按自己的 SLO 在曲线上取点。
- 本质:把 9.1 的”延迟/吞吐 trade-off”和 9.2 的”并发-延迟-吞吐曲线”变成标准交付物
- 对我们的启示:自己的评测也应该产出曲线而不是单点——
vllm bench sweep serve(9.2)正是干这个的
📌 关键点:评测方法论的两次进化(LoadGen++、Endpoint 格式)指向同一件事——评测要反映”在约束下能用多少”,而不是”峰值多高”。这与 Goodput 思想完全一致:行业正在把”达标率”变成通用语言。
5. LLM 专项榜单:LLM-Perf 与 InferenceMAX
5.1 LLM-Perf Leaderboard(Hugging Face optimum 团队)
- 统一配置下的 vLLM/TRT-LLM/TGI 等引擎对比(社区驱动)
- 维度:吞吐、TTFT/TPOT 延迟、显存
- 局限:固定硬件配置、固定负载——看趋势可以,直接搬结论要谨慎
5.2 SemiAnalysis InferenceMAX(vLLM 官方合作)
- Pareto Frontier 方法论:对每个 ISL/OSL 组合(如 1K/1K、1K/8K、8K/1K),在不同并发下测吞吐与延迟,画帕累托前沿(图 1/图 2)
- 2025-10 结果:Blackwell vs Hopper,gpt-oss-120b 最高 4.3× 吞吐、Llama 3.3 70B(1K/8K)3.7×(同延迟水平)
- 支持投机解码(gpt-oss-120b-Eagle3)与 DEP(Data+Expert Parallel)展望
5.3 三种评测范式的定位
| 范式 | 代表 | 适合回答 |
|---|---|---|
| 行业规范 | MLPerf Inference | “行业平均水平/最优在哪” |
| 引擎对比 | LLM-Perf | “我的引擎选型对不对” |
| 硬件前沿 | InferenceMAX | “新硬件/新优化的上限在哪” |
💡 提示:InferenceMAX 的 Pareto 图是 9.2”并发-延迟-吞吐曲线”的行业级示范——自己做评测时照这个格式产出:横轴延迟(P99)、纵轴吞吐、每条曲线一个并发档位。一张图讲完整个 trade-off 故事。
6. 从权威基准学到什么:对我们自己的启示
① 负载清单 = 能力建设清单
MoE / 推理模型 / VLM / 长输出 —— 平台能力按这个排优先级
② 场景决定指标
Offline 看吞吐,Interactive 看达标率 —— 先定场景再定指标(9.1)
③ 软件是性能的一部分
v6.0 的 2.77× 全是软件优化 —— 每章优化都有真实回报(4-8 章)
④ 曲线代替单点
LoadGen++ / Endpoint / Pareto —— 自己的评测也按曲线交付
⑤ 约束内比较
看任何榜单先问场景、约束、软件栈、硬件配置四个问题
📌 关键点:权威基准的最大价值是校准你的评估体系:用 MLPerf 的负载清单规划能力,用 Endpoint/Pareto 的方法论交付结果,用 Interactive 的 latency target 锚定 SLO。别抄数字,抄方法论。
📝 总结
- MLPerf:场景(Offline/Server/Interactive)+ 约束 + 规则(Closed/Open)决定一切
- v6.0 信号:MoE、推理模型、VLM、视频成为主流负载;Interactive 场景允许投机解码
- v6.0 趋势:软件优化 > 硬件换代(同硬件 2.77×);多节点提交激增(72 节点最大)
- 方法论进化:LoadGen++(serving 栈评测)、Endpoint(Pareto 曲线交付)
- LLM 专项:LLM-Perf(引擎对比)、InferenceMAX(硬件前沿 Pareto)
- 启示:抄方法论不抄数字——负载清单、场景指标、曲线交付、约束内比较
🎯 自我检验清单
- MLPerf 三个场景的指标口径分别是什么?
- v6.0 五个新/更新基准分别释放什么行业信号?
- 同硬件 2.77× 提升说明什么?主要驱动因素?
- LoadGen++ 和 Endpoint 格式分别解决评测的什么问题?
- 看厂商 PR 的四个过滤问题是什么?
- InferenceMAX 的 Pareto 图怎么画?代表什么方法论?
- 你的平台能力建设清单怎么从 v6.0 负载清单推导?
📚 参考资料
- MLCommons:MLPerf Inference v6.0 结果公告(https://mlcommons.org/2026/04/mlperf-inference-v6-0-results/)
- MLPerf Inference Datacenter 基准页(https://mlcommons.org/benchmarks/inference-datacenter/)
- SemiAnalysis InferenceMAX:vLLM and NVIDIA Accelerate Blackwell Inference(https://vllm.ai/blog/2025-10-09-blackwell-inferencemax)
- Hugging Face LLM-Perf Leaderboard(https://huggingface.co/spaces/optimum/llm-perf-leaderboard)
- NAND Research:MLPerf Inference 6.0 解读(https://nand-research.com/mlperf-inference-6-0-software-gains-broadening-competition-shake-things-up/)