MLPerf Inference v6.1 新增智能体基准:Vera Rubin NVL72 首测 3.7 倍于 GB300

M
L
C
o
m
m
o
n
s
发
布
M
L
P
e
r
f
I
n
f
e
r
e
n
c
e
v
6
.
1
结
果
,
提
交
机
构
数
量
创
历
史
新
高
,
并
新
增
两
项
测
试
:
端
到
端
R
A
G
(
把
嵌
入
、
检
索
、
重
排
与
L
L
M
推
理
串
成
一
条
流
水
线
,
分
别
测
建
库
与
问
答
)
与
边
缘
A
g
e
n
t
i
c
推
理
(
多
轮
、
累
积
上
下
文
、
准
确
率
门
限
内
计
时
)
,
后
者
沿
用
即
将
发
布
的
M
L
P
e
r
f
A
g
e
n
t
i
c
数
据
中
心
基
准
的
方
法
学
;
同
时
新
增
投
机
解
码
(
S
e
c
u
l
a
t
i
v
e
D
e
c
o
d
i
n
g
)
在
交
互
场
景
下
的
支
持
。
硬
件
侧
,
N
V
I
D
I
A
V
e
r
a
R
u
b
i
n
N
V
L
7
2
首
次
预
览
提
交
即
拿
下
领
先
成
绩
:
在
Q
w
e
n
3
-
V
L
上
吞
吐
最
高
为
G
B
3
0
0
N
V
L
7
2
的
3
.
7
倍
,
在
D
e
e
S
e
e
k
-
R
1
上
为
2
.
5
倍
;
G
B
3
0
0
N
V
L
7
2
的
2
8
8
卡
四
机
柜
提
交
实
现
9
9
%
扩
展
效
率
;
v
6
.
1
提
交
中
的
软
件
优
化
较
v
6
.
0
带
来
最
高
1
.
6
倍
提
升
。
M
L
C
o
m
m
o
n
s
称
本
轮
结
果
相
对
一
年
前
的
平
台
最
高
有
5
.
7
倍
性
能
增
益
。
意
义
:
基
准
套
件
从
「
单
次
问
答
吞
吐
」
转
向
「
多
步
流
水
线
与
智
能
体
负
载
」
,
评
测
口
径
第
一
次
跟
上
了
实
际
部
署
形
态
;
N
V
I
D
I
A
的
分
数
仍
是
厂
商
提
交
口
径
,
但
基
准
本
身
的
变
化
对
全
行
业
生
效
。
核验记录
MLCommons 公告页经 r.jina.ai 直读(直连 403),确认 v6.1 新增两项测试与投机解码支持;nvidianews.nvidia.com/news 列表页可见日期 September 16, 2026,NVIDIA 博客正文经 Jina 直读核对 3.7×/2.5×/99%/1.6× 数字。所有性能数字均为厂商提交口径(Closed Division),未独立复测。