BENCHMARK OPEN PERFORMANCE DATA

性能榜单

让每一个性能数字都带着完整测试条件。

不做脱离环境的总分。只有模型、GPU、精度、负载和软件版本一致的结果才进行直接比较。

NEW FRESH-SERVICE MATRIX

MIF 与 vLLM 0.25.1:Qwen3-VL-8B 单卡吞吐

相同的500条自然多模态请求,在18组负载条件下分别执行 request-cold 与 warmup-hot;每格均为本轮一次全新服务运行。

验证等级 内部实测 · 单次运行 不提供跨运行CV或置信区间
数值领先 30 / 36

MIF 在36个配对单元中有30个吞吐数值更高。

c8 全部组合 +4.83%–+7.30%

低并发档位的领先在全部输出长度与EOS设置中一致出现。

高并发观察 基本持平

多数差异不足1%;单次运行不用于判断微小差异的稳定性。

模型
Qwen3-VL-8B-Instruct
硬件
1 × NVIDIA L40S · BF16
请求集
vision-arena-bench-v0.1 · train[0:500]
请求方式
unlimited arrival rate · 500/500成功
MIF
ccedb0dc · aigcengine-profile:trt-20260527
vLLM
0.25.1 · 752a3a504485790a2e8491cacbb35c137339ad34
vLLM镜像
vllm/vllm-openai:v0.25.1
Payload SHA-256
cf8e985584af4d6912e95ab325818f4762e48ed239262651f9219190d61c99dd

每格:MIF / vLLM(MIF相对差异),单位为 output tok/s。

c8/c16/c32:客户端 concurrency 与服务端 max_num_seqs 同时设为8/16/32;continuous batching 的实际逐轮 batch 动态变化。

MIF / vLLM 0.25.1 output tok/s 对比
max tokens EOS 并发档位 request-cold warmup-hot
128 EOS停止 c88 / 8
284.558 / 268.650 +5.92%
283.091 / 268.677 +5.36%
128 EOS停止 c1616 / 16
437.622 / 438.199 -0.13%
438.585 / 436.410 +0.50%
128 EOS停止 c3232 / 32
626.101 / 628.488 -0.38%
627.466 / 626.142 +0.21%
128 忽略EOS c88 / 8
287.765 / 268.857 +7.03%
287.634 / 268.723 +7.04%
128 忽略EOS c1616 / 16
437.566 / 439.930 -0.54%
438.772 / 439.235 -0.11%
128 忽略EOS c3232 / 32
638.359 / 641.824 -0.54%
645.520 / 638.590 +1.09%
256 EOS停止 c88 / 8
310.934 / 292.291 +6.38%
310.307 / 292.550 +6.07%
256 EOS停止 c1616 / 16
502.202 / 502.745 -0.11%
502.646 / 501.789 +0.17%
256 EOS停止 c3232 / 32
761.811 / 761.246 +0.07%
763.477 / 762.964 +0.07%
256 忽略EOS c88 / 8
315.206 / 294.656 +6.97%
315.267 / 293.816 +7.30%
256 忽略EOS c1616 / 16
507.933 / 505.912 +0.40%
507.424 / 505.631 +0.35%
256 忽略EOS c3232 / 32
796.694 / 790.524 +0.78%
798.412 / 787.682 +1.36%
512 EOS停止 c88 / 8
321.855 / 300.656 +7.05%
321.811 / 300.554 +7.07%
512 EOS停止 c1616 / 16
529.975 / 528.653 +0.25%
529.895 / 528.091 +0.34%
512 EOS停止 c3232 / 32
831.708 / 827.197 +0.55%
833.623 / 824.139 +1.15%
512 忽略EOS c88 / 8
322.434 / 306.516 +5.19%
321.394 / 306.580 +4.83%
512 忽略EOS c1616 / 16
545.821 / 542.401 +0.63%
545.034 / 541.789 +0.60%
512 忽略EOS c3232 / 32
889.323 / 878.410 +1.24%
891.589 / 877.848 +1.57%

输出结束条件

ignore_eos=true时每请求严格生成max_tokens个token,并校验总量等于500 × max_tokens;关闭时生成EOS即停止。

Cold 与 Hot

request-cold不执行warmup;warmup-hot先运行20条与正式集图片、prompt和request ID均不重叠的请求。

结果边界

所有单元使用相同payload、temperature=0和seed 42。差异不足1%的结果标记为基本持平,不外推为稳定优势。

查看完整运行环境与调度口径

GPU为NVIDIA L40S 46,068 MiB;Driver 550.163.01,CUDA 12.9;功耗上限350 W,开启persistence,未锁频。每次运行前确认无其他GPU compute process。

三个并发档位使用完全一致的容器。实际单轮batch不超过min(concurrency, max_num_seqs, 当前已就绪请求数, token/KV budget),因此c8/c16/c32是客户端与服务端容量档位,不是固定batch size。

本轮MIF与vLLM各执行36个fresh-service单元,共72次服务运行;每个单元校验500/500成功及服务日志,没有复用旧artifact。

HISTORY STEADY-STATE BASELINE

历史稳态基准

以下记录保留原有三次运行中位数口径,不与上方单次fresh-service矩阵混排。

TEST 2026-07-19

VisionArena-Bench v0.1 · train[0:500]

500 requests · concurrency 8 · exactly 128 output tokens/request · unlimited arrival rate

硬件
1 × NVIDIA L40S
精度
BF16
榜单口径
稳态3次中位数
验证等级
内部实测
#模型 / 框架版本输出吞吐TTFTITLTPOTE2E运行稳定性结论
01 Qwen2.5-VL-3B · mif0.1.0+git.a8035220 522.042 tok/s 312.054 ms 13.957 ms 12.922 ms 1953.139 ms 500/500 × 3CV 0.258% 与 vLLM 持平
02 Qwen2.5-VL-3B · vLLM0.23.1rc1.dev1130+gfdf2cf66d 521.796 tok/s 334.646 ms 14.243 ms 12.735 ms 1953.977 ms 500/500 × 3CV 0.123% 与 mif 持平
03 Qwen3-VL-8B · mif0.1.0+git.a8035220 273.649 tok/s 362.005 ms 26.608 ms 26.446 ms 3717.142 ms 500/500 × 3CV 0.265% 吞吐领先 1.42%
04 Qwen3-VL-8B · vLLM0.23.1rc1.dev1130+gfdf2cf66d 269.807 tok/s 316.476 ms 27.791 ms 27.164 ms 3764.676 ms 500/500 × 3CV 0.030% 基准对照
Qwen2.5-VL-3B · mif0.1.0+git.a8035220查看完整条件
GPU
1 × NVIDIA L40S
测试场景
Steady state · 20 excluded warmup requests
吞吐范围
521.159–523.805 tok/s
成功率
500/500 × 3
加载后 / 峰值显存
29,865 MiB / 30,105 MiB
KV Cache
12.159 GiB · 22,135 blocks / 354,160 tokens

延迟分位数(p50 / p95 / p99)

  • TTFT289.0 / 551.8 / 834.4 ms
  • ITL10.3 / 20.9 / 102.7 ms
  • TPOT12.4 / 16.2 / 29.1 ms
  • E2E1864.7 / 2357.6 / 4178.1 ms

完整运行时栈对比;mif 使用 PyTorch 2.10.0+cu129 / Transformers 4.57.6。吞吐差异小于双方运行波动范围。

Qwen2.5-VL-3B · vLLM0.23.1rc1.dev1130+gfdf2cf66d查看完整条件
GPU
1 × NVIDIA L40S
测试场景
Steady state · 20 excluded warmup requests
吞吐范围
521.574–522.777 tok/s
成功率
500/500 × 3
加载后 / 峰值显存
38,927 MiB / 38,927 MiB
KV Cache
25.97 GiB · 756,464 tokens

延迟分位数(p50 / p95 / p99)

  • TTFT294.9 / 586.1 / 1129.8 ms
  • ITL10.6 / 21.6 / 101.1 ms
  • TPOT12.3 / 16.2 / 28.0 ms
  • E2E1865.4 / 2436.1 / 4098.9 ms

完整运行时栈对比;vLLM source revision fdf2cf66d,使用 PyTorch 2.11.0+cu129 / Transformers 5.13.1。

Qwen3-VL-8B · mif0.1.0+git.a8035220查看完整条件
GPU
1 × NVIDIA L40S
测试场景
Steady state · 20 excluded warmup requests
吞吐范围
273.250–274.659 tok/s
成功率
500/500 × 3
加载后 / 峰值显存
38,503 MiB / 38,573 MiB
KV Cache
8.697 GiB · 3,958 blocks / 63,328 tokens

延迟分位数(p50 / p95 / p99)

  • TTFT336.7 / 684.2 / 1034.1 ms
  • ITL23.3 / 29.7 / 116.6 ms
  • TPOT25.7 / 30.7 / 53.8 ms
  • E2E3585.8 / 4333.6 / 7465.0 ms

完整运行时栈对比;mif 的平均 TTFT 比 vLLM 高 14.39%,同时 ITL、TPOT 与 E2E 更低。

Qwen3-VL-8B · vLLM0.23.1rc1.dev1130+gfdf2cf66d查看完整条件
GPU
1 × NVIDIA L40S
测试场景
Steady state · 20 excluded warmup requests
吞吐范围
269.713–269.874 tok/s
成功率
500/500 × 3
加载后 / 峰值显存
44,683 MiB / 45,505 MiB
KV Cache
24.02 GiB · 174,864 tokens

延迟分位数(p50 / p95 / p99)

  • TTFT224.7 / 692.7 / 4351.0 ms
  • ITL24.2 / 40.2 / 111.9 ms
  • TPOT26.7 / 30.9 / 33.1 ms
  • E2E3625.8 / 4414.3 / 8042.2 ms

完整运行时栈对比;vLLM source revision fdf2cf66d,使用 PyTorch 2.11.0+cu129 / Transformers 5.13.1。

01

固定测试场景

模型权重、输入输出分布、并发、Warmup、结束条件必须一致。

02

公开测试环境

记录GPU、驱动、CUDA、框架版本、启动参数与原始指标。

03

分级验证

区分内部实测、可复现、社区验证和官方复测,不混淆可信度。