MIF 在36个配对单元中有30个吞吐数值更高。
BENCHMARK OPEN PERFORMANCE DATA
性能榜单
不做脱离环境的总分。只有模型、GPU、精度、负载和软件版本一致的结果才进行直接比较。
NEW FRESH-SERVICE MATRIX
MIF 与 vLLM 0.25.1:Qwen3-VL-8B 单卡吞吐
相同的500条自然多模态请求,在18组负载条件下分别执行 request-cold 与 warmup-hot;每格均为本轮一次全新服务运行。
低并发档位的领先在全部输出长度与EOS设置中一致出现。
多数差异不足1%;单次运行不用于判断微小差异的稳定性。
- 模型
- Qwen3-VL-8B-Instruct
- 硬件
- 1 × NVIDIA L40S · BF16
- 请求集
- vision-arena-bench-v0.1 · train[0:500]
- 请求方式
- unlimited arrival rate · 500/500成功
- MIF
ccedb0dc·aigcengine-profile:trt-20260527- vLLM
- 0.25.1 ·
752a3a504485790a2e8491cacbb35c137339ad34 - vLLM镜像
vllm/vllm-openai:v0.25.1- Payload SHA-256
cf8e985584af4d6912e95ab325818f4762e48ed239262651f9219190d61c99dd
每格:MIF / vLLM(MIF相对差异),单位为 output tok/s。
c8/c16/c32:客户端 concurrency 与服务端 max_num_seqs 同时设为8/16/32;continuous batching 的实际逐轮 batch 动态变化。
| max tokens | EOS | 并发档位 | request-cold | warmup-hot |
|---|---|---|---|---|
| 128 | EOS停止 | c88 / 8 |
284.558 / 268.650
+5.92%
|
283.091 / 268.677
+5.36%
|
| 128 | EOS停止 | c1616 / 16 |
437.622 / 438.199
-0.13%
|
438.585 / 436.410
+0.50%
|
| 128 | EOS停止 | c3232 / 32 |
626.101 / 628.488
-0.38%
|
627.466 / 626.142
+0.21%
|
| 128 | 忽略EOS | c88 / 8 |
287.765 / 268.857
+7.03%
|
287.634 / 268.723
+7.04%
|
| 128 | 忽略EOS | c1616 / 16 |
437.566 / 439.930
-0.54%
|
438.772 / 439.235
-0.11%
|
| 128 | 忽略EOS | c3232 / 32 |
638.359 / 641.824
-0.54%
|
645.520 / 638.590
+1.09%
|
| 256 | EOS停止 | c88 / 8 |
310.934 / 292.291
+6.38%
|
310.307 / 292.550
+6.07%
|
| 256 | EOS停止 | c1616 / 16 |
502.202 / 502.745
-0.11%
|
502.646 / 501.789
+0.17%
|
| 256 | EOS停止 | c3232 / 32 |
761.811 / 761.246
+0.07%
|
763.477 / 762.964
+0.07%
|
| 256 | 忽略EOS | c88 / 8 |
315.206 / 294.656
+6.97%
|
315.267 / 293.816
+7.30%
|
| 256 | 忽略EOS | c1616 / 16 |
507.933 / 505.912
+0.40%
|
507.424 / 505.631
+0.35%
|
| 256 | 忽略EOS | c3232 / 32 |
796.694 / 790.524
+0.78%
|
798.412 / 787.682
+1.36%
|
| 512 | EOS停止 | c88 / 8 |
321.855 / 300.656
+7.05%
|
321.811 / 300.554
+7.07%
|
| 512 | EOS停止 | c1616 / 16 |
529.975 / 528.653
+0.25%
|
529.895 / 528.091
+0.34%
|
| 512 | EOS停止 | c3232 / 32 |
831.708 / 827.197
+0.55%
|
833.623 / 824.139
+1.15%
|
| 512 | 忽略EOS | c88 / 8 |
322.434 / 306.516
+5.19%
|
321.394 / 306.580
+4.83%
|
| 512 | 忽略EOS | c1616 / 16 |
545.821 / 542.401
+0.63%
|
545.034 / 541.789
+0.60%
|
| 512 | 忽略EOS | c3232 / 32 |
889.323 / 878.410
+1.24%
|
891.589 / 877.848
+1.57%
|
输出结束条件
ignore_eos=true时每请求严格生成max_tokens个token,并校验总量等于500 × max_tokens;关闭时生成EOS即停止。
Cold 与 Hot
request-cold不执行warmup;warmup-hot先运行20条与正式集图片、prompt和request ID均不重叠的请求。
结果边界
所有单元使用相同payload、temperature=0和seed 42。差异不足1%的结果标记为基本持平,不外推为稳定优势。
查看完整运行环境与调度口径
GPU为NVIDIA L40S 46,068 MiB;Driver 550.163.01,CUDA 12.9;功耗上限350 W,开启persistence,未锁频。每次运行前确认无其他GPU compute process。
三个并发档位使用完全一致的容器。实际单轮batch不超过min(concurrency, max_num_seqs, 当前已就绪请求数, token/KV budget),因此c8/c16/c32是客户端与服务端容量档位,不是固定batch size。
本轮MIF与vLLM各执行36个fresh-service单元,共72次服务运行;每个单元校验500/500成功及服务日志,没有复用旧artifact。
HISTORY STEADY-STATE BASELINE
历史稳态基准
以下记录保留原有三次运行中位数口径,不与上方单次fresh-service矩阵混排。
TEST 2026-07-19
VisionArena-Bench v0.1 · train[0:500]
500 requests · concurrency 8 · exactly 128 output tokens/request · unlimited arrival rate
- 硬件
- 1 × NVIDIA L40S
- 精度
- BF16
- 榜单口径
- 稳态3次中位数
- 验证等级
- 内部实测
| # | 模型 / 框架版本 | 输出吞吐 | TTFT | ITL | TPOT | E2E | 运行稳定性 | 结论 |
|---|---|---|---|---|---|---|---|---|
| 01 | Qwen2.5-VL-3B · mif0.1.0+git.a8035220 | 522.042 tok/s | 312.054 ms | 13.957 ms | 12.922 ms | 1953.139 ms | 500/500 × 3CV 0.258% | 与 vLLM 持平 |
| 02 | Qwen2.5-VL-3B · vLLM0.23.1rc1.dev1130+gfdf2cf66d | 521.796 tok/s | 334.646 ms | 14.243 ms | 12.735 ms | 1953.977 ms | 500/500 × 3CV 0.123% | 与 mif 持平 |
| 03 | Qwen3-VL-8B · mif0.1.0+git.a8035220 | 273.649 tok/s | 362.005 ms | 26.608 ms | 26.446 ms | 3717.142 ms | 500/500 × 3CV 0.265% | 吞吐领先 1.42% |
| 04 | Qwen3-VL-8B · vLLM0.23.1rc1.dev1130+gfdf2cf66d | 269.807 tok/s | 316.476 ms | 27.791 ms | 27.164 ms | 3764.676 ms | 500/500 × 3CV 0.030% | 基准对照 |
Qwen2.5-VL-3B · mif0.1.0+git.a8035220查看完整条件
- GPU
- 1 × NVIDIA L40S
- 测试场景
- Steady state · 20 excluded warmup requests
- 吞吐范围
- 521.159–523.805 tok/s
- 成功率
- 500/500 × 3
- 加载后 / 峰值显存
- 29,865 MiB / 30,105 MiB
- KV Cache
- 12.159 GiB · 22,135 blocks / 354,160 tokens
延迟分位数(p50 / p95 / p99)
- TTFT
289.0 / 551.8 / 834.4 ms - ITL
10.3 / 20.9 / 102.7 ms - TPOT
12.4 / 16.2 / 29.1 ms - E2E
1864.7 / 2357.6 / 4178.1 ms
完整运行时栈对比;mif 使用 PyTorch 2.10.0+cu129 / Transformers 4.57.6。吞吐差异小于双方运行波动范围。
Qwen2.5-VL-3B · vLLM0.23.1rc1.dev1130+gfdf2cf66d查看完整条件
- GPU
- 1 × NVIDIA L40S
- 测试场景
- Steady state · 20 excluded warmup requests
- 吞吐范围
- 521.574–522.777 tok/s
- 成功率
- 500/500 × 3
- 加载后 / 峰值显存
- 38,927 MiB / 38,927 MiB
- KV Cache
- 25.97 GiB · 756,464 tokens
延迟分位数(p50 / p95 / p99)
- TTFT
294.9 / 586.1 / 1129.8 ms - ITL
10.6 / 21.6 / 101.1 ms - TPOT
12.3 / 16.2 / 28.0 ms - E2E
1865.4 / 2436.1 / 4098.9 ms
完整运行时栈对比;vLLM source revision fdf2cf66d,使用 PyTorch 2.11.0+cu129 / Transformers 5.13.1。
Qwen3-VL-8B · mif0.1.0+git.a8035220查看完整条件
- GPU
- 1 × NVIDIA L40S
- 测试场景
- Steady state · 20 excluded warmup requests
- 吞吐范围
- 273.250–274.659 tok/s
- 成功率
- 500/500 × 3
- 加载后 / 峰值显存
- 38,503 MiB / 38,573 MiB
- KV Cache
- 8.697 GiB · 3,958 blocks / 63,328 tokens
延迟分位数(p50 / p95 / p99)
- TTFT
336.7 / 684.2 / 1034.1 ms - ITL
23.3 / 29.7 / 116.6 ms - TPOT
25.7 / 30.7 / 53.8 ms - E2E
3585.8 / 4333.6 / 7465.0 ms
完整运行时栈对比;mif 的平均 TTFT 比 vLLM 高 14.39%,同时 ITL、TPOT 与 E2E 更低。
Qwen3-VL-8B · vLLM0.23.1rc1.dev1130+gfdf2cf66d查看完整条件
- GPU
- 1 × NVIDIA L40S
- 测试场景
- Steady state · 20 excluded warmup requests
- 吞吐范围
- 269.713–269.874 tok/s
- 成功率
- 500/500 × 3
- 加载后 / 峰值显存
- 44,683 MiB / 45,505 MiB
- KV Cache
- 24.02 GiB · 174,864 tokens
延迟分位数(p50 / p95 / p99)
- TTFT
224.7 / 692.7 / 4351.0 ms - ITL
24.2 / 40.2 / 111.9 ms - TPOT
26.7 / 30.9 / 33.1 ms - E2E
3625.8 / 4414.3 / 8042.2 ms
完整运行时栈对比;vLLM source revision fdf2cf66d,使用 PyTorch 2.11.0+cu129 / Transformers 5.13.1。
固定测试场景
模型权重、输入输出分布、并发、Warmup、结束条件必须一致。
公开测试环境
记录GPU、驱动、CUDA、框架版本、启动参数与原始指标。
分级验证
区分内部实测、可复现、社区验证和官方复测,不混淆可信度。