推理性能
本章节提供基于在线服务调用的性能测试结果,以及基于 llama-bench 的离线快速验证命令。本章节的所有测试结果均为在开启性能模式和compute_only模式下获得。
性能测试结果
Qwen3.6-35B-A3B-Q4_K
| concurrency | input_len | output_len | TTFT (ms) | ITL (ms) | TPS(out) |
|---|---|---|---|---|---|
| 1 | 32 | 32.0 | 2984.62 | 48.37 | 20.67 |
| 1 | 128 | 127.5 | 4599.00 | 50.61 | 19.76 |
| 1 | 1024 | 1023.75 | 21381.77 | 53.98 | 18.53 |
| 1 | 3072 | 872.0 | 63574.58 | 70.91 | 13.61 |
| 1 | 8192 | 1024.0 | 202111.53 | 76.09 | 13.14 |
| 1 | 16384 | 1023.5 | 507777.95 | 100.43 | 9.96 |
Qwen3.5-9B-Q4_K
| concurrency | input_len | output_len | TTFT (ms) | ITL (ms) | TPS(out) |
|---|---|---|---|---|---|
| 1 | 32.0 | 32.0 | 2653.57 | 87.43 | 11.44 |
| 1 | 128.0 | 128.0 | 4909.20 | 89.27 | 11.20 |
| 1 | 1024.0 | 1024.0 | 30108.14 | 92.86 | 10.77 |
| 1 | 3072.0 | 896.0 | 87600.66 | 116.42 | 7.87 |
| 1 | 8192.0 | 1024.0 | 252897.72 | 111.63 | 8.96 |
| 1 | 16384.0 | 1024.0 | 581702.43 | 132.05 | 7.57 |
测试前准备
llama.cpp 可使用 llama-bench 进行离线单并发推理性能测试。测试前请确认模型路径正确,并已完成 MUSA 版本编译。
建议测试前清理缓存:
sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"
文本生成快速验证
decode 速度测试
llama-bench -m <model-path> -ngl 999 -fa 1 -p 0 -n 64 -d 64 -r 3 -o json --mmap 0
prefill 速度测试
llama-bench -m <model-path> -ngl 999 -fa 1 -p 1024 -n 0 -r 3 -o json --mmap 0
参数说明
| 参数 | 说明 |
|---|---|
-m <model-path> | 指定 GGUF 模型文件路径。 |
-ngl 999 | 指定 offload 到 GPU 的模型层数。设置为较大值时,尽可能将模型层放到 MUSA GPU 上执行。 |
-fa 1 | 开启 Flash Attention。 |
-p 0 | prompt token 数。decode 测试中设置为 0,用于聚焦 token 生成阶段性能。 |
-p 1024 | prompt token 数。prefill 测试中设置为 1024,用于测试 prompt 处理阶段性能。 |
-n 64 | 生成 token 数。decode 测试中设置为 64。 |
-n 0 | 生成 token 数。prefill 测试中设置为 0,表示不测试 decode 阶段。 |
-d 64 | 指定 llama-bench 的 n-depth 参数。decode 测试中设置为 64。 |
-r 3 | 重复测试次数。 |
-o json | 以 JSON 格式输出测试结果。 |
--mmap 0 | 禁用 mmap 加载模型。 |
输出示例
以Qwen3.5-35B-A3B-Q4_K模型为例
decode 测试输出
MUSA: found 1 device(s)
MUSA: device 0: M1000 (62.0 GB, compute 2.2, shared mem 72 KB)
MUSA: device 0: VMM supported (granularity 4096 bytes)
[
{
"build_commit": "3c7a0aa75",
"build_number": 9171,
"cpu_info": "CPU",
"gpu_info": "M1000",
"backends": "MUSA",
"model_filename": "/home/dev/models/Qwen3.6-35B-A3B-Q4_K.gguf",
"model_type": "qwen35moe 35B.A3B Q4_K - Medium",
"model_size": 19572951552,
"model_n_params": 34660610688,
"n_batch": 2048,
"n_ubatch": 512,
"n_threads": 12,
"cpu_mask": "0x0",
"cpu_strict": false,
"poll": 50,
"type_k": "f16",
"type_v": "f16",
"n_gpu_layers": 999,
"n_cpu_moe": 0,
"split_mode": "layer",
"main_gpu": 0,
"no_kv_offload": false,
"flash_attn": true,
"devices": "auto",
"tensor_split": "0.00",
"tensor_buft_overrides": "none",
"use_mmap": false,
"use_direct_io": false,
"embeddings": false,
"no_op_offload": 0,
"no_host": false,
"fit_target": 0,
"fit_min_ctx": 0,
"n_prompt": 0,
"n_gen": 64,
"n_depth": 64,
"test_time": "2026-06-17T03:01:40Z",
"avg_ns": 3202880822,
"stddev_ns": 30942164,
"avg_ts": 19.983248,
"stddev_ts": 0.191983,
"samples_ns": [ 3238606330, 3185446567, 3184589569 ],
"samples_ts": [ 19.7616, 20.0914, 20.0968 ]
}
]