跳到主要内容

推理性能

以下数据为 Llama.cpp-MUSA-M1000 0.0.9252 在 AIBook(AIOS 1.5.0、M1000 64G)上的单并发测试结果。测试参数为 Batch=1、Output=50、Ctx=100k、NChip=1,Prefill Chunk Size 以表格记录为准。Prefill(tps)Input / TTFT × 1000 计算,Decode(tps) 对应测试结果中的 TPS。

Prefill Chunk Size 对应 llama.cpp 的 --ubatch-size 参数,即物理 batch size,用于限制单次模型计算处理的最大 token 数。长输入会在 Prefill 阶段按该参数分批处理;该参数会影响 Prefill 性能,因此性能测试结果需同时记录该配置。

Qwen3.5-9B-Q4_K

ModelSizeQuantizationCtx(k)NChipBatchPrefill Chunk SizeInputOutputTTFT(ms)Prefill(tps)Decode(tps)
Qwen3.59BQ4_K10011512128501766.2572.478.26
Qwen3.59BQ4_K100115121k507933.71126.048.16
Qwen3.59BQ4_K100115128k5066847.19119.687.66
Qwen3.59BQ4_K1001151216k50141993.80112.687.35
Qwen3.59BQ4_K1001151232k50345693.5292.576.51

Qwen3.6-35B-A3B-Q4_K

ModelSizeQuantizationCtx(k)NChipBatchPrefill Chunk SizeInputOutputTTFT(ms)Prefill(tps)Decode(tps)
Qwen3.635B-A3BQ4_K100111024128501251.82102.2516.54
Qwen3.635B-A3BQ4_K1001110241k505722.61174.7516.46
Qwen3.635B-A3BQ4_K1001110248k5051447.24155.5015.48
Qwen3.635B-A3BQ4_K10011102416k50116917.50136.8514.97
Qwen3.635B-A3BQ4_K10011102432k50293873.05108.8912.90

Qwen3.5-4B-Q4_K

ModelSizeQuantizationCtx(k)NChipBatchPrefill Chunk SizeInputOutputTTFT(ms)Prefill(tps)Decode(tps)
Qwen3.54BQ4_K10011512128501065.76120.1012.19
Qwen3.54BQ4_K100115121k504784.77209.0011.87
Qwen3.54BQ4_K100115128k5043070.51185.7411.12
Qwen3.54BQ4_K1001151216k5096440.81165.9010.17
Qwen3.54BQ4_K1001151232k50243374.91131.488.73

Qwen3-Embedding-0.6B-f16

Embedding 模型仅测试输入长度 128、1k、8k;其不产生文本输出,Decode(tps) 为测试工具统一输出指标,仅供参考。

ModelSizeQuantizationCtx(k)NChipBatchPrefill Chunk SizeInputOutputTTFT(ms)Prefill(tps)Decode(tps)
Qwen30.6Bf161001151212850180.80707.9621.34
Qwen30.6Bf16100115121k501602.14624.1719.49
Qwen30.6Bf16100115128k5018519.37431.9810.79

测试前准备

llama.cpp 可使用 llama-bench 进行离线单并发推理性能测试。测试前请确认模型路径正确,并已完成 MUSA 版本编译。

建议测试前清理缓存:

sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"

文本生成快速验证

decode 速度测试

llama-bench -m <model-path> -ngl 999 -fa 1 -p 0 -n 64 -d 64 -r 3 -o json --mmap 0

prefill 速度测试

llama-bench -m <model-path> -ngl 999 -fa 1 -p 1024 -n 0 -r 3 -o json --mmap 0

参数说明

参数说明
-m <model-path>指定 GGUF 模型文件路径。
-ngl 999指定 offload 到 GPU 的模型层数。设置为较大值时,尽可能将模型层放到 MUSA GPU 上执行。
-fa 1开启 Flash Attention。
-p 0prompt token 数。decode 测试中设置为 0,用于聚焦 token 生成阶段性能。
-p 1024prompt token 数。prefill 测试中设置为 1024,用于测试 prompt 处理阶段性能。
-n 64生成 token 数。decode 测试中设置为 64
-n 0生成 token 数。prefill 测试中设置为 0,表示不测试 decode 阶段。
-d 64指定 llama-benchn-depth 参数。decode 测试中设置为 64
-r 3重复测试次数。
-o json以 JSON 格式输出测试结果。
--mmap 0禁用 mmap 加载模型。

输出示例

以下输出仅作格式参考,具体数值以实际运行环境为准。

Qwen3.5-4B-Q4_K_PURE模型为例

decode 测试输出

MUSA: found 1 device(s)
MUSA: device 0: M1000 (31.0 GB, compute 2.2, shared mem 72 KB)
MUSA: device 0: VMM supported (granularity 4096 bytes)
[
{
"build_commit": "af51ba0a6",
"build_number": 9252,
"cpu_info": "CPU",
"gpu_info": "M1000",
"backends": "MUSA",
"model_filename": "./Qwen3.5-4B-Q4_K_PURE/Qwen3.5-4B-Q4_K_PURE.gguf",
"model_type": "qwen35 4B Q4_K - Medium",
"model_size": 2369040384,
"model_n_params": 4205751296,
"n_batch": 2048,
"n_ubatch": 512,
"n_threads": 12,
"cpu_mask": "0x0",
"cpu_strict": false,
"poll": 50,
"type_k": "f16",
"type_v": "f16",
"n_gpu_layers": 999,
"n_cpu_moe": 0,
"split_mode": "layer",
"main_gpu": 0,
"no_kv_offload": false,
"flash_attn": true,
"devices": "auto",
"tensor_split": "0.00",
"tensor_buft_overrides": "none",
"use_mmap": false,
"use_direct_io": false,
"embeddings": false,
"no_op_offload": 0,
"no_host": false,
"fit_target": 0,
"fit_min_ctx": 0,
"n_prompt": 0,
"n_gen": 64,
"n_depth": 64,
"test_time": "2026-08-19T12:10:46Z",
"avg_ns": 4216986659,
"stddev_ns": 303263394,
"avg_ts": 15.227344,
"stddev_ts": 1.056228,
"samples_ns": [ 4563154685, 4089667872, 3998137421 ],
"samples_ts": [ 14.0254, 15.6492, 16.0075 ]
}
]

prefill 测试输出

MUSA: found 1 device(s)
MUSA: device 0: M1000 (31.0 GB, compute 2.2, shared mem 72 KB)
MUSA: device 0: VMM supported (granularity 4096 bytes)
[
{
"build_commit": "af51ba0a6",
"build_number": 9252,
"cpu_info": "CPU",
"gpu_info": "M1000",
"backends": "MUSA",
"model_filename": "./Qwen3.5-4B-Q4_K_PURE/Qwen3.5-4B-Q4_K_PURE.gguf",
"model_type": "qwen35 4B Q4_K - Medium",
"model_size": 2369040384,
"model_n_params": 4205751296,
"n_batch": 2048,
"n_ubatch": 512,
"n_threads": 12,
"cpu_mask": "0x0",
"cpu_strict": false,
"poll": 50,
"type_k": "f16",
"type_v": "f16",
"n_gpu_layers": 999,
"n_cpu_moe": 0,
"split_mode": "layer",
"main_gpu": 0,
"no_kv_offload": false,
"flash_attn": true,
"devices": "auto",
"tensor_split": "0.00",
"tensor_buft_overrides": "none",
"use_mmap": false,
"use_direct_io": false,
"embeddings": false,
"no_op_offload": 0,
"no_host": false,
"fit_target": 0,
"fit_min_ctx": 0,
"n_prompt": 1024,
"n_gen": 0,
"n_depth": 0,
"test_time": "2026-08-19T12:11:19Z",
"avg_ns": 2519429067,
"stddev_ns": 2191482,
"avg_ts": 406.441495,
"stddev_ts": 0.353585,
"samples_ns": [ 2520191684, 2521136751, 2516958767 ],
"samples_ts": [ 406.318, 406.166, 406.84 ]
}
]

结果解读

llama-bench 输出中重点关注 samples_ts 字段,该字段记录每次重复测试的 tokens/s 结果。第一次运行可能受到 warmup 影响而偏慢,正式观察性能时建议重点关注第一次之后的数值。

多模态模型快速验证

多模态模型性能测试需要先启动服务,再通过多模态接口访问服务。多模态部分的性能可从服务日志中查看。

服务启动示例:

llama-server --model /home/dev/models/Qwen3.6-35B-A3B-Q4.gguf --mmproj /home/dev/models/mmproj-Qwen3.6-35B-A3B-BF16.gguf --media-path /home/jingyi.wang/projects/llama.cpp/tools/mtmd --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap

访问服务可参考“服务调用”章节的多模态图片调用示例。访问后,服务日志中会输出多模态处理耗时,例如:

srv process_chun: processing image...
encoding image slice...
image slice encoded in 4800 ms
decoding image batch 1/1, n_tokens_batch = 300

其中 image slice encoded in 4800 ms 表示 ViT 编码时间。按单张图片计算,FPS 为 1000 / 4800 = 0.2