推理性能
模型性能数据
以下数据来自 SGLang-MUSA 0.5.10+20260803 在 M1000 AImodule 端侧环境的实测结果。均在性能模式 + compute_only 环境下测试,数值供参考。
测试环境
- 端设备:M1000 AImodule,64G 统一内存
- 系统版本:V1.4.1
- MUSA 版本:5.1.1
- 服务参数:
max-total-tokens=16384 - 文本测试并发:1
- 文本测试输入 / 输出:无前缀场景为 128/100、250/100、500/100、1000/100、2000/100;带 prefix 场景为 500/100、1000/100、2000/100、4000/100、8000/100、16000/100,其中
PrefillLen=250
测试说明
测试指标说明如下:
Prefill(tps):Prefill 阶段吞吐,单位 token/s。TTFT(ms):首 token 延迟,单位 ms。Decode(tps):Decode 阶段吞吐,单位 token/s。TPOT(ms):单个输出 token 平均耗时,单位 ms。Profile:测试 profile,格式为prefill_len:input_len。Vision(fps):视觉编码帧率,单位 frame/s。Precision:模型量化精度。
性能复现流程
解压得到安装包目录:
tar -zxvf SGLang-MUSA-M1000-M1000_1.4.1_sglang.tar.gz
cd 20260803_M1000_1.4.1_sglang
修改 scripts/ci/musa/tilelang_workflow_config.json 中的模型路径为实际路径,比如:
"model_paths": [
"/home/dev/models/Qwen3-30B-A3B-GPTQ-Int4",
"/home/dev/models/Qwen3.5-35B-A3B-GPTQ-Int4"
]
生成工作流配置并加载环境变量,预编译 TileLang kernel;如果你已经在 快速开始 里执行过这一步,这里可以直接跳过:
scripts/ci/musa/generate_tilelang_workflow.sh
source scripts/ci/musa/setup_env.sh
scripts/ci/musa/precompile_tilelang_kernels.sh
分别启动服务并运行 benchmark。每组测试使用两个终端:启动 端运行服务,运行 benchmark 端执行对应测试。benchmark 通过 MODEL_KEY 选择对应模型配置。
Qwen3-30B-A3B-GPTQ-Int4 (MoE GPTQ,GPTQ INT4 (W4A16))
启动:
scripts/ci/musa/start_qwen3_server.sh
运行 benchmark:
MODEL_KEY=qwen3 scripts/ci/musa/run_tilelang_benchmark.sh
Qwen3.5-35B-A3B-GPTQ-Int4 (MoE GPTQ,GPTQ INT4 (W4A16))
启动:
scripts/ci/musa/start_qwen35_server.sh
运行 benchmark:
MODEL_KEY=qwen35 scripts/ci/musa/run_tilelang_benchmark.sh
Qwen3.5-35B-A3B-GPTQ-Int4 (MoE GPTQ,GPTQ INT4 (W4A16)) 开启 MTP 投机解码
启动:
SGLANG_USE_TL_MOE_GROUPED_GEMM=0 QWEN35_EXTRA_SERVER_ARGS="--speculative-algorithm NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4" scripts/ci/musa/start_qwen35_server.sh
运行 benchmark:
MODEL_KEY=qwen35_mtp scripts/ci/musa/run_tilelang_benchmark.sh
Qwen3.5_FQ-35B-A3B (MoE GPTQ,GPTQ INT4 (W4A16))
启动:
scripts/ci/musa/start_qwen35_fq_server.sh
运行 benchmark:
MODEL_KEY=qwen35_fq scripts/ci/musa/run_tilelang_benchmark.sh
Qwen3.5_FQ-35B-A3B(MoE GPTQ,GPTQ INT4 (W4A16)) 开启 MTP 投机解码
启动:
SGLANG_USE_TL_MOE_GROUPED_GEMM=0 QWEN35_FQ_EXTRA_SERVER_ARGS="--speculative-algorithm NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4" scripts/ci/musa/start_qwen35_fq_server.sh
运行 benchmark:
MODEL_KEY=qwen35_fq_mtp scripts/ci/musa/run_tilelang_benchmark.sh
Qwen3.6_FQ-35B-A3B (MoE GPTQ,GPTQ INT4 (W4A16))
启动:
scripts/ci/musa/start_qwen36_fq_server.sh
运行 benchmark:
MODEL_KEY=qwen36_fq scripts/ci/musa/run_tilelang_benchmark.sh
Qwen3-VL-8B (VLM GPTQ,GPTQ INT4 (W4A16))
启动:
scripts/ci/musa/start_qwen3vl_server.sh
运行 benchmark:
MODEL_KEY=qwen3vl scripts/ci/musa/run_tilelang_benchmark.sh