Qwen3 Dense 模型部署
本章节包含 Qwen3 Dense 系列模型的部署脚本,脚本涉及的参数说明、PD 分离一键部署说明见 快速开始。
info
启动 SGLang 服务前需要切换python虚拟环境到sglang-0.5.6,执行命令:workon sglang-0.5.6 或 source ~/.virtualenvs/sglang-0.5.6/bin/activate
Qwen3-8B
单卡启动脚本 qwen3_8b_server.sh
#!/bin/bash
source ~/.virtualenvs/sglang-0.5.6/bin/activate
export MCCL_SOCKET_IFNAME=bond0
export SGLANG_ENABLE_SPEC_V2=1
export MATE_FORCE_JIT=1
MODEL_PATH=/data/models/Qwen3-8B-FP8
SPEC_MODEL_PATH=/data/models/Qwen3-8B_eagle3
python3 -m sglang.launch_server \
--model-path $MODEL_PATH \
--served-model-name qwen3-8b-fp8 \
--mem-fraction-static 0.9 \
--cuda-graph-bs $(seq 1 64) \
--host 0.0.0.0 \
--port 20133 \
--attention-backend fa3 \
--tp-size 1 \
--max-running-requests 256 \
--sampling-backend flashinfer \
--speculative-draft-model-path $SPEC_MODEL_PATH \
--speculative-algorithm EAGLE3 \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4 \
--disable-radix-cache \
--chunked-prefill-size 8192
Qwen3-14B
单卡启动脚本 qwen3_14b_server.sh
#!/bin/bash
source ~/.virtualenvs/sglang-0.5.6/bin/activate
export SGLANG_ENABLE_SPEC_V2=1
export MATE_FORCE_JIT=1
MODEL_PATH=/data/models/Qwen3-14B-FP8
python3 -m sglang.launch_server \
--model-path $MODEL_PATH \
--served-model-name qwen3-14b-fp8 \
--mem-fraction-static 0.9 \
--cuda-graph-bs $(seq 1 64) \
--host 0.0.0.0 \
--port 20133 \
--attention-backend fa3 \
--tp-size 1 \
--max-running-requests 256 \
--sampling-backend flashinfer \
--disable-radix-cache \
--chunked-prefill-size 8192
Qwen3-32B
Qwen3-32B 可以使用单机4卡混合部署,也可以在1台机器内做PD分离部署。