快速开始
模型下载
当前版本升级到 vllm 社区 v0.9.2,可以在 https://huggingface.co/ 直接下载开源模型。对于量化模型,我们提供加速版模型。
Qwen3-30B-A3B GPTQ
apt install git-lfs
git lfs install
git clone https://huggingface.co/Qwen/Qwen3-30B-A3B-GPTQ-Int4
gptq-Qwen3-8B
apt install git-lfs
git lfs install
git clone https://www.modelscope.cn/hiruyun/gptq-Qwen3-8B.git
gptq-Qwen2.5-7B-Instruct
apt install git-lfs
git lfs install
git clone https://www.modelscope.cn/hiruyun/gptq-Qwen2.5-7B-Instruct.git
tip
如果对量化模型有速度要求,需要经过模型转换,模型转换工具后期会开放。
服务启动
warning
注意:以下命令中的模型路径需要替换为本地的模型路径。
Qwen3-30B-A3B-GPTQ-Int4
export TRITON_CACHE_DIR="/tmp/triton" && sudo sh -c "echo 3 > /proc/sys/vm/drop_caches" # 推荐执行前先清楚系统缓存
ENABLE_MUSA_MMA=1 vllm serve Qwen3-30B-A3B-GPTQ-Int4 -tp 1 --gpu_memory_utilization 0.7 --quantization gptq --block_size 32 --num-gpu-blocks-override 512 --max-model-len 16384 --max-num-seqs 1 --swap_space 0
tip
--num-gpu-blocks-override 512 --max-model-len 16384适用场景为单并发16k上下文
gptq-Qwen3-8B
export TRITON_CACHE_DIR="/tmp/triton" && sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"
ENABLE_MUSA_MMA=1 vllm serve /home/mt/ruyun.li/models/gptq-Qwen3-8B/ -tp 1 --gpu_memory_utilization 0.7 --quantization gptq --block_size 32 --num-gpu-blocks-override 512 --max-model-len 16384 --swap_space 0
gptq-Qwen2.5-7B-Instruct
export TRITON_CACHE_DIR="/tmp/triton" && sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"
ENABLE_MUSA_MMA=1 vllm serve gptq-Qwen2.5-7B-Instruct/ -tp 1 --gpu_memory_utilization 0.7 --quantization gptq --block_size 32 --num-gpu-blocks-override 512 --max-model-len 16384 --swap_space 0
参数说明
model:模型路径,需要替换为本地实际模型路径。-tp/--tensor-parallel-size:张量并行参数,目前仅支持1。--pipeline-parallel-size:流水线并行参数,当前仅支持默认值1,一般无需配置。--gpu_memory_utilization:用于预留模型加载和运行所需显存。当前 vLLM-MUSA patch 后,显存不再主要通过该参数严格控制,只需设置到足够模型加载即可。--num-gpu-blocks-override:手动指定 KV Cache 使用的 GPU block 数量,是当前控制 KV Cache 容量的关键参数,若遇oom可尝试减小此值,同时需减小--max-model-len以保证正常启动。--block_size:每个 KV Cache block 可容纳的 token 数,需使用32。--max-model-len:单条请求允许的最大上下文长度,包含输入和输出 token。该值需要满足:max-model-len <= num-gpu-blocks-override * block_size / max-num-seqs--max-num-seqs:最大并发序列数,可理解为服务端同时处理的最大请求序列数,默认值为256。单并发场景建议显式设置为1。--swap_space:CPU swap 空间大小,当前端侧场景建议设置为0。--quantization:量化方式,GPTQ 模型需要设置为gptq。--dtype:模型权重和计算使用的数据类型,支持默认值auto、float16、bfloat16。--kv-cache-dtype:KV Cache 使用的数据类型,当前建议保持默认值auto。

