Skip to main content

快速开始

模型下载

当前版本升级到 vllm 社区 v0.9.2,可以在 https://huggingface.co/ 直接下载开源模型。对于量化模型,我们提供加速版模型。

Qwen3-30B-A3B GPTQ

apt install git-lfs
git lfs install
git clone https://huggingface.co/Qwen/Qwen3-30B-A3B-GPTQ-Int4

gptq-Qwen3-8B

apt install git-lfs
git lfs install
git clone https://www.modelscope.cn/hiruyun/gptq-Qwen3-8B.git
tip

如果对量化模型有速度要求,需要经过模型转换,模型转换工具后期会开放。

服务启动

warning

注意:以下命令中的模型路径需要替换为本地的模型路径。

Qwen3-30B-A3B-GPTQ-Int4

export TRITON_CACHE_DIR="/tmp/triton" && sudo sh -c "echo 3 > /proc/sys/vm/drop_caches" # 推荐执行前先清楚系统缓存
vllm serve Qwen3-30B-A3B-GPTQ-Int4 -tp 1 --gpu_memory_utilization 0.7 --quantization gptq --max-model-len 16384 --max-num-seqs 1 --swap_space 0 --num-gpu-blocks-override 512 --block_size 32 --enforce-eager
tip
  • --num-gpu-blocks-override 512 --max-model-len 16384 适用场景为单并发16k上下文

gptq-Qwen3-8B

export TRITON_CACHE_DIR="/tmp/triton" && sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"
vllm serve /home/mt/ruyun.li/models/gptq-Qwen3-8B/ -tp 1 --gpu_memory_utilization 0.7 --quantization gptq --num-gpu-blocks-override 512 --max-model-len 16384 --swap_space 0 --block_size 32 --enforce-eager

gptq-Qwen2.5-7B-Instruct

export TRITON_CACHE_DIR="/tmp/triton" && sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"
vllm serve gptq-Qwen2.5-7B-Instruct/ -tp 1 --gpu_memory_utilization 0.7 --quantization gptq --num-gpu-blocks-override 512 --max-model-len 16384 --swap_space 0 --block_size 32 --enforce-eager

参数说明

  • model:模型路径,需要替换为本地实际模型路径。
  • -tp / --tensor-parallel-size:张量并行参数,目前仅支持 1
  • --pipeline-parallel-size:流水线并行参数,当前仅支持默认值 1,一般无需配置。
  • --gpu_memory_utilization:用于预留模型加载和运行所需显存。当前 vLLM-MUSA patch 后,显存不再主要通过该参数严格控制,只需设置到足够模型加载即可。
  • --num-gpu-blocks-override:手动指定 KV Cache 使用的 GPU block 数量,是当前控制 KV Cache 容量的关键参数,若遇oom可尝试减小此值,同时需减小--max-model-len以保证正常启动。
  • --block_size:每个 KV Cache block 可容纳的 token 数,需使用 32
  • --max-model-len:单条请求允许的最大上下文长度,包含输入和输出 token。该值需要满足:
    max-model-len <= num-gpu-blocks-override * block_size / max-num-seqs
  • --max-num-seqs:最大并发序列数,可理解为服务端同时处理的最大请求序列数,默认值为 256。单并发场景建议显式设置为 1
  • --swap_space:CPU swap 空间大小,当前端侧场景建议设置为 0
  • --quantization:量化方式,GPTQ 模型需要设置为 gptq
  • --dtype:模型权重和计算使用的数据类型,支持默认值 autofloat16bfloat16
  • --kv-cache-dtype:KV Cache 使用的数据类型,当前建议保持默认值 auto
  • --enforce-eager:强制使用 eager 模式,不启用 MUSA Graph。