快速开始
模型下载
当前 AIModule 1.4.2 版本基于 vLLM 0.16.0,可直接使用 Hugging Face 或 ModelScope 上的开源模型。对于 GPTQ INT4(W4A16)量化模型,启动服务时需要增加 --quantization gptq 参数。
gptq-Qwen3.6-35B-A3B-4bit-group
apt install git-lfs
git lfs install
git clone https://www.modelscope.cn/potter001/gptq-Qwen3.6-35B-A3B-4bit-group.git
gptq-Qwen3-VL-8B
apt install git-lfs
git lfs install
git clone https://www.modelscope.cn/potter001/gptq-Qwen3-VL-8B-Instruct-4bit-group.git
gptq-Qwen3-8B
apt install git-lfs
git lfs install
git clone https://www.modelscope.cn/hiruyun/gptq-Qwen3-8B.git
Qwen3-30B-A3B-GPTQ-Int4
apt install git-lfs
git lfs install
git clone https://www.modelscope.cn/Qwen/Qwen3-30B-A3B-GPTQ-Int4.git
服务启动前准备
以下命令中的模型路径需要替换为本地实际模型路径。 模型总参数为30B以上的,推荐在64g内存模组下运行。
建议每次启动服务前先配置运行环境并清理缓存:
source /home/dev/miniforge3/etc/profile.d/conda.sh
conda activate v1.4.2
export LD_LIBRARY_PATH="$CONDA_PREFIX/lib:$LD_LIBRARY_PATH"
export TRITON_CACHE_DIR="/tmp/triton"
sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"
服务启动
建议根据模型任务类型选择对应启动命令,不同类型模型不要混用启动方式。
本版本建议使用 MUSA Graph 启动。启动命令中增加以下参数后,会开启 MUSA Graph 图捕获能力:
--compilation-config '{"simple_cuda_graph": true, "cudagraph_capture_sizes": [1]}'
使用 MUSA Graph 时不要再增加 --enforce-eager,否则会强制使用 eager 模式,无法进行图捕获。
文本生成模型
适用于 Qwen、Hunyuan 等普通文本生成模型。将 <MODEL_PATH> 替换为本地实际模型路径即可。
通用启动模板
vllm serve <MODEL_PATH> \
--host 127.0.0.1 \
--port 8000 \
-tp 1 \
--gpu_memory_utilization 0.7 \
--dtype bfloat16 \
--block_size 32 \
--num-gpu-blocks-override 512 \
--max-model-len 16384 \
--max-num-seqs 1 \
--swap_space 0 \
--no-enable-prefix-caching \
--trust-remote-code \
--compilation-config '{"simple_cuda_graph": true, "cudagraph_capture_sizes": [1]}'
GPTQ INT4(W4A16)模型
GPTQ INT4(W4A16)模型通常表示权重为 4 bit、激活为 16 bit。Dense GPTQ 模型在通用模板基础上增加:
--quantization gptq
适用模型示例:
gptq-Qwen3-8Bgptq-Qwen3.5-9B-full-int4-groupgptq-Qwen3.5-4B-full-int4-groupQwen3.6-27B-gptq-v1
Qwen3.6-27B-gptq-v1 是 Dense GPTQ 模型,不属于 MoE 模型,不需要使用下方 MoE 专用的 VLLM_MUSA_ATTN=tilelang 启动方式。
Qwen3-30B-A3B-GPTQ-Int4
Qwen3-30B-A3B-GPTQ-Int4 建议在通用模板基础上使用以下差异项:
VLLM_MUSA_TILELANG_KVREUSE=1 VLLM_MUSA_ATTN=tilelang vllm serve <MODEL_PATH> \
--host 127.0.0.1 \
--port 8000 \
-tp 1 \
--gpu_memory_utilization 0.7 \
--quantization gptq \
--dtype float16 \
--block_size 32 \
--num-gpu-blocks-override 512 \
--max-model-len 16384 \
--max-num-seqs 1 \
--swap_space 0 \
--no-enable-prefix-caching \
--trust-remote-code \
--compilation-config '{"simple_cuda_graph": true, "cudagraph_capture_sizes": [1]}'
gptq-Qwen3.6-35B-A3B-4bit-group
gptq-Qwen3.6-35B-A3B-4bit-group 建议在通用模板基础上使用以下差异项:
VLLM_MUSA_ATTN=tilelang vllm serve <MODEL_PATH> \
--host 127.0.0.1 \
--port 8000 \
-tp 1 \
--gpu_memory_utilization 0.7 \
--quantization gptq \
--dtype bfloat16 \
--block_size 32 \
--num-gpu-blocks-override 512 \
--max-model-len 16384 \
--max-num-seqs 1 \
--swap_space 0 \
--no-enable-prefix-caching \
--trust-remote-code \
--compilation-config '{"simple_cuda_graph": true, "cudagraph_capture_sizes": [1]}'
VLLM_MUSA_ATTN=tilelang 当前仅推荐用于上方已验证的 MoE 量化模型。不要直接加到普通 Dense 文本生成示例中,否则可能出现 KV Cache dtype 不匹配、MUSA Graph 捕获失败或退化执行。
多模态与 OCR 模型
适用于 Qwen3-VL、OCR 等支持图片输入的模型。将 <MODEL_PATH> 替换为本地实际模型路径即可。
通用启动模板
vllm serve <MODEL_PATH> \
--host 127.0.0.1 \
--port 8000 \
-tp 1 \
--gpu_memory_utilization 0.7 \
--dtype bfloat16 \
--block_size 32 \
--num-gpu-blocks-override 512 \
--max-model-len 16384 \
--max-num-seqs 1 \
--swap_space 0 \
--no-enable-prefix-caching \
--trust-remote-code \
--limit-mm-per-prompt '{"image":1}' \
--compilation-config '{"simple_cuda_graph": true, "cudagraph_capture_sizes": [1]}'
Qwen3-VL 8B / 30B-A3B / 32B
gptq-Qwen3-VL-8B-Instruct-4bit-group、gptq-Qwen3-VL-30B-A3B-Instruct-4bit-group 和 gptq-Qwen3-VL-32B-Instruct-4bit-group 在通用模板基础上增加:
--hf-overrides '{"text_config":{"tie_word_embeddings":false}}'
DeepSeek-OCR-2
DeepSeek-OCR-2 在通用模板基础上将上下文长度设置为:
--max-model-len 8192