快速开始
模型下载
当前 AIBook AIOS 1.5.0 系统环境预装 vLLM-MUSA 1.4.2,基于 vLLM 0.16.0,可直接使用 Hugging Face 或 ModelScope 上的开源模型。对于 GPTQ 量化模型,启动服务时需要增加 --quantization gptq 参数。
gptq-Qwen3-8B
apt install git-lfs
git lfs install
git clone https://www.modelscope.cn/hiruyun/gptq-Qwen3-8B.git
gptq-Qwen3.5-9B-full-int4-group
apt install git-lfs
git lfs install
git clone https://www.modelscope.cn/potter001/gptq-Qwen3.5-9B-full-int4-group.git
gptq-Qwen3-VL-8B
apt install git-lfs
git lfs install
git clone https://www.modelscope.cn/potter001/gptq-Qwen3-VL-8B-Instruct-4bit-group.git
服务启动前准备
注意
以下命令中的模型路径需要替换为本地实际模型路径。
启动服务前可选清理系统缓存:
sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"
服务启动
建议根据模型任务类型选择对应启动命令,不同类型模型不要混用启动方式。
本版本建议使用 MUSA Graph 启动。启动命令中增加以下参数后,会开启 MUSA Graph 图捕获能力:
--compilation-config '{"simple_cuda_graph": true, "cudagraph_capture_sizes": [1]}'
提示
使用 MUSA Graph 时不要再增加 --enforce-eager,否则会强制使用 eager 模式,无法进行图捕获。
文本生成模型
适用于 Qwen、Qwen Instruct 等普通文本生成模型。以下以 gptq-Qwen3-8B 为例:
vllm serve /home/dev/models/gptq-Qwen3-8B \
--host 127.0.0.1 \
--port 8000 \
-tp 1 \
--gpu_memory_utilization 0.5 \
--quantization gptq \
--block_size 32 \
--num-gpu-blocks-override 512 \
--max-model-len 16384 \
--max-num-seqs 1 \
--swap_space 0 \
--compilation-config '{"simple_cuda_graph": true, "cudagraph_capture_sizes": [1]}'