快速开始
综合来讲,在单机使用时 vLLM-MUSA 与使用官方 vLLM 无明显差异。
启动容器与 API 服务
启动容器:
docker run -it -d \
--privileged \
--net host \
--name=vllm-musa \
-w /workspace \
-v /data:/home/model \
--shm-size=80g \
--env MTHREADS_VISIBLE_DEVICES=all \
registry.mthreads.com/mcconline/vllm-musa-qy2-py310:v0.7.3 \
/bin/bash
用户可以根据需要调整传入参数。例如如果不需要保持容器在后台运行,可以选择不传入 -d 选项。
进入容器:
docker exec -it vllm-musa bash
启动 OpenAI 兼容 API 服务, 以模型文件在主机 /data/DeepSeek-R1-Distill-Llama-70B/ 目录下为例,则经过映射后其在容器内的路径为 /home/model/DeepSeek-R1-Distill-Llama-70B/:
vllm serve /home/model/DeepSeek-R1-Distill-Llama-70B/ \
--gpu-memory-utilization 0.8 \
--served-model-name "DeepSeek-R1-Distill-Llama-70B" \
--max-model-len 8192 \
--trust-remote-code \
-tp 8 \
-pp 1
模型默认会开启 MUSA Graph(类似 CUDA Graph)以获取更好的性能,但相比 eager mode 对 GPU 的显存占用会相对更高,以及启动时间会有所延长。可以通过传入 --enforce-eager 关闭。
更多参数可以在 vLLM 官网找到。
可以再启动一个 shell session 使用 curl 验证服务:
curl http://0.0.0.0:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "DeepSeek-R1-Distill-Llama-70B",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "1+1等于几?"}
]
}'
停止容器:
docker container stop vllm-musa
删除容器:
docker container rm vllm-musa

