跳到主要内容

硬件与模型支持

镜像版本列表

vLLM-MUSA 版本服务器镜像源
0.9.2 RC 3Intelsh-harbor.mthreads.com/mcc-ai-serving/vllm-musa-ph1-py310-sets2:4.3.1-fix-ca-reduce
0.9.2 RC 3Hygonsh-harbor.mthreads.com/mcctest/vllm_musa:20251104_hygon

模型权重准备

确保待测模型的权重文件保存在 /data/playground/model 下,如果没有可以,需要通过huggingface或魔塔社区(https://www.modelscope.cn/models)下载权重保存本地。

具体下载方式可参考社区说明文档。

Huggingface参考文档:https://huggingface.co/docs/huggingface_hub/main/en/guides/cli#hf-download

魔塔社区参考文档:https://www.modelscope.cn/docs/models/download

如无法访问 Hugging Face,推荐使用魔塔社区下载模型:

pip install modelscope
python -c "from modelscope import snapshot_download; snapshot_download('<模型名称>')"

以下是vLLM 支持模型列表,供参考:

模型名称Hugging Face 链接
Qwen3-32Bhttps://huggingface.co/Qwen/Qwen3-32B
Qwen3 32B FP8https://huggingface.co/Qwen/Qwen3-32B-FP8
Deepseek R1 Distill Qwen 32Bhttps://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-32B
DeepSeek R1 Distill Qwen 32B FP8 dynamichttps://huggingface.co/RedHatAI/DeepSeek-R1-Distill-Qwen-32B-FP8-dynamic
Llama3.3 70B Instructhttps://huggingface.co/meta-llama/Llama-3.3-70B-Instruct
RedHatAI/Llama-3.3-70B-Instruct-FP8-dynamichttps://huggingface.co/RedHatAI/Llama-3.3-70B-Instruct-FP8-dynamic
Qwen3 8Bhttps://huggingface.co/Qwen/Qwen3-8B
Qwen3 8B FP8https://huggingface.co/Qwen/Qwen3-8B-FP8
ChatGLM2 6Bhttps://huggingface.co/zai-org/chatglm2-6b
QwQ 32Bhttps://huggingface.co/Qwen/QwQ-32B
QwQ 32B FP8 dynamichttps://huggingface.co/RedHatAI/QwQ-32B-FP8-dynamic