硬件与模型支持
镜像版本列表
| vLLM-MUSA 版本 | 服务器 | 镜像源 |
|---|---|---|
| 0.9.2 RC 3 | Intel | sh-harbor.mthreads.com/mcc-ai-serving/vllm-musa-ph1-py310-sets2:4.3.1-fix-ca-reduce |
| 0.9.2 RC 3 | Hygon | sh-harbor.mthreads.com/mcctest/vllm_musa:20251104_hygon |
模型权重准备
确保待测模型的权重文件保存在 /data/playground/model 下,如果没有可以,需要通过huggingface或魔塔社区(https://www.modelscope.cn/models)下载权重保存本地。
具体下载方式可参考社区说明文档。
Huggingface参考文档:https://huggingface.co/docs/huggingface_hub/main/en/guides/cli#hf-download
魔塔社区参考文档:https://www.modelscope.cn/docs/models/download
如无法访问 Hugging Face,推荐使用魔塔社区下载模型:
pip install modelscope
python -c "from modelscope import snapshot_download; snapshot_download('<模型名称>')"
以下是vLLM 支持模型列表,供参考:
| 模型名称 | Hugging Face 链接 |
|---|---|
| Qwen3-32B | https://huggingface.co/Qwen/Qwen3-32B |
| Qwen3 32B FP8 | https://huggingface.co/Qwen/Qwen3-32B-FP8 |
| Deepseek R1 Distill Qwen 32B | https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-32B |
| DeepSeek R1 Distill Qwen 32B FP8 dynamic | https://huggingface.co/RedHatAI/DeepSeek-R1-Distill-Qwen-32B-FP8-dynamic |
| Llama3.3 70B Instruct | https://huggingface.co/meta-llama/Llama-3.3-70B-Instruct |
| RedHatAI/Llama-3.3-70B-Instruct-FP8-dynamic | https://huggingface.co/RedHatAI/Llama-3.3-70B-Instruct-FP8-dynamic |
| Qwen3 8B | https://huggingface.co/Qwen/Qwen3-8B |
| Qwen3 8B FP8 | https://huggingface.co/Qwen/Qwen3-8B-FP8 |
| ChatGLM2 6B | https://huggingface.co/zai-org/chatglm2-6b |
| QwQ 32B | https://huggingface.co/Qwen/QwQ-32B |
| QwQ 32B FP8 dynamic | https://huggingface.co/RedHatAI/QwQ-32B-FP8-dynamic |

