跳到主要内容

版本发布信息


vLLM-MUSA 0.21

镜像链接

docker pull registry.mthreads.com/presale/devtech/vllm_musa:s4000_4.3.5_d0708

功能特性

  • 引擎升级:核心推理引擎 vLLM 升级至 社区 0.21 版本
  • 模型支持:新增 Qwen3.5,Qwen-VL,GLM 等模型的支持
  • 稳定性优化:解决部分模型启动 server 时 crash 偶发问题,增强稳定性
  • 一键部署:提供 deploy.sh 脚本,支持一键部署 vLLM 模型服务
  • 最佳配置加载:vllmviewer 和 deploy.sh 支持自动加载模型最佳配置,无需手动调参
  • 模板优化:新增 no-thinking chat template,解决 Qwen 系列模型循环输出 /think 的问题
  • 一键压测:提供 query.sh 脚本,支持对已部署模型进行性能基准测试
  • 可视化操作:提供 vLLMViewer 工具,支持通过 Web 界面进行模型部署和测试

历史版本

vLLM-MUSA 0.9.2

功能特性

  • 基于 vLLM 社区版本 0.9.2
  • 适配多种投机采样方案:支持多种投机采样方案,包括Deepseek模型的MTP,Dense模型的Eagle/Eagle3
  • FlashAttention算子能力提升

vLLM-MUSA 0.7.3

功能特性

  • 基于 vLLM 社区版本 0.7.3
  • 支持 DeepSeek V3/R1 BF16 模型,以及 Qwen Dense 系列模型
  • 支持 TP,PP 并行策略,TP 并行支持自定义 AllReduce
  • 新增基于 WMMA 实现路径的 Triton 后端
  • 支持 MUSA C++ Kernel for MLA and MoE;
  • 支持 MUSA Graph,提升推理性能;