跳到主要内容

版本发布信息

SGLang-MUSA v0.5.6.post3

镜像链接

# Intel/AMD 平台
registry.mthreads.com/mcconline/inference/sglang:v0.5.6.post3-ph1-4.3.5-torch2.9.0-20260605
# Hygon 平台
registry.mthreads.com/mcconline/inference/sglang:v0.5.6.post3-ph1-4.3.5-torch2.9.0-20260604-hygon

功能特性

  • 深度适配主流开源大模型: 支持 GLM,Kimi,Qwen,DeepSeek 系列模型,并在 PD 分离架构下的性能进行深度优化。

  • PD 分离部署: 支持 Prefill/Decode 节点分离部署,通过 RDMA 实现高效 KV Cache 传输,适用于大规模 MoE 模型的高吞吐场景,支持多种实例配比。

  • 并行策略: 支持张量并行 (TP)、流水线并行 (PP)、专家并行 (EP) 以及数据并行 (DP) Attention。

  • 精度支持: 全面支持 FP8 精度推理,在保证精度的前提下显著降低显存占用。

  • DeepEP MoE 加速: 集成 DeepEP normal/low_latency 模式,支持 EP (Expert Parallelism) + DP Attention 高效分布式推理。

  • FlashAttention 3: attention-backend 与 mm-attention-backend 均采用 FA3,提升 Attention 计算效率。

  • DeepGEMM: MoE Runner 使用 DeepGEMM 后端,优化 MoE 层矩阵运算性能。

  • EAGLE3 投机采样: 部分模型支持 EAGLE3 投机采样,加速解码速度。

  • MUSA Graph 优化: 支持细粒度 MUSA Graph BS 配置,降低 kernel launch 开销。

  • 静态 EPLB (Expert-Level Load Balancing): Prefill/Decode 节点支持静态专家负载均衡。