版本发布信息
SGLang-MUSA v0.5.6.post3
镜像链接
# Intel/AMD 平台
registry.mthreads.com/mcconline/inference/sglang:v0.5.6.post3-ph1-4.3.5-torch2.9.0-20260605
# Hygon 平台
registry.mthreads.com/mcconline/inference/sglang:v0.5.6.post3-ph1-4.3.5-torch2.9.0-20260604-hygon
功能特性
-
深度适配主流开源大模型: 支持 GLM,Kimi,Qwen,DeepSeek 系列模型,并在 PD 分离架构下的性能进行深度优化。
-
PD 分离部署: 支持 Prefill/Decode 节点分离部署,通过 RDMA 实现高效 KV Cache 传输,适用于大规模 MoE 模型的高吞吐场景,支持多种实例配比。
-
并行策略: 支持张量并行 (TP)、流水线并行 (PP)、专家并行 (EP) 以及数据并行 (DP) Attention。
-
精度支持: 全面支持 FP8 精度推理,在保证精度的前提下显著降低显存占用。
-
DeepEP MoE 加速: 集 成 DeepEP normal/low_latency 模式,支持 EP (Expert Parallelism) + DP Attention 高效分布式推理。
-
FlashAttention 3: attention-backend 与 mm-attention-backend 均采用 FA3,提升 Attention 计算效率。
-
DeepGEMM: MoE Runner 使用 DeepGEMM 后端,优化 MoE 层矩阵运算性能。
-
EAGLE3 投机采样: 部分模型支持 EAGLE3 投机采样,加速解码速度。
-
MUSA Graph 优化: 支持细粒度 MUSA Graph BS 配置,降低 kernel launch 开销。
-
静态 EPLB (Expert-Level Load Balancing): Prefill/Decode 节点支持静态专家负载均衡。

