Kimi 模型部署
Kimi-K2.5/2.6 模型部 署
本章节以 Kimi-K2.5-FP8 部署为例,采取的是最小部署方案 3P4D,即3台机器作为Prefill,4台机器为Decode。支持64K及以上长输入,需增加 Decode 机器数。注意 384(expert数)需要能被 Decode 机器数整除。该部署方式同样适用于 Kimi-K2.6。
- 脚本涉及的参数说明和一键运行说明见 快速开始。
- 如果需要修改部署方式,请更新
run.sh中PREFILL_SERVER_COUNT和DECODE_SERVER_COUNT。 - DeepEP 的配置文件内容参考 DeepEP 配置文件
- 如要开启投机采样,建议使用 4P6D 部署方案,参考
/sgl-workspace/kimi-scripts目录下的decode_server_mtp.sh和run_mtp.sh脚本。
信息
启动 SGLang 服务前需要切换python虚拟环境,执行命令:workon kimi