帮助(FAQ)
1.启动vLLM服务相关
1.1:使用vllm serve运行服务报错: "MUSA error: invalid argument"
答: 可能安装驱动后没有重启机器,重启即可。
重启过机器仍然有该错误,可能是容器没有挂载gpu,使用-e MTHREADS_VISIBLE_DEVICES=all 指定gpu或者使用特权模式: --net host --privileged --pid=host
1.2:ray端口冲突
答: 清理残留ray进程
或者run.sh中换一个变量RAY_PORT的端口
也需确认运行run.sh脚本的机器 IP 时 hostfile 中第一个ip
1.3:ray报错gpu数量不足
答:
确认一下TP*PP是否等于机器上的GPU数量。
如果GPU数量足够,并执行run.sh后有相关错误,在容器内执行ray status看看gpu数量。如果少于实际数量,还需排查原因。如果多于实际数量,看一下机器是否有其他容器也使用了62262的 ssh 端口导致ray start时统计 GPU 数量错误
1.4:vllm serve启动服务报错显存不足
答: 首先mthreads-gmi确认没有残留进程。
其次参考多机部署-启动服务的vllm serve启动参数说明。
1.5:向vllm服务发送请求时报错: "This model's maximum context length is xxx tokens. However, you requested xxx tokens"
答: 参考多机部署-启动服务的vllm serve启动参数说明。
1.6:resource temporarily unavailable 错误
答: 参考环境配置中的其他环境配置。
1.7:vllm serve报错
答: 没有开启iommu。
编辑 /etc/default/grub,确保
GRUB_CMDLINE_LINUX_DEFAULT="intel_iommu=on iommu.passthrough=0 pci=disable_acs_redir=pci:1000:c030"
sudo update-grub,sudo reboot

