帮助(FAQ)
- 转换7B模型最后被Killed
内存不够需要增大swap超过16G
# 先把当前所有分区都关闭了
swapoff -a
# 创建要作为 Swap 分区文件
dd if=/dev/zero of=/var/swapfile bs=1G count=16
# 建立 Swap 的文件系统
mkswap /var/swapfile
# 启用 Swap 分区
swapon /var/swapfile
# 查看 Linux 当前分区
free -m
# 清理cache
sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"
- 启动模型出现内存不够
当出现内存不足的问题时,可以尝试以下方法:
降低 --gpu-memory-utilization, 将该值从默认的较高值(如 0.5)降低到较低值(如 0.4 或 0.5)。
减少 --max-model-len,如果模型不需要处理特别长的上下文,可以将该值从默认的较大值(如 4096)降低到较小值(如 2048 或 1024)。
- 运行模型出现较为严重的重复
vllm目前不支持自动加载模型自带的config参数,需要在客户端加一下参数'repetition_penalty':1.05

