跳到主要内容

快速开始

模型下载

可直接使用 GGUF 格式模型,目前支持 Qwen3.5-9B、Qwen3.6-35B-A3B、Qwen3.5-4B 的 Q4_K 量化模型,以及 Qwen3-Embedding-0.6B-f16。具体支持模型见“支持模型列表”章节。

下载模型前建议先安装并初始化 Git LFS:

sudo apt install git-lfs
git lfs install

Qwen3.5-9B-Q4_K.gguf

git clone https://www.modelscope.cn/models/zenbit/Qwen3.5-9B-Q4_K-GGUF.git

Qwen3.6-35B-A3B-Q4_K.gguf

git clone https://www.modelscope.cn/models/zenbit/Qwen3.6-35B-A3B-Q4_K-GGUF.git

mmproj-Qwen3.6-35B-A3B-BF16.gguf

mmproj-Qwen3.6-35B-A3B-BF16.ggufQwen3.6-35B-A3B-Q4_K.gguf 开启多模态时需指定的 ViT 模型。

git clone https://www.modelscope.cn/models/zenbit/mmproj-Qwen3.6-35B-A3B-BF16-GGUF.git

Qwen3.5-4B-Q4_K

git clone https://www.modelscope.cn/zenbit/Qwen3.5-4B-Q4_K_PURE.git

Qwen3-Embedding-0.6B-f16

git clone https://modelscope.cn/models/zenbit/Qwen3-Embedding-0.6B-f16.git

服务启动前准备

建议每次启动服务前先清理缓存:

sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"

服务启动

建议根据模型任务类型选择对应启动命令,不同类型模型不要混用启动方式。

本版本建议使用 MUSA Graph 启动。MUSA Graph 默认开启,如需关闭,在启动时添加环境变量:GGML_MUSA_DISABLE_GRAPHS=1

Prefill Chunk Size 配置

Prefill Chunk Size 对应 llama.cpp 的 --ubatch-size 参数,用于限制 Prefill 阶段单次模型计算处理的最大 token 数。默认值为 512;如需将 Prefill Chunk Size 设置为 1024,可在 llama-server 启动命令中添加 --ubatch-size 1024

文本生成模型

适用于 Qwen、Qwen Instruct 等普通文本生成模型。

llama-server --model <model-path> --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap

启动示例:

llama-server --model /home/dev/models/Qwen3.6-35B-A3B-Q4.gguf --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap

多模态生成模型

适用于 Qwen3.6-35B-A3B-Q4_K 等支持图片输入的多模态模型。

llama-server --model <model-path> --mmproj <mmproj-model-path> --media-path <media-path> --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap

启动示例:

llama-server --model /home/dev/models/Qwen3.6-35B-A3B-Q4.gguf --mmproj /home/dev/models/mmproj-Qwen3.6-35B-A3B-BF16.gguf --media-path /home/jingyi.wang/projects/llama.cpp/tools/mtmd --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap

Embedding 模型

适用于 Qwen3-Embedding 等文本向量模型。启动服务时需要添加 --embeddings,并通过 --alias 指定调用时使用的模型名称。

以下命令以模型文件存放在 /home/dev/llama_embedding_models_20260803/ 为例,请根据实际存放位置修改模型路径。

llama-server \
-m /home/dev/llama_embedding_models_20260803/Qwen3-Embedding-0.6B-f16.gguf \
--alias qwen3-embedding \
--embeddings \
-ngl all \
-fa on \
-np 1 \
--host 0.0.0.0 \
--port 18081

--host 0.0.0.0 表示监听所有网络接口。仅需本机访问时,建议改为 --host 127.0.0.1

参数说明

参数说明
--model <model-path>指定 GGUF 模型文件路径。
--mmproj <mmproj-model-path>指定多模态模型使用的 mmproj 文件路径,仅多模态生成模型需要配置。
--media-path <media-path>指定本地图片、音频等媒体文件的访问目录,仅多模态生成模型需要配置。
--host 127.0.0.1指定服务监听地址。127.0.0.1 表示仅本机可访问。
--port 8000指定服务监听端口。
--ctx-size 32768指定上下文长度。上下文越长,显存占用越高。
-ngl 999指定 offload 到 GPU 的模型层数。设置为较大值时,尽可能将模型层放到 MUSA GPU 上执行。
--cont-batching开启连续批处理,用于提升服务场景下的请求调度效率。
--flash-attn on开启 Flash Attention。
--metrics开启服务端 metrics 接口,便于查看运行指标。
--parallel 1指定并行处理的序列数量。
--ubatch-size 1024指定 Prefill Chunk Size。默认值为 512,设置为 1024 时会增大 Prefill 阶段单次模型计算处理的最大 token 数。
--reasoning off关闭 reasoning parser。
--no-mmap禁用 mmap 方式加载模型,改为直接读入内存。
--alias qwen3-embedding指定模型别名。调用 Embedding 接口时,model 字段需要填写该别名。
--embeddings以 Embedding 模式启动服务,并启用 /v1/embeddings 接口。
-ngl all将全部支持的模型层卸载到 GPU。
-fa on开启 Flash Attention,与 --flash-attn on 等价。
-np 1将并发序列数设置为 1,与 --parallel 1 等价。