快速开始
模型下载
Llama.cpp-MUSA-M1000 0.0.9252 可直接使用 GGUF 格式模型,目前支持 Qwen3.5-9B、Qwen3.6-35B-A3B、Qwen3.5-4B 的 Q4_K 量化模型,以及 Qwen3-Embedding-0.6B-f16。具体支持模型见“支持模型列表”章节。
下载模型前建议先安装并初始化 Git LFS:
sudo apt install git-lfs
git lfs install
Qwen3.5-9B-Q4_K.gguf
git clone https://www.modelscope.cn/models/zenbit/Qwen3.5-9B-Q4_K-GGUF.git
Qwen3.6-35B-A3B-Q4_K.gguf
git clone https://www.modelscope.cn/models/zenbit/Qwen3.6-35B-A3B-Q4_K-GGUF.git
mmproj-Qwen3.6-35B-A3B-BF16.gguf
mmproj-Qwen3.6-35B-A3B-BF16.gguf 为 Qwen3.6-35B-A3B-Q4_K.gguf 开启多模态时需指定的 ViT 模型。
git clone https://www.modelscope.cn/models/zenbit/mmproj-Qwen3.6-35B-A3B-BF16-GGUF.git
Qwen3.5-4B-Q4_K
git clone https://www.modelscope.cn/zenbit/Qwen3.5-4B-Q4_K_PURE.git
Qwen3-Embedding-0.6B-f16
git clone https://modelscope.cn/models/zenbit/Qwen3-Embedding-0.6B-f16.git
服务启动前准备
建议每次启动服务前先清理缓存:
sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"
服务启动
建议根据模型任务类型选择对应启动命令,不同类型模型不要混用启动方式。
本版本建议使用 MUSA Graph 启动。MUSA Graph 默认开启,如需关闭,在启动时添加环境变量:GGML_MUSA_DISABLE_GRAPHS=1。
Prefill Chunk Size 配置
Prefill Chunk Size 对应 llama.cpp 的 --ubatch-size 参数,用于限制 Prefill 阶段单次模型计算处理的最大 token 数。默认值为 512;如需将 Prefill Chunk Size 设置为 1024,可在 llama-server 启动命令中添加 --ubatch-size 1024。
文本生成模型
适用于 Qwen、Qwen Instruct 等普通文本生成模型。
llama-server --model <model-path> --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap
启动示例:
llama-server --model /home/dev/models/Qwen3.6-35B-A3B-Q4.gguf --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap
多模态生成模型
适用于 Qwen3.6-35B-A3B-Q4_K 等支持图片输入的多模态模型。
llama-server --model <model-path> --mmproj <mmproj-model-path> --media-path <media-path> --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap
启动示例:
llama-server --model /home/dev/models/Qwen3.6-35B-A3B-Q4.gguf --mmproj /home/dev/models/mmproj-Qwen3.6-35B-A3B-BF16.gguf --media-path /home/jingyi.wang/projects/llama.cpp/tools/mtmd --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap
Embedding 模型
适用于 Qwen3-Embedding 等文本向量模型。启动服务时需要添加 --embeddings,并通过 --alias 指定调用时使用的模型名称。
以下命令以模型文件存放在 /home/dev/llama_embedding_models_20260803/ 为例,请根据实际存放位置修改模型路径。
llama-server \
-m /home/dev/llama_embedding_models_20260803/Qwen3-Embedding-0.6B-f16.gguf \
--alias qwen3-embedding \
--embeddings \
-ngl all \
-fa on \
-np 1 \
--host 0.0.0.0 \
--port 18081
--host 0.0.0.0 表示监听所有网络接口。仅需本机访问时,建议改为 --host 127.0.0.1。
参数说明
| 参数 | 说明 |
|---|---|
--model <model-path> | 指定 GGUF 模型文件路径。 |
--mmproj <mmproj-model-path> | 指定多模态模型使用的 mmproj 文件路径,仅多模态生成模型需要配置。 |
--media-path <media-path> | 指定本地图片、音频等媒体文件的访问目录,仅多模态生成模型需要配置。 |
--host 127.0.0.1 | 指定服务监听地址。127.0.0.1 表示仅本机可访问。 |
--port 8000 | 指定服务监听端口。 |
--ctx-size 32768 | 指定上下文长度。上下文越长,显存占用越高。 |
-ngl 999 | 指定 offload 到 GPU 的模型层 数。设置为较大值时,尽可能将模型层放到 MUSA GPU 上执行。 |
--cont-batching | 开启连续批处理,用于提升服务场景下的请求调度效率。 |
--flash-attn on | 开启 Flash Attention。 |
--metrics | 开启服务端 metrics 接口,便于查看运行指标。 |
--parallel 1 | 指定并行处理的序列数量。 |
--ubatch-size 1024 | 指定 Prefill Chunk Size。默认值为 512,设置为 1024 时会增大 Prefill 阶段单次模型计算处理的最大 token 数。 |
--reasoning off | 关闭 reasoning parser。 |
--no-mmap | 禁用 mmap 方式加载模型,改为直接读入内存。 |
--alias qwen3-embedding | 指定模型别名。调用 Embedding 接口时,model 字段需要填写该别名。 |
--embeddings | 以 Embedding 模式启动服务,并启用 /v1/embeddings 接口。 |
-ngl all | 将全部支持的模型层卸载到 GPU。 |
-fa on | 开启 Flash Attention,与 --flash-attn on 等价。 |
-np 1 | 将并发序列数设置为 1,与 --parallel 1 等价。 |

