跳到主要内容

快速开始

模型下载

Llama.cpp-MUSA-M1000 版本可直接使用 GGUF 格式模型,目前支持Qwen3.5-9B和Qwen3.5-35B-A3B的Q4_K量化模型。具体支持模型见“支持模型列表”章节。

下载模型前建议先安装并初始化 Git LFS:

sudo apt install git-lfs
git lfs install

Qwen3.5-9B-Q4_K.gguf

git clone https://www.modelscope.cn/models/zenbit/Qwen3.5-9B-Q4_K-GGUF.git

Qwen3.6-35B-A3B-Q4_K.gguf

git clone https://www.modelscope.cn/models/zenbit/Qwen3.6-35B-A3B-Q4_K-GGUF.git

mmproj-Qwen3.6-35B-A3B-BF16.gguf

mmproj-Qwen3.6-35B-A3B-BF16.ggufQwen3.6-35B-A3B-Q4_K.gguf 开启多模态时需指定的 ViT 模型。

git clone https://www.modelscope.cn/models/zenbit/mmproj-Qwen3.6-35B-A3B-BF16-GGUF.git

服务启动前准备

建议每次启动服务前先清理缓存:

sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"

服务启动

建议根据模型任务类型选择对应启动命令,不同类型模型不要混用启动方式。

本版本建议使用 MUSA Graph 启动。MUSA Graph 默认开启,如需关闭,在启动时添加环境变量:GGML_MUSA_DISABLE_GRAPHS=1

文本生成模型

适用于 Qwen、Qwen Instruct 等普通文本生成模型。

llama-server --model <model-path> --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap

启动示例:

llama-server --model /home/dev/models/Qwen3.6-35B-A3B-Q4.gguf --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap

多模态生成模型

适用于 Qwen3.6-35B-A3B-Q4_K 等支持图片输入的多模态模型。

llama-server --model <model-path> --mmproj <mmproj-model-path> --media-path <media-path> --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap

启动示例:

llama-server --model /home/dev/models/Qwen3.6-35B-A3B-Q4.gguf --mmproj /home/dev/models/mmproj-Qwen3.6-35B-A3B-BF16.gguf --media-path /home/jingyi.wang/projects/llama.cpp/tools/mtmd --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap

参数说明

参数说明
--model <model-path>指定 GGUF 模型文件路径。
--mmproj <mmproj-model-path>指定多模态模型使用的 mmproj 文件路径,仅多模态生成模型需要配置。
--media-path <media-path>指定本地图片、音频等媒体文件的访问目录,仅多模态生成模型需要配置。
--host 127.0.0.1指定服务监听地址。127.0.0.1 表示仅本机可访问。
--port 8000指定服务监听端口。
--ctx-size 32768指定上下文长度。上下文越长,显存占用越高。
-ngl 999指定 offload 到 GPU 的模型层数。设置为较大值时,尽可能将模型层放到 MUSA GPU 上执行。
--cont-batching开启连续批处理,用于提升服务场景下的请求调度效率。
--flash-attn on开启 Flash Attention。
--metrics开启服务端 metrics 接口,便于查看运行指标。
--parallel 1指定并行处理的序列数量。
--reasoning off关闭 reasoning parser。
--no-mmap禁用 mmap 方式加载模型,改为直接读入内存。