快速开始
模型下载
AIBook AIOS 1.5.0 系统环境预装 Llama.cpp-MUSA-M1000 0.0.9171,可直接使用 GGUF 格式模型,目前支持 Qwen3.5-9B 和 Qwen3.6-35B-A3B 的 Q4_K 量化模型。具体支持模型见“支持模型列表”章节。
下载模型前建议先安装并初始化 Git LFS:
sudo apt install git-lfs
git lfs install
Qwen3.5-9B-Q4_K.gguf
git clone https://www.modelscope.cn/models/zenbit/Qwen3.5-9B-Q4_K-GGUF.git
Qwen3.6-35B-A3B-Q4_K.gguf
git clone https://www.modelscope.cn/models/zenbit/Qwen3.6-35B-A3B-Q4_K-GGUF.git
mmproj-Qwen3.6-35B-A3B-BF16.gguf
mmproj-Qwen3.6-35B-A3B-BF16.gguf 为 Qwen3.6-35B-A3B-Q4_K.gguf 开启多模态时需指定的 ViT 模型。
git clone https://www.modelscope.cn/models/zenbit/mmproj-Qwen3.6-35B-A3B-BF16-GGUF.git
服务启动前准备
建议每次启动服务前先清理缓存:
sudo sh -c "echo 3 > /proc/sys/vm/drop_caches"
服务启动
建议根据模型任务类型选择对应启动命令,不同类型模型不要混用启动方式。
本版本建议使用 MUSA Graph 启动。MUSA Graph 默认开启,如需关闭,在启动时添加环境变量:GGML_MUSA_DISABLE_GRAPHS=1。
文本生成模型
适用于 Qwen、Qwen Instruct 等普通文本生成模型。
llama-server --model <model-path> --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap
启动示例:
llama-server --model /home/dev/models/Qwen3.6-35B-A3B-Q4.gguf --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap
多模态生成模型
适用于 Qwen3.6-35B-A3B-Q4_K 等支持图片输入的多模态模型。
llama-server --model <model-path> --mmproj <mmproj-model-path> --media-path <media-path> --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap
启动示例:
llama-server --model /home/dev/models/Qwen3.6-35B-A3B-Q4.gguf --mmproj /home/dev/models/mmproj-Qwen3.6-35B-A3B-BF16.gguf --media-path /home/jingyi.wang/projects/llama.cpp/tools/mtmd --host 127.0.0.1 --port 8000 --ctx-size 32768 -ngl 999 --cont-batching --flash-attn on --metrics --parallel 1 --reasoning off --no-mmap
参数说明
| 参数 | 说明 |
|---|---|
--model <model-path> | 指定 GGUF 模型文件路径。 |
--mmproj <mmproj-model-path> | 指定多模态模型使用的 mmproj 文件路径,仅多模态生成模型需要配置。 |
--media-path <media-path> | 指定本地图片、音频等媒体文件的访问目录,仅多模态生成模型需要配置。 |
--host 127.0.0.1 | 指定服务监听地址。127.0.0.1 表示仅本机可访问。 |
--port 8000 | 指定服务监听端口。 |
--ctx-size 32768 | 指定上下文长度。上下文越长,显存占用越高。 |
-ngl 999 | 指定 offload 到 GPU 的模型层数。设置为较大值时,尽可能将模型层放到 MUSA GPU 上执行。 |
--cont-batching | 开启连续批处理,用于提升服务场景下的请求调度效率。 |
--flash-attn on | 开启 Flash Attention。 |
--metrics | 开启服务端 metrics 接口,便于查看运行指标。 |
--parallel 1 | 指定并行处理的序列数量。 |
--reasoning off | 关闭 reasoning parser。 |
--no-mmap | 禁用 mmap 方式加载模型,改为直接读入内存。 |

