Skip to main content

服务调用

接口测试

服务启动后,可以通过模型列表接口检查服务是否正常响应。

curl http://127.0.0.1:8000/v1/models

输出示例:

{
"models": [
{
"name": "Qwen3.6-35B-A3B-Q4.gguf",
"model": "Qwen3.6-35B-A3B-Q4.gguf",
"modified_at": "",
"size": "",
"digest": "",
"type": "model",
"description": "",
"tags": [
""
],
"capabilities": [
"completion",
"multimodal"
],
"parameters": "",
"details": {
"parent_model": "",
"format": "gguf",
"family": "",
"families": [
""
],
"parameter_size": "",
"quantization_level": ""
}
}
],
"object": "list",
"data": [
{
"id": "Qwen3.6-35B-A3B-Q4.gguf",
"aliases": [],
"tags": [],
"object": "model",
"created": 1781495975,
"owned_by": "llamacpp",
"meta": {
"vocab_type": 2,
"n_vocab": 248320,
"n_ctx_train": 262144,
"n_embd": 2048,
"n_params": 34660610688,
"size": 19572951552
}
}
]
}

文本生成模型调用

curl 调用

curl http://127.0.0.1:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen",
"messages": [{"role": "user", "content": "你好,介绍一下北京"}],
"temperature": 0.7,
"max_tokens": 128
}'

参数说明

参数说明
http://127.0.0.1:8000/v1/chat/completionsChat Completions 接口地址,需要与服务启动时的 --host--port 保持一致。
Content-Type: application/json指定请求体格式为 JSON。
model模型名称。llama.cpp 服务端会接收该字段,通常可填写当前服务加载的模型别名或模型名称。
messages对话消息列表。每条消息包含 rolecontent
role消息角色。用户输入使用 user
content用户输入内容。文本生成模型中填写字符串。
temperature采样温度。数值越高,输出随机性越强。
max_tokens本次请求最多生成的 token 数。

多模态图片调用

使用本地图片进行测试

curl http://127.0.0.1:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "请描述这张图片"},
{"type": "image_url", "image_url": {"url": "file://test-1.jpeg"}}
]
}],
"temperature": 0.7,
"max_tokens": 128
}'
参数说明
model模型名称。多模态请求需要服务启动时已加载对应的模型和 mmproj 文件。
messages对话消息列表。多模态请求中,content 使用数组形式传入文本和图片。
role消息角色。用户输入使用 user
content多模态输入内容列表,可以同时包含文本和图片。
type: "text"表示该元素为文本输入。
text文本提示词内容。
type: "image_url"表示该元素为图片输入。
image_url.url图片路径。使用本地图片时填写file:// 路径,例如测试图片在/dev/images/test-1.jpg,服务启动时--media-path设置为/dev/images, 则此处图片路径应设为file://test-1.jpeg
temperature采样温度。数值越高,输出随机性越强。
max_tokens本次请求最多生成的 token 数。