服务调用
接口测试
服务启动后,可先检查模型列表:
curl http://localhost:8000/v1/models
输出示例:
{
"object": "list",
"data": [
{
"id": "/home/dev/models/gptq-Qwen3-8B",
"object": "model",
"owned_by": "vllm",
"root": "/home/dev/models/gptq-Qwen3-8B",
"parent": null
}
]
}
warning
以下调用示例中的 model 需要与服务端实际部署的模型路径或 --served-model-name 保持一致。
文本生成模型调用
适用于 Qwen、Qwen Instruct 等通过 /v1/chat/completions 接口调用的文本生成模型。以下以 gptq-Qwen3-8B 为例。
curl 调用
另开一个窗口调用:
curl http://127.0.0.1:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"temperature": 0.7,
"top_p": 0.8,
"max_tokens": 100,
"chat_template_kwargs":{"enable_thinking":false},
"messages": [
{
"role": "user",
"content": "北京有哪些名胜古迹?"
}
]
}'
参数说明
| 参数名 | 作用 | 输入范围(含建议值) |
|---|---|---|
temperature | 控制生成随机性,值越大越发散、越小越确定 | 浮点数 0.0 ~ 2.0(建议:0.1 ~ 1.5) |
top_p | 核采样,只从累积概率达到 top_p 的 token 中采样 | 浮点数 0.0 ~ 1.0(建议:0.7 ~ 0.9) |
max_tokens | 单次响应最大生成 token 数 | 正整数,且不超过模型最大上下文长度 |
chat_template_kwargs | 传递给 chat template 的附加参数 | {"enable_thinking":false} 表示关闭 thinking 输出 |
messages | 对话消息列表 | 按 OpenAI Chat Completions 格式填写 |
多模态图片调用
多模态图片模型启动时需要增加 --limit-mm-per-prompt '{"image":1}'。Qwen3-VL 2B/4B 不需要 --hf-overrides;Qwen3-VL 8B 需要额外增加 --hf-overrides '{"text_config":{"tie_word_embeddings":false}}'。
使用在线图片 URL
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "/home/dev/models/gptq-Qwen3-VL-8B-Instruct-4bit-group",
"max_tokens": 256,
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "请描述这张图片。"},
{
"type": "image_url",
"image_url": {
"url": "https://modelscope.oss-cn-beijing.aliyuncs.com/resource/qwen.png"
}
}
]
}
]
}'