(可选) 使用 KuaE-Chat 快速体验网页对话
KuaE Chat 是摩尔线程自主开发的简易网页对话体验前端,旨在帮助用户快速完成大模型部署的验证。其集成了包括模型后端一键部署、一键切换、数学公式渲染、深度思考等实用功能。
warning
KuaE Chat 本身不具备模型推理能力,其需要配合对应 OpenAI 兼容格式的推理服务API进行工作。
因为涉及到/tmp/目录等操作,建议开启sudo权限
sudo -s
一键部署
rm -rf /tmp/kuae-chat-public/
mkdir /tmp/kuae-chat-public/
cat > /tmp/kuae-chat-public/models.json <<- EOF
[
{
"model_name": "DeepSeek-R1-Distill-Llama-70B",
"url": "http://10.1.0.133:8000/v1/chat/completions"
}
]
EOF
docker container rm -f kuae-chat
docker run -p 3000:3000 -v /tmp/kuae-chat-public:/app/public/models/ --name=kuae-chat registry.mthreads.com/mcconline/kuae-chat:1.0
将部署的model_name、url对应填入下方命令:
model_name: 对应vllm-serve的--served-model-name参数。如果vllm-serve不传该参数,则使用模型权重所在路径。url:格式为http://{ip}:{port}/v1/chat/completions。IP和port分别对应API服务所在IP和对应vLLM服务端口--port(若未指定,默认8000)。例如以下命令中的10.1.0.133:8000。注意,即使在通一台机器上部署此处也建议填写真实局域网IP地址例如10.1.0.133,而非127.0.0.1以避免因DNS解析导致的服务访问问题。
部署完成后打开浏览器输入服务器所在 URL 的3000端口(例如 http://10.1.0.133:3000 )即可看到对话界面。输入问题后发送即可体验网页对话:

多模型后端切换
KuaE-Chat 支持接入多个模型后端。网页应用通过读取容器内 /app/public/models/ 路径下 models.json 内的配置内容获取后端列表。
因为上面我们把该路径映射到 /tmp/kuae-chat-public/ 中,用户只需要修改 /tmp/kuae-chat-public/models.json 中的内容,即可修改对应配置。例如修改成以下样例后保存:
/tmp/kuae-chat-public/models.json
[
{
"model_name": "DeepSeek-R1-Distill-Llama-70B",
"url": "http://10.1.0.133:8000/v1/chat/completions"
},
{
"model_name": "QwQ-32B",
"url": "http://10.1.0.133:9000/v1/chat/completions"
}
]
刷新页面后,前端会自动重载配置文件,可以看到更新后的模型列表。点击切换到 想要使用的模型即可开始使用:


