龙虾活了!让 OpenClaw 能说能听更能干的妙招
变更记录
| 版本 | 日期 | 变更内容 |
|---|---|---|
| 1.0.0 | 2026-03-19 | 初始版本 |
| 1.0.1 | 2026-04-01 | 将 ASR 模型由 Whisper 更换为效果更好的 FunASR,将 TTS 模型由 Piper TTS 更换为效果更好的 Kokoro。新增 12 个推荐 Skill 的安装步骤及说明。 |
项目简介
本文档以小明与OpenClaw 智能助手的真实交互故事为主线,带你走进一个沉浸式的技能部署之旅。你将亲身经历:
- 如何通过自然语言对话触发 Skills 的自动安装
- 各种 Skills 的实际应用场景
- 从零构建本地 AI 工具链的完整体验
主角介绍:
- 小明:一位热爱探索 AI 技术的用户,喜欢用语音与智能助手进行自然交互
- OpenClaw 智能助手:部署在 MTT AIBOOK 上的 AI 助手,能够根据用户需求自动安装和配置 Skills
难度:中级,适合有编程基础的开发者体验
本文或视频为第三方开源 AI 智能体 OpenClaw 的部署与使用演示教程。根据国家工信部及互联网应急中心预警,该软件存在权限滥用、数据泄露、系统被控等已知风险。请您在充分了解技 术原理、自行评估风险后自行决定是否使用。如因个人部署操作产生任何影响,摩尔线程不为此承担相关责任。
前置条件
硬件要求
| 组件 | 要求 |
|---|---|
| 设备 | MTT AIBOOK 笔记本,型号 A141 |
| 存储空间 | >= 5GB |
| 网络 | 网络环境通畅,可访问互联网 |
软件要求
| 组件 | 要求 |
|---|---|
| 操作系统 | MTT AIBOOK 操作系统 AIOS(1.3.4) |
| Python | 3.10 |
| Node.js | 22.22+ |
| OpenClaw | 最新版本 |
| 飞书 | 已配置消息通道 |
OpenClaw 初始配置
在开始本文档的 Skills 部署之前,需要先完成 OpenClaw 的基础配置:
-
运行 Onboarding 配置:
openclaw onboard -
安装飞书机器人:
# 安装成功后,会自动弹出二维码,使用飞书扫描创建机器人npx -y @larksuite/openclaw-lark-tools install更多配置信息,请参阅 飞书机器人参考文档。
-
(可选)切换默认模型:
本文 Onboarding 过程中选择 Kimi-k2.5 作为默认模型。如需切换模型,使用以下命令:
openclaw config
第一章:语音转录能力 --- FunASR
1.1 功能介绍
FunASR 由阿里达摩院开源的语音识别模型,支持高精度的语音转录。
| 特性 | 说明 |
|---|---|
| 功能 | 将语音转换为文字 |
| 语言支持 | 多语言,中文支持效果极佳 |
| 模型类型 | Paraformer / SenseVoice |
| 运行方式 | 本地运行,无需联网 |
1.2 安装部署
💬 小明:「安装 FunASR 作为语音转录功能应用程序。」
智能助手检测到需求,自动开始安装:
🤖 智能助手:「FunASR 已经安装好了!现在你可以发语音给我,我能识别了。」
安装过程:
- 检测系统环境和 Python 版本
- 安装 FunASR 及相关依赖包
- 下载中文语音识别模型
1.3 功能验证
小明发送了一条语音消息测试:
🤖 智能助手:「语音转录成功!识别到的内容是:"你好,请帮我记录今天的待办事项"」
FunASR 语音转录能力已就绪。
第二章:语音合成能力 --- Kokoro
2.1 功能介绍
Kokoro 是一个轻量级、高质量的本地语音合成引擎。
| 特性 | 说明 |
|---|---|
| 功能 | 将文字转换为语音 |
| 语言支持 | 多语言,中文效果优秀 |
| 模型 | zf_xiaobei(年轻中文女声) |
| 运行方式 | 本地运行,无需联网 |
2.2 安装部署
💬 小明:「部署 Kokoro 作为语音合成应用程序。」
智能助手开始安装:
🤖 智能助手:「Kokoro 部署完成!」
部署状态:
- Kokoro 已安装
- 中文语音模型已下载(zf_xiaobei)
- 语音合成功能正常
模型信息:
- 语言:中文(zh_CN)
- 声音:zf_xiaobei(年轻中文女声)
- 质量:标准(平衡速度和质量)
要试试合成一段语音吗?
2.3 功能验证
💬 小明:「发送生成的音频文件给我,说"养龙虾真好"。」
🤖 智能助手:「语音已生成!但由于飞书 API 限制,无法直接发送音频文件。」
2.4 飞书语音消息闭环
💬 小明:「你想办法帮我搞定。」
🤖 智能助手:「搞定!二维码已发送,扫描即可下载音频文件!」
音频信息:
- 文本:"养龙虾真好"
- 格式:MP3
💬 小明:「让飞书 API 支持语音发送。」
🤖 智能助手:「搞定!飞书语音消息发送工具已配置完成!」
功能:
- 自动将音频转换为 opus 格式(飞书要求)
- 上传音频文件到飞书
- 发送语音消息
语音消息应该已经发送到你的飞书了!检查一下收到了吗?
小明收到了第一条语音消息,语音交互闭环完成。
第三章:图片文字识别能力 --- PaddleOCR
3.1 功能介绍
PaddleOCR 是百度开源的 OCR 工具,支持中英文文字识别。
| 特性 | 说明 |
|---|---|
| 功能 | 识别图片中的文字 |
| 语言支持 | 80+ 语言,中英文效果优秀 |
| 能力 | 文字检测、文字识别、表格识别 |
| 运行方式 | 本地运行,无需联网 |
3.2 安装部署
💬 小明:「安装 PaddleOCR 作为图片识别功能应用程序。」
智能助手开始安装:
🤖 智能助手:「PaddleOCR 需要装一下。我来装...搞定!PaddleOCR 已安装,版本 3.4.0,可以识别图片中的文字。现在你可以发图片给我,我能识别了。」
安装过程:
- 安装 PaddleOCR 及依赖包
- 下载中文识别模型
- 配置 protobuf 版本兼容性
3.3 功能验证
小明发送了一张关于 Agentic AI 组织变革的信息图:

🤖 智能助手:「图片识别成功!这是一张关于 Agentic AI(智能体 AI)组织变革的信息图。」
主要内容:
- 标题:AGENTIC AI: Leaders Guide to Org Chart Evolution
- 副标题:From Silos to Networks: The Next Paradigm for the AI Era
- 对比传统组织与新型智能体组织
- 5 大变革支柱:商业模式、运营模式、治理、人才、技术与数据
需要我详细解释某个部分吗?
PaddleOCR 完美识别了复杂的英文图表信息。
第四章:视觉检测能力 --- YOLO NPU
4.1 功能介绍
YOLO NPU 使用 NPU 加速的 YOLOv8 模型进行目标检测。
| 特性 | 说明 |
|---|---|
| 功能 | 实时物体检测 |
| 加速方式 | NPU 硬件加速 |
| 检测类别 | COCO 80 类(人、车、动物、家具等) |
| 输入方式 | 图片文件 / 摄像头实时拍摄 |
4.2 安装部署
💬 小明:「帮我安装 YOLO NPU Skill,从 https://gitee.com/MooreThreads-AI-SOC/M1000_Developer_Document/tree/master/user_cases/UC_Samples_OpenClaw/skills/yolo-npu 安装。」
🤖 智能助手:「正在从 Gitee 安装 YOLO NPU Skill...安装完成!YOLO NPU Skill 已就绪,支持摄像头拍照和图片检测。要试试吗?」
安装过程:
- 从 Gitee 下载 yolo-npu Skill
- 检测 mtnn 驱动版本(需要 1.4+)
- 创建 conda 环境 npu(python3.10)
- 安装 opencv-python、numpy 和 mtnn_api
- 下载 YOLOv8m 模型(.mtnn 格式)
4.3 实战:识别画面中有几个人
💬 小明:「帮我打开电脑的摄像头,拍张照片,看一下这照片有几个人。请用语音回答我。 」
智能助手执行了完整的流程:
- 调用摄像头拍照
- 使用 YOLO NPU 进行人物检测
- 使用视觉模型分析画面细节
- 使用 Kokoro 合成语音回复
- 发送语音消息
🤖 智能助手(语音):「搞定!照片里有 2 个人,两位都是男性。左边的人面向右侧,右边的人面向左侧。」
4.4 实时检测:看看桌上有什么
💬 小明:「使用笔记本自带 USB 摄像头,抓拍一张图片,识别后的文字和图像结果都发送给我。」
🤖 智能助手:「搞定!」
识别结果:
- 检测到 2 个物体
- 1 个人(置信度 72%)
- 1 把椅子(置信度 70%)
图片和语音都已发送!
第五章:记忆更新
5.1 记住用户偏好
💬 小明:「请记住,FunASR 作为语音转录功能应用程序;用 Kokoro 来做语音合成的功能。我后面飞书交互,都是用语音。」
🤖 智能助手