一、节点基础概念
1.1 什么是节点
节点是远程硬件设备,通过网络接入 OpenClaw Gateway,让云端智能体联动物理设备,实现视听、语音、定位、外设控制,打通软件与硬件。
架构示意:
plaintext
硬件节点(手机/树莓派/摄像头) <--网络--> OpenClaw Gateway(服务端)
1.2 主流节点类型与适用设备
表格
| 节点类型 | 核心能力 | 典型硬件 |
|---|---|---|
| 移动节点 | 摄像头、麦克风、GPS 定位、推送 | Android /iOS 手机 |
| 音频节点 | 录音、播放、语音转文字 (STT)、文字转语音 (TTS) | 树莓派、USB 麦克风 + 音箱 |
| 摄像头节点 | 拍照、短视频、视频流、图像识别 | USB 摄像头、网络 IP 摄像头 |
| 通用硬件节点 | 自定义传感器、继电器、外设控制 | Arduino、ESP32、单片机 |
二、移动节点部署(手机端,入门首选)
手机是一体化全功能节点,无需额外接线,快速上手。
2.1 Android 手机配置
- 安装客户端 从项目 Releases 下载 OpenClaw 安卓 APK,安装到手机。
- 填写连接信息 打开 APP,填写网关地址与密钥: plaintext
Gateway URL: http://你的服务器IP:18789 Token: 你的网关访问令牌 - 授权权限 依次允许:摄像头、麦克风、位置、通知权限。
- 建立连接 点击「连接」,连接成功后手机自动注册为网关节点。
2.2 iOS 手机配置
- 通过 TestFlight / 应用商店安装对应客户端;
- 填写网关地址、Token,授权权限后连接;
限制说明:iOS 系统后台权限严格,后台常驻录音、持续监听会受限,建议前台运行使用。
2.3 移动节点可用能力
连接完成后,可直接在对话中下发指令:
- 拍照 / 视频:
拍一张当前环境照片 - 录音:
录制10秒环境声音 - 定位:
查看我当前的位置
三、音频节点配置(录音 / 播音 / 语音交互)
负责收音、放音、语音转文字、文字转语音,搭配树莓派、PC、外置麦克风音箱均可使用。
3.1 基础配置(openclaw.json)
json
{
"nodes": {
"audio": {
"enabled": true,
"inputDevice": "default",
"outputDevice": "default",
"sampleRate": 16000,
"tts": {
"provider": "edge-tts",
"voice": "zh-CN-XiaoxiaoNeural"
}
}
}
}
3.2 TTS 语音引擎与音色
表格
| 引擎 | 特点 | 费用 |
|---|---|---|
| edge-tts(推荐) | 中文音色自然、延迟低 | 完全免费 |
| openai-tts | 音色丰富 | 按调用计费 |
| local | 系统本地语音 | 免费 |
常用中文音色
- 女声标准:
zh-CN-XiaoxiaoNeural - 男声标准:
zh-CN-YunxiNeural - 活泼女声:
zh-CN-XiaoyiNeural
3.3 音频节点功能清单
audio_record:麦克风录音audio_play:播放音频文件stt:语音转文字tts:文字转语音播报
四、摄像头节点配置(拍照 / 视频 / 图像理解)
分为本地 USB 摄像头、网络 IP 摄像头,支持拍照、录视频、图片内容识别。
4.1 基础配置
json
{
"nodes": {
"camera": {
"enabled": true,
"device": "/dev/video0",
"resolution": "1280x720"
}
}
}
- Linux / 树莓派:设备路径一般为
/dev/video0 - Windows:自动识别摄像头设备,无需填写路径
4.2 图像理解(视觉分析)
依托大模型实现识图、读文字、场景描述、物体识别,需启用视觉模型。
json
{
"mediaUnderstanding": {
"enabled": true,
"model": "gpt-4o",
"maxImageSize": "1024x1024"
}
}
使用流程:摄像头拍照 → 图片上传视觉模型 → 分析结果返回
典型场景:识别物品、读取文档文字、描述环境、异常检测。
五、语音唤醒(免手动激活)
类似语音助手,说出唤醒词即可激活交互,依赖音频节点麦克风持续监听。
5.1 配置示例
json
{
"voicewake": {
"enabled": true,
"wakeWord": "小龙虾",
"sensitivity": 0.5,
"audioNode": "default"
}
}
参数说明:
wakeWord:自定义唤醒词,支持中文 / 英文sensitivity:灵敏度 0~1,数值越高越容易触发audioNode:绑定使用的音频节点
5.2 运行流程
持续监听麦克风 → 识别到唤醒词 → 启动录音 → 语音转文字 → 智能体处理 → TTS 语音回复
提示:持续监听麦克风会增加设备功耗,移动设备建议按需开关。
六、Talk 实时语音对话模式
全双工语音交互,全程语音问答,无需手动点击,适合长时间语音聊天。
6.1 完整配置
json
{
"talk": {
"enabled": true,
"stt": {
"provider": "whisper",
"model": "whisper-1"
},
"tts": {
"provider": "edge-tts",
"voice": "zh-CN-XiaoxiaoNeural"
},
"vadSensitivity": 0.6
}
}
vadSensitivity:语音活动检测灵敏度,自动判断说话起止。
6.2 语音唤醒 vs Talk 模式
表格
| 模式 | 激活方式 | 交互形式 | 资源消耗 | 适用场景 |
|---|---|---|---|---|
| 语音唤醒 | 唤醒词触发 | 单次问答 | 低 | 偶尔下发语音指令 |
| Talk 模式 | 手动开启 | 连续对话 | 高 | 长时间语音聊天 |
七、GPS 定位功能(位置获取)
依托移动设备 GPS,获取实时地理位置,支持定时刷新位置。
7.1 配置
json
{
"nodes": {
"location": {
"enabled": true,
"updateInterval": 300
}
}
}
updateInterval:位置刷新间隔,单位秒,默认 300 秒(5 分钟)
7.2 使用场景
查询当前位置、基于位置推荐周边服务、位置状态播报。
八、硬件组合方案(从入门到进阶)
8.1 入门方案(零额外硬件)
闲置安卓 / 苹果手机
- 优势:即装即用,集成摄像头 + 麦克风 + GPS,无需接线
- 用途:日常拍照、语音指令、定位、移动监控
8.2 进阶方案(树莓派 + 外设,固定点位)
plaintext
树莓派4B
├─ USB麦克风阵列(语音唤醒、收音)
├─ 有源音箱(TTS语音播报)
└─ USB摄像头(监控、拍照)
- 适用:居家固定监控、全屋语音助手、桌面语音交互
8.3 企业 / 全屋多节点方案
plaintext
Gateway 服务端
├─ 门口节点:独立摄像头(门禁监控)
├─ 客厅节点:树莓派+音视频(语音助手)
├─ 卧室节点:手机(移动语音/定位)
└─ 办公区节点:电脑客户端(文字+语音)
九、常见问题排查
9.1 节点频繁断开
- 检查网关
18789端口是否放行、防火墙规则; - 确认设备与网关在同一网络,公网访问检查端口映射;
- 查看日志: bash运行
openclaw gateway status openclaw logs | grep node
9.2 摄像头拍照模糊 / 黑屏
- 核对配置里的
分辨率与设备匹配; - 检查摄像头物理连接、光线环境;
- Linux 确认设备路径
/dev/video0正确。
9.3 语音识别准确率低
- 更换降噪麦克风,减少环境噪音;
- 优先使用
whisper作为 STT 引擎; - 调整麦克风音量与 VAD 灵敏度。
9.4 语音唤醒不触发
- 确认音频节点正常工作,麦克风可正常收音;
- 适当调高
sensitivity灵敏度; - 缩短唤醒词,避免生僻词汇。
十、总结
- 节点系统是 OpenClaw 软硬结合的核心,让 AI 脱离纯文本交互,控制物理硬件;
- 手机是最简单的一体化移动节点,零基础可快速落地;
- 音频、摄像头、定位、语音唤醒、Talk 模式可按需组合配置;
- 树莓派 + 外设适合搭建固定场景的语音 / 监控节点;
- 多节点组网可实现全屋、多区域智能化联动,拓展能力上限。