一、节点基础概念

1.1 什么是节点

节点是远程硬件设备,通过网络接入 OpenClaw Gateway,让云端智能体联动物理设备,实现视听、语音、定位、外设控制,打通软件与硬件。

架构示意:

plaintext

硬件节点(手机/树莓派/摄像头) <--网络--> OpenClaw Gateway(服务端)

1.2 主流节点类型与适用设备

表格

节点类型核心能力典型硬件
移动节点摄像头、麦克风、GPS 定位、推送Android /iOS 手机
音频节点录音、播放、语音转文字 (STT)、文字转语音 (TTS)树莓派、USB 麦克风 + 音箱
摄像头节点拍照、短视频、视频流、图像识别USB 摄像头、网络 IP 摄像头
通用硬件节点自定义传感器、继电器、外设控制Arduino、ESP32、单片机

二、移动节点部署(手机端,入门首选)

手机是一体化全功能节点,无需额外接线,快速上手。

2.1 Android 手机配置

  1. 安装客户端 从项目 Releases 下载 OpenClaw 安卓 APK,安装到手机。
  2. 填写连接信息 打开 APP,填写网关地址与密钥: plaintextGateway URL: http://你的服务器IP:18789 Token: 你的网关访问令牌
  3. 授权权限 依次允许:摄像头、麦克风、位置、通知权限。
  4. 建立连接 点击「连接」,连接成功后手机自动注册为网关节点。

2.2 iOS 手机配置

  1. 通过 TestFlight / 应用商店安装对应客户端;
  2. 填写网关地址、Token,授权权限后连接;

限制说明:iOS 系统后台权限严格,后台常驻录音、持续监听会受限,建议前台运行使用。

2.3 移动节点可用能力

连接完成后,可直接在对话中下发指令:

  • 拍照 / 视频:拍一张当前环境照片
  • 录音:录制10秒环境声音
  • 定位:查看我当前的位置

三、音频节点配置(录音 / 播音 / 语音交互)

负责收音、放音、语音转文字、文字转语音,搭配树莓派、PC、外置麦克风音箱均可使用。

3.1 基础配置(openclaw.json)

json

{
  "nodes": {
    "audio": {
      "enabled": true,
      "inputDevice": "default",
      "outputDevice": "default",
      "sampleRate": 16000,
      "tts": {
        "provider": "edge-tts",
        "voice": "zh-CN-XiaoxiaoNeural"
      }
    }
  }
}

3.2 TTS 语音引擎与音色

表格

引擎特点费用
edge-tts(推荐)中文音色自然、延迟低完全免费
openai-tts音色丰富按调用计费
local系统本地语音免费

常用中文音色

  • 女声标准:zh-CN-XiaoxiaoNeural
  • 男声标准:zh-CN-YunxiNeural
  • 活泼女声:zh-CN-XiaoyiNeural

3.3 音频节点功能清单

  • audio_record:麦克风录音
  • audio_play:播放音频文件
  • stt:语音转文字
  • tts:文字转语音播报

四、摄像头节点配置(拍照 / 视频 / 图像理解)

分为本地 USB 摄像头、网络 IP 摄像头,支持拍照、录视频、图片内容识别。

4.1 基础配置

json

{
  "nodes": {
    "camera": {
      "enabled": true,
      "device": "/dev/video0",
      "resolution": "1280x720"
    }
  }
}
  • Linux / 树莓派:设备路径一般为 /dev/video0
  • Windows:自动识别摄像头设备,无需填写路径

4.2 图像理解(视觉分析)

依托大模型实现识图、读文字、场景描述、物体识别,需启用视觉模型。

json

{
  "mediaUnderstanding": {
    "enabled": true,
    "model": "gpt-4o",
    "maxImageSize": "1024x1024"
  }
}

使用流程:摄像头拍照 → 图片上传视觉模型 → 分析结果返回

典型场景:识别物品、读取文档文字、描述环境、异常检测。


五、语音唤醒(免手动激活)

类似语音助手,说出唤醒词即可激活交互,依赖音频节点麦克风持续监听。

5.1 配置示例

json

{
  "voicewake": {
    "enabled": true,
    "wakeWord": "小龙虾",
    "sensitivity": 0.5,
    "audioNode": "default"
  }
}

参数说明:

  • wakeWord:自定义唤醒词,支持中文 / 英文
  • sensitivity:灵敏度 0~1,数值越高越容易触发
  • audioNode:绑定使用的音频节点

5.2 运行流程

持续监听麦克风 → 识别到唤醒词 → 启动录音 → 语音转文字 → 智能体处理 → TTS 语音回复

提示:持续监听麦克风会增加设备功耗,移动设备建议按需开关。


六、Talk 实时语音对话模式

全双工语音交互,全程语音问答,无需手动点击,适合长时间语音聊天。

6.1 完整配置

json

{
  "talk": {
    "enabled": true,
    "stt": {
      "provider": "whisper",
      "model": "whisper-1"
    },
    "tts": {
      "provider": "edge-tts",
      "voice": "zh-CN-XiaoxiaoNeural"
    },
    "vadSensitivity": 0.6
  }
}
  • vadSensitivity:语音活动检测灵敏度,自动判断说话起止。

6.2 语音唤醒 vs Talk 模式

表格

模式激活方式交互形式资源消耗适用场景
语音唤醒唤醒词触发单次问答偶尔下发语音指令
Talk 模式手动开启连续对话长时间语音聊天

七、GPS 定位功能(位置获取)

依托移动设备 GPS,获取实时地理位置,支持定时刷新位置。

7.1 配置

json

{
  "nodes": {
    "location": {
      "enabled": true,
      "updateInterval": 300
    }
  }
}
  • updateInterval:位置刷新间隔,单位秒,默认 300 秒(5 分钟)

7.2 使用场景

查询当前位置、基于位置推荐周边服务、位置状态播报。


八、硬件组合方案(从入门到进阶)

8.1 入门方案(零额外硬件)

闲置安卓 / 苹果手机

  • 优势:即装即用,集成摄像头 + 麦克风 + GPS,无需接线
  • 用途:日常拍照、语音指令、定位、移动监控

8.2 进阶方案(树莓派 + 外设,固定点位)

plaintext

树莓派4B
├─ USB麦克风阵列(语音唤醒、收音)
├─ 有源音箱(TTS语音播报)
└─ USB摄像头(监控、拍照)
  • 适用:居家固定监控、全屋语音助手、桌面语音交互

8.3 企业 / 全屋多节点方案

plaintext

Gateway 服务端
├─ 门口节点:独立摄像头(门禁监控)
├─ 客厅节点:树莓派+音视频(语音助手)
├─ 卧室节点:手机(移动语音/定位)
└─ 办公区节点:电脑客户端(文字+语音)

九、常见问题排查

9.1 节点频繁断开

  1. 检查网关 18789 端口是否放行、防火墙规则;
  2. 确认设备与网关在同一网络,公网访问检查端口映射;
  3. 查看日志: bash运行openclaw gateway status openclaw logs | grep node

9.2 摄像头拍照模糊 / 黑屏

  1. 核对配置里的分辨率与设备匹配;
  2. 检查摄像头物理连接、光线环境;
  3. Linux 确认设备路径 /dev/video0 正确。

9.3 语音识别准确率低

  1. 更换降噪麦克风,减少环境噪音;
  2. 优先使用 whisper 作为 STT 引擎;
  3. 调整麦克风音量与 VAD 灵敏度。

9.4 语音唤醒不触发

  1. 确认音频节点正常工作,麦克风可正常收音;
  2. 适当调高 sensitivity 灵敏度;
  3. 缩短唤醒词,避免生僻词汇。

十、总结

  1. 节点系统是 OpenClaw 软硬结合的核心,让 AI 脱离纯文本交互,控制物理硬件;
  2. 手机是最简单的一体化移动节点,零基础可快速落地;
  3. 音频、摄像头、定位、语音唤醒、Talk 模式可按需组合配置;
  4. 树莓派 + 外设适合搭建固定场景的语音 / 监控节点;
  5. 多节点组网可实现全屋、多区域智能化联动,拓展能力上限。