一、API 调用成本整体概述
使用云端大模型对接 OpenClaw 时,Token 消耗量直接决定 API 费用。不同厂商、不同模型的定价差距极大,合理选型与管控 Token,可将综合使用成本降低 90% 以上。
主流模型价格参考(按百万 Token 计价)
价格为市场常规报价,实际以厂商官网为准,仅作成本量级参考:
表格
| 模型 | 输入单价 | 输出单价 | 综合点评 |
|---|---|---|---|
| GPT-4o | $2.50 | $10.00 | 综合能力强,中高端定价 |
| GPT-4o-mini | $0.15 | $0.60 | 日常场景性价比首选 |
| Claude 3.5 Sonnet | $3.00 | $15.00 | 长文本 / 复杂推理强,价格偏高 |
| Claude 3.5 Haiku | $0.80 | $4.00 | 响应快、成本适中 |
| DeepSeek V3 | ¥1.00 | ¥2.00 | 国内首选,价格极低 |
| 通义千问 Plus | ¥0.80 | ¥2.00 | 国内生态完善,低成本 |
| Ollama 本地模型 | 免费 | 免费 | 无 API 费用,依赖本地硬件 |
单次对话成本测算
以常规对话为例,拆解 Token 构成:
- 系统人设 + 技能规则:约 2000 Token
- 历史对话上下文:约 3000 Token
- 用户当前提问:约 200 Token
- AI 回复内容:约 500 Token 单次合计:5700 Token
单次对话成本对照:
表格
| 模型 | 单次对话成本 |
|---|---|
| GPT-4o | 约 ¥0.13 |
| GPT-4o-mini | 约 ¥0.007 |
| DeepSeek V3 | 约 ¥0.007 |
| Ollama 本地 | 0 元 |
按每日对话 100 次、按月 30 天计算月均成本:
表格
| 模型 | 月度预估成本 |
|---|---|
| GPT-4o | 约 ¥390 |
| GPT-4o-mini | 约 ¥21 |
| DeepSeek V3 | 约 ¥21 |
| Ollama 本地 | 0 元(仅计硬件 / 电费) |
提示:单次单价看似低廉,高频使用下累积成本会快速上涨,必须做好管控。
二、Token 基础概念与消耗明细
1. 什么是 Token
Token 是大模型解析文本的最小单位,不等于汉字 / 单词数量:
- 英文:1 个单词 ≈ 1~2 个 Token
- 中文:1 个汉字 ≈ 1~2 个 Token
- 代码 / 符号:关键字、标点、括号基本单独计为 1 个 Token
2. 输入 Token & 输出 Token
API 计费分为两大块,输出 Token 价格普遍是输入的 2~5 倍(生成文本算力开销更高):
plaintext
输入 Token(用户侧下发内容)
├─ SOUL.md、AGENTS.md 智能体人设与规则
├─ 已安装所有 Skill 技能描述
├─ 历史全部对话记录
└─ 用户最新提问
输出 Token(模型返回内容)
└─ AI 最终回复文本
3. 隐性 Token 消耗(易被忽略)
除可见对话外,系统配置、技能、记忆都会持续占用 Token,属于固定开销:
表格
| 消耗来源 | 大致 Token 区间 | 说明 |
|---|---|---|
| SOUL.md 人设 | 100 ~ 500 | 人设越长,固定开销越大 |
| AGENTS.md 项目说明 | 200 ~ 1000 | 多智能体场景消耗更高 |
| 单条 Skill 技能 | 24+ | 安装越多,累积越高 |
| MEMORY.md 长期记忆 | 100 ~ 500 | 长期对话会持续膨胀 |
| 工具函数定义 | 50 ~ 200 | 内置工具、自定义工具描述 |
| 工具调用返回结果 | 不固定 | 网页搜索、文件读取等大数据返回消耗极高 |
举例:安装 20 个技能,仅技能描述就会额外占用 500+ Token。
三、Token 使用量查看与监控配置
1. 快速查看统计数据
OpenClaw 内置用量统计,一键查看当日 / 当月 Token 消耗:
bash
运行
openclaw status
输出示例:
plaintext
Token Usage (Today):
Input: 45230 tokens
Output: 12450 tokens
Total: 57680 tokens
Token Usage (This Month):
Input: 1234567 tokens
Output: 345678 tokens
Total: 1580245 tokens
2. 开启详细用量追踪
编辑主配置文件 ~/.openclaw/openclaw.json,开启追踪功能:
json
{
"usageTracking": {
"enabled": true,
"logLevel": "detailed"
}
}
日志级别说明:
basic:仅记录每日总用量detailed:记录每一次请求的 Token 消耗verbose:追加模型、响应耗时、调用链路等全量信息
3. 配置用量告警(防超额扣费)
设置每日 / 每月用量上限,接近阈值自动提醒:
json
{
"usageTracking": {
"enabled": true,
"alerts": {
"dailyLimit": 100000,
"monthlyLimit": 3000000
}
}
}
达到限额后网关会主动弹出警告,避免无限制扣费。
四、Prompt 缓存(低成本核心优化)
1. 工作原理
Prompt 缓存会对重复不变的前缀内容做缓存,二次及后续调用时,缓存部分大幅减免计费。
- 首次请求:全部内容正常计费
- 后续请求:固定的系统提示词、技能描述命中缓存,仅新增内容计费
示例流程:
- 首次:系统提示词 (2000) + 历史对话 (3000) + 新消息 (200) → 全额计费
- 二次:缓存命中 (2000) + 新增历史 (3200) + 新消息 (150) → 仅变动部分计费
2. 各厂商缓存支持
表格
| 模型厂商 | 缓存支持 | 优惠力度 |
|---|---|---|
| Anthropic(Claude) | 支持 | 缓存部分减免 90% 费用 |
| OpenAI | 支持 | 缓存部分减免 50% 费用 |
| DeepSeek | 支持 | 缓存部分阶梯折扣 |
| Ollama | 无需缓存 | 本地运行零 API 费用 |
3. 缓存优化技巧
缓存为自动生效,只需配合以下规则最大化收益:
- 尽量保持
SOUL.md、AGENTS.md、技能列表稳定,不要频繁修改; - 将固定不变的内容放在提示词最前方;
- 长会话、连续多轮对话场景,缓存收益最高。
五、模型选型与混合调度策略
1. 按业务场景匹配模型(降本首选)
选对模型是成本优化效果最显著的手段:
表格
| 使用场景 | 推荐模型 | 选择理由 |
|---|---|---|
| 日常闲聊、简单问答 | DeepSeek / GPT-4o-mini | 成本极低,能力完全够用 |
| 代码编写、复杂推理 | GPT-4o / Claude 3.5 Sonnet | 逻辑能力强,保障输出质量 |
| 文本翻译、摘要 | DeepSeek / GPT-4o-mini | 任务简单,无需高配模型 |
| 数据分析、数理计算 | GPT-4o | 计算精度高 |
| 隐私敏感、数据不外流 | Ollama 本地模型 | 数据本地运行,零 API 费用 |
2. 混合模型 + 故障转移配置
主用低成本国内模型,故障时自动切换备用模型,兼顾省钱与稳定性:
json
{
"model": {
"provider": "deepseek",
"model": "deepseek-chat",
"fallback": [
{
"provider": "openai",
"model": "gpt-4o-mini"
}
]
}
}
六、全方位成本优化实操方案
1. 精简系统提示词(减少固定开销)
SOUL.md人设控制在 200~500 字,剔除冗余描述;AGENTS.md仅保留必要项目规则,删除大段示例代码;- 不堆砌无关话术,减少每次调用的基础 Token。
2. 清理无用技能
每个技能都会常驻占用 Token,卸载长期不用的技能:
bash
运行
# 查看已安装全部技能
clawhub list
# 卸载闲置技能
clawhub uninstall 技能名称
3. 控制上下文长度
历史对话是 Token 暴涨的主要原因:
- 单轮对话过长时,手动新建会话重置上下文;
- 避免一个会话连续数百轮对话累积历史记录。
4. 开启对话自动压缩
利用低价模型对超长历史做摘要压缩,缩减上下文体积:
json
{
"compaction": {
"enabled": true,
"model": "deepseek-chat"
}
}
建议使用低成本模型执行压缩,避免二次增加成本。
5. 部署本地模型(终极零成本方案)
使用 Ollama 运行开源大模型,完全摆脱云端 API 计费:
bash
运行
# 一键安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh
# 下载轻量模型(7B 系列,8G 显存即可流畅运行)
ollama pull qwen2.5:7b
OpenClaw 对接本地模型配置:
json
{
"model": {
"provider": "ollama",
"model": "qwen2.5:7b"
}
}
说明:本地模型无 API 费用,但会占用硬件资源、推理速度略慢。
七、成本快速计算公式
通用月成本估算公式:
plaintext
月度总成本 = 单次对话Token数 × 每日对话次数 × 30 × 每千Token单价
示例(DeepSeek V3,每日 50 次对话,单次 5700 Token):
plaintext
总Token = 5700 × 50 × 30 = 8550000 Token
月成本 = 8550000 ÷ 1000 × 0.002 = ¥17.1
八、常见问题排查
1. Token 消耗远超预期?
优先排查 4 个高频原因:
- 工具调用返回大量数据(搜索结果、完整文件内容);
- 安装了大量闲置技能,累积固定开销;
- 单一会话历史对话过多,上下文持续膨胀;
SOUL.md/AGENTS.md内容冗长。
2. 本地模型真的完全免费吗?
- API 调用:0 费用;
- 隐性成本:GPU/CPU 硬件损耗、电费;
- 硬件要求:7B 模型建议 8GB 及以上显存。
3. 如何做到「不降质量、只降成本」?
推荐分层使用策略:
- 简单问答、闲聊、翻译 → 低价轻量模型;
- 代码、推理、复杂任务 → 高性能模型;
- 配置故障转移,自动切换兜底。
九、总结
- 模型定价差距极大,合理选型是降本第一优先级;
- Token 分为输入与输出,输出计费普遍更高,同时存在人设、技能等隐性消耗;
- 开启用量监控与告警,实时掌握消耗、防止超额扣费;
- 利用 Prompt 缓存、对话压缩、精简配置,持续压低固定开销;
- 高频轻度使用选云端低价模型,隐私 / 长期离线使用优先 Ollama 本地模型。