一、API 调用成本整体概述

使用云端大模型对接 OpenClaw 时,Token 消耗量直接决定 API 费用。不同厂商、不同模型的定价差距极大,合理选型与管控 Token,可将综合使用成本降低 90% 以上。

主流模型价格参考(按百万 Token 计价)

价格为市场常规报价,实际以厂商官网为准,仅作成本量级参考:

表格

模型输入单价输出单价综合点评
GPT-4o$2.50$10.00综合能力强,中高端定价
GPT-4o-mini$0.15$0.60日常场景性价比首选
Claude 3.5 Sonnet$3.00$15.00长文本 / 复杂推理强,价格偏高
Claude 3.5 Haiku$0.80$4.00响应快、成本适中
DeepSeek V3¥1.00¥2.00国内首选,价格极低
通义千问 Plus¥0.80¥2.00国内生态完善,低成本
Ollama 本地模型免费免费无 API 费用,依赖本地硬件

单次对话成本测算

常规对话为例,拆解 Token 构成:

  • 系统人设 + 技能规则:约 2000 Token
  • 历史对话上下文:约 3000 Token
  • 用户当前提问:约 200 Token
  • AI 回复内容:约 500 Token 单次合计:5700 Token

单次对话成本对照:

表格

模型单次对话成本
GPT-4o约 ¥0.13
GPT-4o-mini约 ¥0.007
DeepSeek V3约 ¥0.007
Ollama 本地0 元

每日对话 100 次、按月 30 天计算月均成本:

表格

模型月度预估成本
GPT-4o约 ¥390
GPT-4o-mini约 ¥21
DeepSeek V3约 ¥21
Ollama 本地0 元(仅计硬件 / 电费)

提示:单次单价看似低廉,高频使用下累积成本会快速上涨,必须做好管控。

二、Token 基础概念与消耗明细

1. 什么是 Token

Token 是大模型解析文本的最小单位,不等于汉字 / 单词数量

  • 英文:1 个单词 ≈ 1~2 个 Token
  • 中文:1 个汉字 ≈ 1~2 个 Token
  • 代码 / 符号:关键字、标点、括号基本单独计为 1 个 Token

2. 输入 Token & 输出 Token

API 计费分为两大块,输出 Token 价格普遍是输入的 2~5 倍(生成文本算力开销更高):

plaintext

输入 Token(用户侧下发内容)
├─ SOUL.md、AGENTS.md 智能体人设与规则
├─ 已安装所有 Skill 技能描述
├─ 历史全部对话记录
└─ 用户最新提问

输出 Token(模型返回内容)
└─ AI 最终回复文本

3. 隐性 Token 消耗(易被忽略)

除可见对话外,系统配置、技能、记忆都会持续占用 Token,属于固定开销:

表格

消耗来源大致 Token 区间说明
SOUL.md 人设100 ~ 500人设越长,固定开销越大
AGENTS.md 项目说明200 ~ 1000多智能体场景消耗更高
单条 Skill 技能24+安装越多,累积越高
MEMORY.md 长期记忆100 ~ 500长期对话会持续膨胀
工具函数定义50 ~ 200内置工具、自定义工具描述
工具调用返回结果不固定网页搜索、文件读取等大数据返回消耗极高

举例:安装 20 个技能,仅技能描述就会额外占用 500+ Token

三、Token 使用量查看与监控配置

1. 快速查看统计数据

OpenClaw 内置用量统计,一键查看当日 / 当月 Token 消耗:

bash

运行

openclaw status

输出示例:

plaintext

Token Usage (Today):
Input: 45230 tokens
Output: 12450 tokens
Total: 57680 tokens

Token Usage (This Month):
Input: 1234567 tokens
Output: 345678 tokens
Total: 1580245 tokens

2. 开启详细用量追踪

编辑主配置文件 ~/.openclaw/openclaw.json,开启追踪功能:

json

{
  "usageTracking": {
    "enabled": true,
    "logLevel": "detailed"
  }
}

日志级别说明:

  • basic:仅记录每日总用量
  • detailed:记录每一次请求的 Token 消耗
  • verbose:追加模型、响应耗时、调用链路等全量信息

3. 配置用量告警(防超额扣费)

设置每日 / 每月用量上限,接近阈值自动提醒:

json

{
  "usageTracking": {
    "enabled": true,
    "alerts": {
      "dailyLimit": 100000,
      "monthlyLimit": 3000000
    }
  }
}

达到限额后网关会主动弹出警告,避免无限制扣费。

四、Prompt 缓存(低成本核心优化)

1. 工作原理

Prompt 缓存会对重复不变的前缀内容做缓存,二次及后续调用时,缓存部分大幅减免计费。

  • 首次请求:全部内容正常计费
  • 后续请求:固定的系统提示词、技能描述命中缓存,仅新增内容计费

示例流程:

  1. 首次:系统提示词 (2000) + 历史对话 (3000) + 新消息 (200) → 全额计费
  2. 二次:缓存命中 (2000) + 新增历史 (3200) + 新消息 (150) → 仅变动部分计费

2. 各厂商缓存支持

表格

模型厂商缓存支持优惠力度
Anthropic(Claude)支持缓存部分减免 90% 费用
OpenAI支持缓存部分减免 50% 费用
DeepSeek支持缓存部分阶梯折扣
Ollama无需缓存本地运行零 API 费用

3. 缓存优化技巧

缓存为自动生效,只需配合以下规则最大化收益:

  1. 尽量保持 SOUL.mdAGENTS.md、技能列表稳定,不要频繁修改;
  2. 将固定不变的内容放在提示词最前方;
  3. 长会话、连续多轮对话场景,缓存收益最高。

五、模型选型与混合调度策略

1. 按业务场景匹配模型(降本首选)

选对模型是成本优化效果最显著的手段:

表格

使用场景推荐模型选择理由
日常闲聊、简单问答DeepSeek / GPT-4o-mini成本极低,能力完全够用
代码编写、复杂推理GPT-4o / Claude 3.5 Sonnet逻辑能力强,保障输出质量
文本翻译、摘要DeepSeek / GPT-4o-mini任务简单,无需高配模型
数据分析、数理计算GPT-4o计算精度高
隐私敏感、数据不外流Ollama 本地模型数据本地运行,零 API 费用

2. 混合模型 + 故障转移配置

主用低成本国内模型,故障时自动切换备用模型,兼顾省钱与稳定性:

json

{
  "model": {
    "provider": "deepseek",
    "model": "deepseek-chat",
    "fallback": [
      {
        "provider": "openai",
        "model": "gpt-4o-mini"
      }
    ]
  }
}

六、全方位成本优化实操方案

1. 精简系统提示词(减少固定开销)

  • SOUL.md 人设控制在 200~500 字,剔除冗余描述;
  • AGENTS.md 仅保留必要项目规则,删除大段示例代码;
  • 不堆砌无关话术,减少每次调用的基础 Token。

2. 清理无用技能

每个技能都会常驻占用 Token,卸载长期不用的技能:

bash

运行

# 查看已安装全部技能
clawhub list

# 卸载闲置技能
clawhub uninstall 技能名称

3. 控制上下文长度

历史对话是 Token 暴涨的主要原因:

  • 单轮对话过长时,手动新建会话重置上下文;
  • 避免一个会话连续数百轮对话累积历史记录。

4. 开启对话自动压缩

利用低价模型对超长历史做摘要压缩,缩减上下文体积:

json

{
  "compaction": {
    "enabled": true,
    "model": "deepseek-chat"
  }
}

建议使用低成本模型执行压缩,避免二次增加成本。

5. 部署本地模型(终极零成本方案)

使用 Ollama 运行开源大模型,完全摆脱云端 API 计费:

bash

运行

# 一键安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh

# 下载轻量模型(7B 系列,8G 显存即可流畅运行)
ollama pull qwen2.5:7b

OpenClaw 对接本地模型配置:

json

{
  "model": {
    "provider": "ollama",
    "model": "qwen2.5:7b"
  }
}

说明:本地模型无 API 费用,但会占用硬件资源、推理速度略慢。

七、成本快速计算公式

通用月成本估算公式:

plaintext

月度总成本 = 单次对话Token数 × 每日对话次数 × 30 × 每千Token单价

示例(DeepSeek V3,每日 50 次对话,单次 5700 Token):

plaintext

总Token = 5700 × 50 × 30 = 8550000 Token
月成本 = 8550000 ÷ 1000 × 0.002 = ¥17.1

八、常见问题排查

1. Token 消耗远超预期?

优先排查 4 个高频原因:

  1. 工具调用返回大量数据(搜索结果、完整文件内容);
  2. 安装了大量闲置技能,累积固定开销;
  3. 单一会话历史对话过多,上下文持续膨胀;
  4. SOUL.md / AGENTS.md 内容冗长。

2. 本地模型真的完全免费吗?

  • API 调用:0 费用;
  • 隐性成本:GPU/CPU 硬件损耗、电费;
  • 硬件要求:7B 模型建议 8GB 及以上显存。

3. 如何做到「不降质量、只降成本」?

推荐分层使用策略:

  • 简单问答、闲聊、翻译 → 低价轻量模型;
  • 代码、推理、复杂任务 → 高性能模型;
  • 配置故障转移,自动切换兜底。

九、总结

  1. 模型定价差距极大,合理选型是降本第一优先级
  2. Token 分为输入与输出,输出计费普遍更高,同时存在人设、技能等隐性消耗;
  3. 开启用量监控与告警,实时掌握消耗、防止超额扣费;
  4. 利用 Prompt 缓存、对话压缩、精简配置,持续压低固定开销;
  5. 高频轻度使用选云端低价模型,隐私 / 长期离线使用优先 Ollama 本地模型。