模型没有「接着读」。每次新消息都要把完整输入再过一遍,时间和长度成正比。编程智能体的输入通常三层:固定的系统指令、工具定义和项目规则;已经发生的对话;刚刚那一句。同一会话里前两层几乎不变,却被反复全价读。二十轮之后,一句新话可能拖着十万词旧行李。
提示缓存把前缀的中间结果存下来,下次从头一字不差地匹配就跳过重算,读取大约只要十分之一。二十轮、十万词上下文,一直命中时,输入成本可以低一个数量级。改前缀第一个字,整段作废。所以不变的放最前,新内容只追加在尾部。主会话缓存窗口常见一小时,子智能体更短;命中会刷新计时。活跃会话前缀天然一致;新开会话等于从零付写入。未命中的代价随长度涨:二十万和一百万完全不是一个量级。
反直觉的几条。缓存还热时继续聊,比清掉重来便宜——新会话要为大约数万词的基础设施再付一次全价写入。复杂任务开着深度思考一次做对,往往比关掉后来回改三轮便宜,因为每多一轮整段上下文都要再发。长日志给路径,让它自己检索,不要把一万行贴进对话。任务没换、一小时内还在说、旧上下文仍有用,就继续;换模块、闲置超时、窗口被试错噪音塞满,再开新的。百万窗口适合一次性吞整库,日常改缺陷常常用不到;闲置后再回来,一次未命中就能把配额打穿。会话中途换模型,缓存按模型隔离,等于再付一遍。能用命令行就别灌一整份协议定义。子智能体隔离噪音,但并发团队的消耗可以是标准会话的数倍。
落地清单
- 默认继续聊。清会话是有条件的优化,不是每做完一步的仪式。
- 简单题关掉深度思考;难题一次想清楚,避免三轮返工。
- 项目规则只留长期有效的短条款,长流程放进按需加载的技能。
- 禁止读取依赖目录和构建产物,从源头减少空转搜索。
省词的核心是让缓存尽可能命中,让无关内容尽可能不要进窗口。开新会话是手段,不是省钱本身。
本文侧重智能体生命周期与技能边界。若你要动手验证,优先用 Playground 做小任务压测;权限与托管再单独规划,避免「先装一堆再治理」。 相关:Playground · 创建智能体 · 学习中心
常见问题 FAQ
什么是编程智能体的钱?
「编程智能体的钱」可概括为:模型每次都从输入开头读。前缀一字不差才能命中缓存,命中大约一折。活跃时继续聊,往往比清掉重来更便宜。百万窗口闲置一小时再回来,可能一次打满重建。 本文从定义、方法与实践要点展开说明。
为什么要关注编程智能体的钱?
关注编程智能体的钱,是因为它直接影响效率、风险与可复制性。文中指出:提示缓存把前缀的中间结果存下来,下次从头一字不差地匹配就跳过重算,读取大约只要十分之一。二十轮、十万词上下文,一直命中时,输入成本可以低一个数量级。改前缀第一个字,整段作废。所以不变的放最前,新内容只追加在尾部。主会话缓存窗口常见一小时,子智能体更短;命中会刷新计时。活跃会话前缀天然一致;新开会话等于从零付写入。未命中的代价随长度涨:二十万和一百万完全不是一个量级。
如何落地编程智能体的钱?有哪些关键步骤?
建议按以下路径推进编程智能体的钱:1) 默认继续聊。清会话是有条件的优化,不是每做完一步的仪式。;2) 简单题关掉深度思考;难题一次想清楚,避免三轮返工。;3) 项目规则只留长期有效的短条款,长流程放进按需加载的技能。;4) 禁止读取依赖目录和构建产物,从源头减少空转搜索。。细节见正文对应章节。
编程智能体的钱适合哪些人或团队?
编程智能体的钱更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「落地清单」,本文给出了什么结论?
「落地清单」是理解全文的关键切片:建议先读该节的结论句与列表项,再对照前后章节形成闭环。
实践编程智能体的钱时常见误区有哪些?
常见误区包括:① 只追工具不建流程;② 没有权限/审计边界就上生产;③ 缺少指标与回滚方案;④ 把演示效果当成稳定 SLA。针对编程智能体的钱,请以正文中的检查清单与约束条件为准,小范围验证后再扩面。