把模型当成函数看最清楚:一段文本进去,一段文本出来。包装成对话框、接口或编辑器插件,底层还是无状态映射。客服工单、排障、调研一上手,会立刻撞上五堵墙:跨调用不留信息、输出没有副作用、自回归不能回头改、不知道执行到第几步、自信不等于正确。更大的底座能把推理写得更像样,却补不上这五块架构缺口。
工程上的补法是五件套:推理引擎之外,要记忆、工具、规划器和运行时。记忆管对话窗口、任务状态和长期知识;工具把意图落到搜索、查库、调接口;规划器拆步骤、处理分支;运行时管循环、超时、退出。出问题时先问是哪一层:跨轮失忆是记忆,参数乱是工具描述,打转是循环和退出条件,反复同一错是没有反思。把模型当成系统里最不可靠的部件,再用别的层把它围住,比继续加提示词更靠谱。
自主性不是连续旋钮,是台阶。一次分类、一次摘要是单次推理;搜一下网页再综合是工具增强;多步循环、自己决定何时停是任务驱动;没人触发还自己设子目标,才叫长期自主。公开产品里真正稳的长期自主几乎没有:早期自动拆目标的项目缺退出和预算守卫,演示很炫的编程助手落到企业后,任务仍由人发起。长期跑加上不可逆副作用,风险是乘法。2026 年更现实的是把任务驱动这一档做扎实。
客服退货这种高人工场景,账更容易算错。纯文本大约两成能闭环,工具增强大约六成,带循环的智能体可以到九成五,人工介入从八成掉到百分之五。词费可能从一分钱量级涨到一毛,人工按每次几块算,总成本反而能掉一个数量级。流程已经高度自动化、流量放到平台规模时,词才会变成主要可变成本。评估投入产出,问的是少了多少人插手,不是省了几个词。
落地清单
- 输入输出可穷举、步骤能画成完整状态机、必须百分百确定的,用规则或工作流,不要上智能体。
- 真实系统里语义推理常常只占一两成工作量,骨架仍应是确定性代码。
- N 步任务的输入词不是 N 倍,而是三角数累积;五步大约是「每步新增」的三倍,不是五倍。
- 从最简形态开始。一次调用够用就不要上循环;循环够用就不要拆成多个角色。
用最简单的抽象把事做完。失败的项目多数不是用力不足,是把探索性工具硬套进确定性流程。
本文侧重智能体生命周期与技能边界。若你要动手验证,优先用 Playground 做小任务压测;权限与托管再单独规划,避免「先装一堆再治理」。 相关:Playground · 创建智能体 · 学习中心
常见问题 FAQ
智能体落地最常见的五堵墙是什么?
根据文章,它们是:1) 跨调用不留信息(记忆缺口);2) 输出没有副作用(工具缺口);3) 自回归不能回头改(规划缺口);4) 不知道执行到第几步(状态缺口);5) 自信不等于正确(运行时缺口)。这些是架构问题,单靠更大的底座模型无法解决,需要专门的工程补丁。
为什么说智能体不是一个更大更聪明的模型就够了?
文章指出,更大的模型主要改进的是推理本身(如生成更像样的文本),但它无法补上智能体所需的“架构缺口”。比如,它没有跨轮次记忆,不知道如何调用外部工具(如搜索、数据库),也缺乏自主拆分任务步骤和决定何时停止的机制。这些都需要模型之外的“五件套”(记忆、工具、规划器等)来支持,构成一个完整的系统。
智能体的自主性到底分几个级别?具体指什么?
文章将自主性清晰地分为四个“台阶”,而非连续旋钮:1) 单次推理(如分类、摘要);2) 工具增强(搜一下网页再综合);3) 任务驱动(多步循环,自己决定何时停);4) 长期自主(无人触发还自己设子目标)。目前公开产品中真正稳定的长期自主几乎没有,因为风险随任务持续性和不可逆操作成倍增长。
如何判断一个任务应该用智能体,还是用规则或工作流?
文章的“落地清单”给出了明确标准:如果任务的输入输出可以穷举、步骤能画成完整的状态机、或者过程必须百分百确定,那就应该用规则或确定性工作流,不要上智能体。因为真实系统中语义推理往往只占一两成工作量,骨架仍应是可靠的确定性代码。智能体适合处理那些规则难以穷尽、需要灵活推理的环节。
用智能体真的能降低总成本吗?钱花哪儿了?
是的,文章算了一笔账。在客服退货等场景,纯文本AI只能闭环约20%的工单,但加上工具和循环的智能体可以做到95%。这意味着人工介入能从80%降到5%。虽然每次调用的“词费”可能从一分涨到一毛,但节省的人工费(每次几块钱)要多得多。总成本因此能下降一个数量级。关键在于减少人工插手,而不是省那点API费用。
当智能体出问题时,应该从哪几个层面去排查?
文章建议分层排查:1) 如果是跨轮对话失忆,问题出在“记忆”层;2) 如果是调用工具时参数混乱,检查“工具描述”;3) 如果陷入死循环或行为打转,检查“循环和退出条件”的设置;4) 如果反复犯同样的错误,则是缺少“反思”机制(属于规划或运行时)。把模型当成系统中最不可靠的部件,用其他层把它围住是更稳健的思路。