把大模型从演示变成能值班的系统时,Agent 框架工程几乎总会先露出工程缺口。下面按可执行的顺序来拆:先讲它解决什么、卡在哪,再讲选型时看哪些数字,最后落到智能体和网关该怎么接。本文面向要上线的工程师,不写空泛趋势。
一、从 ReAct 到 Agentic Reasoning:五年范式演进
本文是【大模型基础设施工程】系列的第 19 篇。RAG 解决了”让模型知道”,Agent 解决的是”让模型会做”:从一句话自然语言需求出发,规划步骤、调用工具、观察结果、纠错重试,直到任务完成。这里不做”agent 能改变世界”式的宏大叙事,只谈工程栈——抽象、框架、协议、沙箱、评测——以及在落地时真实踩过的坑。
Agent 并不是 2024 年才出现的概念,但 LLM 让它第一次工程可行。把过去几年的关键节点串起来看:
二、核心抽象:Agent、Task、Tool、Memory、State
ReAct 的核心在于把 思考(Thought) 和 行动(Action) 写在一个 prompt 循环里:
Thought: 我需要查询北京今天的 PM2.5 Action: search[北京 PM2.5 今天] Observation: 今日北京 PM2.5 约 48,良 Thought: 已获取,可以回答 Action: finish[北京今天 PM2.5 大约 48] 这种格式有三个工程优势:
三、框架全景:主流 10 家
2023 年 OpenAI Function Calling 发布后,ReAct 的文本解析逐渐被 结构化 tool_call 取代,但循环本质未变。
ReAct 的缺点是 短视 :每一步都靠上一步的局部推理,面对多跳任务容易绕圈。Plan-and-Execute 先让 LLM 输出一个 JSON 计划,再按计划调度每一步;Reflexion 则在失败后插入一个”自我反思”步骤,把反思写入 episodic memory,下一次轮次读回来。
四、多 Agent 协作模式
这两个思路如今已融进主流框架:LangGraph 里的 plan → execute → replan 子图、AutoGen 的 GroupChatManager 、CrewAI 的 Process.hierarchical ,本质都是 Plan-and-Execute 的变体。
2024 年底开始,o1、DeepSeek-R1、Claude 3.7 Thinking 把 长链推理 内化到模型本身——模型在回答前会生成几千到几万 token 的 <thinking> 块,里面就包含”规划—执行—反思”的完整循环。
五、记忆系统:MemGPT、Letta、Mem0、Zep
这带来一个结构性变化: 框架层需要做的规划编排变少了 。很多在 GPT-4 时代必须用 LangGraph 显式展开的子图,在 R1/o1 上直接一次调用就能完成。这意味着:
传统 AgentExecutor 是一个 while 循环,控制流写死在代码里。问题是:
六、Agent 工程四大难题
LangGraph、Pydantic Graph、OpenAI Agents SDK 的 handoff 等新一代框架统一改用 显式状态图 。节点是纯函数 state -> state ,边是条件路由函数 state -> node_name ,状态是一个 Pydantic / TypedDict,持久化到 checkpointer(内存、SQLite、Redis、Postgres 都行)。
LangChain 是 2022 年底最早一批 LLM 框架,覆盖 Chain、Retriever、Agent、Tool、OutputParser 全套原语。2024 年后官方把 agent 部分独立为 LangGraph ,核心抽象从 AgentExecutor 变为 StateGraph + Checkpointer。
落地时建议先做的 5 件事
- 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。
- 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。
- 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。
- 工具调用默认拒绝,按白名单放开,高风险动作必须人审。
- 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。
和智能体产品怎么接
对龙虾PRO这类要把 OpenClaw 落到中国业务场景的平台来说,Agent 框架工程决定的是延迟能不能进对话、成本能不能规模化、出了问题能不能追溯。技能市场、数字员工和网关都应该吃同一套观测与权限,而不是文章里的概念演示。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是 Agent,它和 RAG 有什么区别?
Agent 是一种让大模型从“知道”信息升级到“会执行”任务的技术。它从自然语言需求出发,自动规划步骤、调用工具、观察结果并纠错重试,直到任务完成。相比 RAG 只解决信息检索,Agent 更侧重动态规划和交互执行,工程栈包括框架、协议和沙箱等。
为什么 Agent 可靠性要靠状态机而不是聊天循环?
传统 AgentExecutor 使用 while 循环,控制流写死在代码里,面对多跳任务容易短视或绕圈。新一代框架如 LangGraph 改用显式状态图,节点是纯函数,状态持久化到检查点,让规划更灵活、错误可恢复,从而提高系统鲁棒性和可靠性。
主流 Agent 框架有哪些,它们如何演进?
主流框架包括 LangGraph、AutoGen、CrewAI 等,它们从 ReAct 循环演进到 Plan-and-Execute 模式,如 LangGraph 的 plan→execute→replan 子图。这些框架统一采用显式状态图,状态用 Pydantic 定义,支持持久化到 Redis 或 Postgres,适应不同协作需求。
多 Agent 协作模式是怎么工作的?
多 Agent 协作通过框架如 AutoGen 的 GroupChatManager 或 CrewAI 的 hierarchical 流程实现,本质是 Plan-and-Execute 的变体。每个 Agent 作为状态图节点,通过条件路由共享记忆和工具,协同完成复杂任务,如任务分发和结果整合。
Agent 记忆系统的作用是什么,有哪些方案?
记忆系统帮助 Agent 存储历史信息,支持反思和长期学习,提升任务成功率。主流方案包括 MemGPT、Letta、Mem0 和 Zep,它们将反思写入 episodic memory,下次轮次读回,避免短视问题,增强上下文连续性。
落地 Agent 工程时,应该先做哪些关键步骤?
建议先用自己的真实请求测试模型性能,算显存和 KV 缓存账决定资源,网关层收口鉴权和路由,工具调用默认拒绝按白名单放开,以及准备模型升级回滚方案。这些步骤能确保系统稳定、安全且可追溯,比如在龙虾PRO平台上集成 OpenClaw 时。