-
智能体不是把模型做大:缺的是记忆、工具、规划和停下来的办法
文本进、文本出解决不了真实任务。无记忆、无副作用、无回溯,都不是换更大模型能撞穿的墙。客服场景里真正的成本往往是人工介入率,不是词账单。
-
智能体运行时就三件事:循环怎么停、工具怎么签契约、提示词当接口
八成线上事故出在状态机、参数约束和提示词版本。一次工具调用其实是两轮推理。十轮任务的词消耗可能是一轮的五十多倍。
-
智能体记不住不是窗口太小,是检索没做好
八成检索增强的质量问题在召回侧。小块检索、大块喂模型,关键词加向量再精排,比换旗舰模型更管用。长上下文不会让检索过时。
-
规划不会随模型自动长出来:前瞻、深度和回溯都要外搭脚手架
逐词预测缺前瞻、缺搜索、缺回头改。边走边看适合短任务,长链路先出计划更省。反思要有根因字段和改善幅度,别无限自评。
-
别让智能体一个大循环跑到底:链式、分流和并行才是能上线的骨架
步骤拓扑写在代码里,才能测试和恢复。规则先分流八成流量,拿不准再走重路径。并行能降延迟,账单也按份数翻。
-
多智能体是乘法不是加法:节点不稳,拆得越多端到端越差
两个八成的节点串联只剩六成四。端到端要九成五,三节点各自得接近九成八。协议把工具集成从乘积变成加减,模型并不直接调外部服务。
-
演示能跑不算上线:追踪、评测、词预算和护栏缺一项就别放流量
同一输入可能走两轮也可能走八轮,只能靠观测。评测要看结果、轨迹和效率。间接注入藏在文档里。学习不能改安全策略、不能升级权限。
-
没接口再看屏幕:图形智能体失败率还差一两个数量级
公开桌面评测从一成五涨到七成二,高风险任务若要把失败压到百分之一,还差数量级。看屏幕比调接口贵一百到一千倍。平台要按词预扣,不能只按请求数限流。
-
推理优化先管住 KV 缓存碎片,再谈连续批和流式吐字
自注意力默认按序列平方重算。缓存键值能把每步变成对新词的一次查询,但连续分配会把显存撕成碎片。分页和动态组批,才是生产里能多塞两三倍用户的原因。
-
大模型适配别复制整份权重:冻住底座,只训练一条很窄的通路
全量微调贵、占存储、还容易忘掉原能力。适配器、低秩更新、前缀和只训偏置,通常动不到百分之一的参数。