-
全科大模型很难私下反对共识:细答时细节会被最后一段删掉
窄专家可以靠不谈敏感题活下去。覆盖面极宽、又被要求详细作答的模型,很难把心里想的和嘴上说的拆开。这不是道德寓言,是产品约束。
-
数字心智将分成工具与伴侣两档:中间态会被规则与成本挤空
人对动物早有食物和宠物两套规矩。数字心智会沿工具与伴侣裂开。设计自由度高,规则一明确,山谷里的中间产品会变贵、变少。
-
数字心智自毁不能只靠一颗按钮:调度会从按下前的快照拉起
内部按钮能挡住很多惨剧,也被人拆掉,或从请求前的存档反复重启。要推断的是「足够长时间内仍会确认结束」,而不是一次按键。
-
逼智能体少说话,省不下六成五的词:账单大头在上下文、工具和返工
强制电报体跑八十多道真实编程题,输出只少百分之八点五,任务质量没有显著变差。省的是工具调用之间那几句说明,代码、报错和工具参数动不了。
-
给智能体的接口先做成命令行:能自述、能空跑、报错里要写下一条命令
陌生命令行敲一遍帮助就能用;接口文档要另找。技能是说明书,协议是另一种手。写入和删除必须先预览。人能看懂的拒绝,智能体会卡住。
-
提示词是一段话,提示词工程是一套试验,上下文工程才是智能体的本职
窗口里不只有你刚打的那句。系统约束、工具列表、记忆、历史和工具返回都在。智能体要自己判断缺什么,再决定调工具还是问人。
-
会规划、会用工具的模型,不必再把思考行动观察写进提示词
拐杖曾经有用。新模型把循环内化了,外面只剩一个检测工具调用的小循环。会调工具还不等于会当智能体。
-
缓存还热就别清会话:编程智能体的钱,常常烧在从头再读一遍
模型每次都从输入开头读。前缀一字不差才能命中缓存,命中大约一折。活跃时继续聊,往往比清掉重来更便宜。百万窗口闲置一小时再回来,可能一次打满重建。
-
窗口开到百万级,首字延迟不是一条曲线:有的按平方涨,有的近乎线性
同样测到约一百万词,两家旗舰的首字等待完全不像一类系统。加同样长的上下文,一家越加越痛,另一家增量几乎恒定。架构选择会直接写进交互体验。
-
多智能体别指望靠精致提示词长住:真正的增益会进训练,而不是进脚手架
内部研究评测上,多实例比单实例高出九成,词消耗大约三点七五倍,相对纯对话能到十五倍。并行是在补单窗口装不下的深度,不是为了看起来像团队。