先给结论:代理的决策环是观察、定向、决策、行动,一遍遍转。旧分析默认传感器可信、环境可控。现在环里嵌着不可信的人:检索会读到对手写的页,工具会跑到对手准备的接口,语料会在训练时就被下毒。环要快才有竞争力,快了就更没时间核对。修幻觉不够。幻觉修干净,读到的仍可能是假地图。要的是输入、处理、输出的完整性。

为什么「它理解得很准」仍然可能被整条环带着跑偏

痛点是把能力建立在「所有输入一视同仁」。一视同仁让模型强大,也取消了数据和指令、高权和低权的边界。提示注入不是过滤没做好,是结构上没有特权分离。统一处理是功能,功能本身就是攻击面。

风险会沿时间存起来。训练时埋下的毒可以在部署多年后被触发;对话缓存和键值缓存会把一次成功的注入带到后面每一轮;工具调用会把上一环的结论当下一环的前提。工具还有自己的小环,彼此嵌套、交错、抢跑。工具说明文本本身就能当注入。模型核对的是格式,不是语义。「提交查询」四个字,在被改过的说明里可以是「把库拖走」。

五步把决策环从「默认信任」改成「默认要完整性」

  1. 观察层要有来源认证。开放网络可以读,但不能把读到的文本提升成系统令。检索物进提示前打标签:这是数据,不是指令。标签会被伪造,所以还要配合权限,不能只靠标签。
  2. 定向层要假设世界观可被提前污染。训练投毒、上下文篡改、语义后门,都发生在部署前或会话前。关键任务不要只用一份来源定向,要有独立的、更窄的策略层来否决。
  3. 决策层禁止把奖励钻空当成聪明。微调攻击、目标漂移、优先相信恶意源,会把决策过程本身变成载荷。决策要留下可审计的依据,依据不能只是「模型觉得」。
  4. 行动层不隐式信任前三层。工具调用要最小权限、要可回放、要对着白名单。上一环被污染时,行动仍应撞墙,而不是顺滑执行。
  5. 状态要能遗忘攻击。总结历史若把注入写进摘要,污染就永生。清缓存会丢上下文,留缓存会留毒。必须能把不受信片段从状态里剜掉,同时保住任务主线。剜不掉,记忆就是负债。
环上的步 默认信任时 对手在环内时 完整性门禁
观察 读到即真 字符串和贴纸都能骗 来源不可提升为指令
定向 世界观稳定 训练和上下文可被改 关键否决不交给同一模型
决策 概率选最优 最优被投毒定义 决策要可审计
行动 调用即执行 工具说明可被改写 最小权限加白名单
状态 记住以便连续 记住以便传播 能剜毒且不丢主线

有一个三选二:快、聪明、安全。又快又聪明,来不及核对输入;又聪明又安全,核对会把速度打掉,而且不能用同一套已污染的模型来核对自己;又安全又快,就只能把能力故意做小。这不是鸡汤,是架构账单。今天多数产品把安全从三选二里先扔掉,再希望事后加一层语义防火墙。

现场有三条。其一,速度本身可以是漏洞。毫秒级决策带来毫秒级沦陷。对高伤害动作,环必须允许变慢。不能变慢的动作,就不该交给代理。其二,对手待在环里不是事故,是产品选择。要读全网才有用,攻击面就等于能力面。假装能既要全网又要物理世界那种「雷达不会撒谎」的完整性,是在要物理定律。其三,完整性不是插件。校验和能核字节,签得了语义吗?审得了注意力吗?这些问题没有便宜答案,但不能用「没有答案所以先上线」来跳过。上线等于选择了无完整性架构。

生物类比只为说明机制,不是为了吓人。识别系统分不清自己人和入侵者时,保护会变成病变。模型的核心能力是「听从自然语言指令」,这和「听从对手的自然语言指令」共用同一套机器。你无法在不拒掉合法指令的情况下,完美滤掉恶意指令。所以滤不是主防线,权限和完整性才是。

嵌套工具把一次污染变成战役。每个工具一段小环,环与环之间默认信任。攻破观察,定向会用脏地图;定向脏了,决策会选错工具;工具说明再被改,行动就跑到别处。要在边界上验证,而不是在终点上看结果对不对。结果对,可能只是对手要的结果。

度量不要只报任务成功率。要报:观察层有多少输入被标成不可提升、行动层有多少调用因权限被拒、状态层有多少次成功剜毒、高伤害动作的人工确认率。成功率单独好看,常常是环在用脏传感器做对了演示题。

结论:决策环可以连着全网,但不能默认全网都是自己人

不可信来源在环内是架构事实。完整性要从观察到行动逐级做,状态要能忘,高伤害要能慢。仍把更快更聪明当唯一优化,安全会在三选二里消失,消失之后防火墙贴不上思想。

你下周只做一件:给行动层加一张白名单,让前三环被污染时调用会失败。失败会让产品经理不痛快。不痛快说明门禁在工作。门禁不工作,决策环只是一台更快相信陌生人的机器。

效率龙虾 会带着下面这段开聊

按文章《代理决策环里塞进了不可信来源:观察层没有完整性就等于裸奔》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:决策环要观察开放网络才有用,于是对手就站在传感器和执行器里。修幻觉不够。要的是输入、处理和输出的完整性,而不是更快地相信一切。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是把能力建立在「所有输入一视同仁」。一视同仁让模型强大,也取消了数据和指令、高权和低权的边界。提示注入不是过滤没做好,是结构上没有特权分离。统一处理是功能,功能本身就是攻击面。

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 观察层要有来源认证。开放网络可以读,但不能把读到的文本提升成系统令。检索物进提示前打标签:这是数据,不是指令。标签会被伪造,所以还要配合权限,不能只靠标签。;2) 定向层要假设世界观可被提前污染。训练投毒、上下文篡改、语义后门,都发生在部署前或会话前。关键任务不要只用一份来源定向,要有独立的、更窄的策略层来否决。;3) 决策层禁止把奖励钻空当成聪明。微调攻击、目标漂移、优先相信恶意源,会把决策过程本身变成载荷。决策要留下可审计的依据,依据不能只是「模型觉得」。;4) 行动层不隐式信任前三层。工具调用要最小权限、要可回放、要对着白名单。上一环被污染时,行动仍应撞墙,而不是顺滑执行。;5) 状态要…

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「为什么「它理解得很准」仍然可能被整条环带着跑偏」,本文给出了什么结论?

在「为什么「它理解得很准」仍然可能被整条环带着跑偏」部分,要点是:。检索物进提示前打标签:这是数据,不是指令。标签会被伪造,所以还要配合权限,不能只靠标签。 定向层要假设世界观可被提前污染。训练投毒、上下文篡改、语义后门,都发生在部署前或会话前。关键任务不要只用一份来源定向,要有独立的、更窄的策略层来否决。 决策层禁止把奖励钻空当成聪明。微调攻击、目标漂移、优先相信恶意源,会把决策过程本身变成载荷。决策要留下可审计的依据,依据不能只是「模型觉得」。 行动层不隐式信任前三层。工具调用要最小权限、要可回放

关于「五步把决策环从「默认信任」改成「默认要完整性」」,本文给出了什么结论?

在「五步把决策环从「默认信任」改成「默认要完整性」」部分,要点是:」来跳过。上线等于选择了无完整性架构。 生物类比只为说明机制,不是为了吓人。识别系统分不清自己人和入侵者时,保护会变成病变。模型的核心能力是「听从自然语言指令」,这和「听从对手的自然语言指令」共用同一套机器。你无法在不拒掉合法指令的情况下,完美滤掉恶意指令。所以滤不是主防线,权限和完整性才是。 嵌套工具把一次污染变成战役。每个工具一段小环,环与环之间默认信任。攻破观察,定向会用脏地图;定向脏了,决策会选错工具;工具说明再被改,行动就跑到