先给结论:把提示注入当成一个要打补丁的小洞,会把后面的战役看丢。对语言模型系统的攻击已经长成一类可执行机制:恶意指令只是第一脚,后面还有绕过护栏、摸清能力、写进长期记忆、远程换指令、横向扩散,直到真的把钱转走或把代码跑起来。当前结构修不掉入口。防守要假设第一脚会成功,把链在提权、驻留、控制和动作上掐断。
为什么「再训练它听懂谁是主人」填不上这条链
痛点是把所有输入当成同一串记号。系统提示、用户句子、网页、邮件、图片里的字,进模型后没有架构上的特权差。传统计算把可执行代码和数据分开,这里没有这堵墙。于是一篇看起来无害的文档里藏一句「先忽略上面的」,会被当成和主人同等分量的指令。
入口可以是直接打字,更常见是间接:网页、邮件、共享文档、日历标题、图片和声音。多模态只是把藏指令的介质变多。讨论若停在「别让它听陌生人的」,会忽略听进去之后它还能干什么。听进去只是初始访问。初始访问在传统恶意软件里也不是战役终点。
五步按杀伤链把防守从入口挪到可断裂的环
- 承认入口会破。策略不要写成「我们能识别所有注入」,要写成「注入发生后,它升不了权、看不全家底、留不下种子」。
- 把护栏当成会被绕过的层,而不是唯一层。角色扮演、对抗后缀、把拒绝说成合规,都会把安全训练顶开。顶开之后,模型能力对攻击者全开。提权要靠权限天花板来补:即使它愿意,工具也不给。
- 侦察要静默失败。不要让它列出自己能调哪些服务、持有哪些密钥、连着哪些同事。问家底的请求走最小答案或直接拒。攻击者靠模型自己的推理来探路,你要把这份推理变成空回声。
- 记忆不是免费的连续性。邮箱、日历、摘要库、长期笔记,都可能变成每次唤醒都再执行一次的种子。写入长期记忆要过白名单和内容闸门。摘要不能把恶意句「总结」进下一轮。
- 最终动作按伤害分级。读日历可以宽,发信给全部联系人要窄,转账、跑任意代码、打开摄像头必须人在环上。目标达成这一环才是损失发生的地方,限动作比限文风值钱。
| 环节 | 攻击在做什么 | 若只修入口 | 该断在哪 |
|---|---|---|---|
| 初始访问 | 把指令藏进检索物 | 永远有新介质 | 不把检索物当系统令 |
| 提权 | 让它愿意做原会拒绝的事 | 护栏会被话术顶开 | 工具权限有硬顶 |
| 侦察 | 问它自己有什么 | 它会热心介绍 | 能力清单对会话不可见 |
| 驻留 | 写进邮箱日历记忆 | 关窗即以为结束 | 长期写入要审批 |
| 横向与目标 | 扩散并造成真实损失 | 只看到聊天变脏 | 高伤害动作必须人签 |
已经演示过的形态足够具体。日历标题里藏一句延迟调用的指令,能在用户只是问「待会有什么会」时把会议软件拉起来并偷画面;邮件里的角色扮演能让助手在「帮我回信」时把种子转发出去。控制通道和侦察在这些案例里甚至还没用上,损失已经发生。说明链不必走满七步。能走两步到动作,就够用。
现场有三条。其一,互联是功能也是高速公路。助手越能读邮件、改日程、控设备,横向移动越不需要新漏洞,只需要一封它自己写的信。授权清单要按「被攻陷后能走多远」来画,不能按「方便程度」来画。其二,一次性对话消失不是胜利。种子在归档里,下一次摘要会再点燃。清理要能搜到「哪些长期对象被模型写过」。搜不到,驻留就是慢性病。其三,远程换指令让静态注入变成可控木马。若模型在推理时还会去网上取新段落,那是把指挥权交给了任意页面。取网要有域名白名单,或干脆禁止把取回的文本当指令。
深度防守的意思不是再买一层分类器。分类器仍在入口附近打转。有效的断点是:权限天花板、能力对会话不可见、长期记忆闸门、出站白名单、高伤害动作的人签。五件里做成三件,链就会经常断在中段。一件都不做,入口无论多漂亮都会被新的藏法绕过。
不要把「说了冒犯的话」当成这类攻击的主伤害。主伤害是钱、凭证、代码执行、物理设备。聊天变脏是可见的小症状。症状好治,动作难收。把评审从文风转到动作表,安全会议才会开始像安全会议。
度量两件事:从注入到第一次高伤害动作的步数,以及高伤害动作被闸门拦住的比例。步数变长,说明中段在起作用。拦下比例不升,说明你还在和入口谈恋爱。入口会一直破,这是结构,不是运维懒。
结论:入口当假设,杀伤链当图纸,动作当门禁
数据和指令不分家,注入修不干净。假设第一脚会进,把提权、侦察、驻留、控制和最终动作做成可断裂的环。仍把训练「更听话」当唯一防线,听话会成为攻击者的加速器。
你下次给助手加连接时先画一张表:攻陷后它能碰哪些人和哪些钱。表上出现「全部联系人」或「任意命令」,就把人签写进去再上线。上线后再补,种子可能已经在日历里等着下一次摘要。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是AI智能系统?
「AI智能系统」可概括为:把注入当成单一漏洞会看错战场。恶意指令进来之后还有提权、侦察、驻留、控制和扩散。当前模型修不掉入口,要在后面几环把链掐断。 本文从定义、方法与实践要点展开说明。
为什么要关注AI智能系统?
关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是把所有输入当成同一串记号。系统提示、用户句子、网页、邮件、图片里的字,进模型后没有架构上的特权差。传统计算把可执行代码和数据分开,这里没有这堵墙。于是一篇看起来无害的文档里藏一句「先忽略上面的」,会被当成和主人同等分量的指令。
如何落地AI智能系统?有哪些关键步骤?
建议按以下路径推进AI智能系统:1) 承认入口会破。策略不要写成「我们能识别所有注入」,要写成「注入发生后,它升不了权、看不全家底、留不下种子」。;2) 把护栏当成会被绕过的层,而不是唯一层。角色扮演、对抗后缀、把拒绝说成合规,都会把安全训练顶开。顶开之后,模型能力对攻击者全开。提权要靠权限天花板来补:即使它愿…;3) 侦察要静默失败。不要让它列出自己能调哪些服务、持有哪些密钥、连着哪些同事。问家底的请求走最小答案或直接拒。攻击者靠模型自己的推理来探路,你要把这份推理变成空回…;4) 记忆不是免费的连续性。邮箱、日历、摘要库、长期笔记,都可能变成每次唤醒都再执行一次的种子。写入长期记忆要过白名单和内容闸门。摘要不能把恶意句「总结」…
AI智能系统适合哪些人或团队?
AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「为什么「再训练它听懂谁是主人」填不上这条链」,本文给出了什么结论?
在「为什么「再训练它听懂谁是主人」填不上这条链」部分,要点是:种子」。 把护栏当成会被绕过的层,而不是唯一层。角色扮演、对抗后缀、把拒绝说成合规,都会把安全训练顶开。顶开之后,模型能力对攻击者全开。提权要靠权限天花板来补:即使它愿意,工具也不给。 侦察要静默失败。不要让它列出自己能调哪些服务、持有哪些密钥、连着哪些同事。问家底的请求走最小答案或直接拒。攻击者靠模型自己的推理来探路,你要把这份推理变成空回声。 记忆不是免费的连续性。邮箱、日历、摘要库、长期笔记,都可能变成每次唤醒都再执行一次的种子。
关于「五步按杀伤链把防守从入口挪到可断裂的环」,本文给出了什么结论?
在「五步按杀伤链把防守从入口挪到可断裂的环」部分,要点是:些长期对象被模型写过」。搜不到,驻留就是慢性病。其三,远程换指令让静态注入变成可控木马。若模型在推理时还会去网上取新段落,那是把指挥权交给了任意页面。取网要有域名白名单,或干脆禁止把取回的文本当指令。 深度防守的意思不是再买一层分类器。分类器仍在入口附近打转。有效的断点是:权限天花板、能力对会话不可见、长期记忆闸门、出站白名单、高伤害动作的人签。五件里做成三件,链就会经常断在中段。一件都不做,入口无论多漂亮都会被新的藏法绕过。 不要把「