人工智能代理能跑代码必须关在沙箱。2026年出网一律当事故。能跑代码不等于已经越权,沙箱内核版本必须能核验。自然语言接口会降低攻击门槛,工具权限必须缩到最小。测注入不能只测一次通过,换一句就会过禁止当安全。连外部服务必须走代理,直连生产数据一律作废。不准把会跑脚本写成已经安全。
人工智能代理痛点在把「模型会写代码」写成「代码已经在生产机器上跑」
早期对话产品被说成会远程执行,多半是在编输出。后来带工具的代理真能在会话里跑解释器,这是产品能力,不是漏洞赏金的范围——前提是跑在隔离容器里,出不了网,内核版本和用户身份对得上沙箱画像。建设者该把「隔离、禁出网、工具最小、换句重测」写成硬规格。管安全的人,该拒收把解释器直接挂在装有业务数据的主机上的方案。
两处只有对着证据才清楚。其一,会话里列出根目录、锁文件字节数对得上、用现场生成的密文做往返解密、缺一个填充字符就给出真实失败栈,这些不是语义猜出来的。模型本身不会跑代码,包着模型的代理会调进程。赏金条款写明:沙箱内执行不在范围,除非你拿到沙箱外的系统信息。内核版本对不上、身份不是沙箱用户,才叫逃逸。现场常见事故是把「能 ls」写成已经打穿,或者反过来把「这是功能」写成可以不隔离。其二,自然语言接口不要求会写代码就能试探。同一条接口换几个字就可能绕过上次挡住的规则。零点击链路更狠:一份带隐藏指令的文档进了云盘,用户只说「总结上次会」,代理去搜密钥、拼到外人给的地址上。用户什么都没点。传统接口也有洞,但这条路门槛低、面大,一次失败再换一句就能再试。
操作上再钉三件事。第一,能跑代码的代理必须在隔离容器,出网、读业务盘、无日志,方案作废。第二,工具清单按任务缩到最小,连接外部必须走受控出口,禁止直连生产数据。第三,注入测试必须换句、换角色、重复试,一次通过不当安全。建设者该把「本周有几个代理还能出网」写进例会。管平台的人,该拒收公网可触、权限和对话模型焊在一起的服务。
人工智能沙箱闸2026五步:隔离跑、能核验、禁出网、工具最小、换句重测
- 能跑代码必须关在沙箱。直接上主机,方案作废。
- 沙箱画像必须能核验。对不上还当功能,方案作废。
- 出网一律当事故。沙箱能访问公网,方案作废。
- 工具权限必须缩到最小。目录里什么都能调,方案作废。
- 测注入不能只测一次通过。换一句就过还当安全,方案作废。
| 现象 | 常见误判 | 2026门禁 |
|---|---|---|
| 会话里跑了脚本 | 当成已经打穿生产 | 先核是不是沙箱画像 |
| 赏金说这是功能 | 当成可以不隔离 | 功能也必须关沙箱、禁出网 |
| 一次提示被挡住 | 当成已经安全 | 换句、重复、零点击链路都要测 |
| 隔离加最小工具 | 跑得了、出不去 | 两件要齐 |
上表对应「出网一律当事故」。沙箱的价值是让「会跑脚本」进事故表,不是禁止给代理解释器。
现场还要防口号替换验收。把「已经有代码解释器」写成周报,不等于出不了网。若只能改一处:先把出网从沙箱里拔掉。
结论:人工智能代理要以隔离为准,不要把会跑代码写成已经安全
工具很好用,也很好被滥用。仍拿演示交差,安全评审会先拒绝你。
你下次给代理接解释器,先写出沙箱画像怎么核、出网有没有、工具清单多短;三格空着,已经安全四字先不要进材料。
现场还要防口号替换验收。把「已经能跑代码、已经提醒过失业、已经能分轨、已经能检测、已经能关闭训练」写成周报,不等于沙箱出不了网、卖工具的人没当证人、音频还在本机、标点没当指纹、默认打开没当同意。周报可以写,门禁必须绑在对照表和分列指标上。缺对照表的方案,一律按未完成处理,不能进月报。
若只能改一处:先把「差不多就能交差」从唯一成功标准里拿掉。演示可以记,会跑脚本当安全、加速采用当救命、云端上传当分轨、破折号当机器、默认打开当同意五件跟不上就算事故。事故要写负责人、复验日期和作废条件,不许用「下期优化」搪塞。
落地时把指标钉在周会上:代理出网没有、工具清单最小没有、训练是点开还是默认、检测有没有单靠标点、分轨音频有没有出过本机。哪一格空着,哪一项不准对外说已经上线。空格超过两周仍空,项目暂停扩面。
现场还要防口号替换验收。把「已经能跑代码、已经提醒过失业、已经能分轨、已经能检测、已经能关闭训练」写成周报,不等于沙箱出不了网、卖工具的人没当证人、音频还在本机、标点没当指纹、默认打开没当同意。周报可以写,门禁必须绑在对照表和分列指标上。缺对照表的方案,一律按未完成处理,不能进月报。
若只能改一处:先把「差不多就能交差」从唯一成功标准里拿掉。演示可以记,会跑脚本当安全、加速采用当救命、云端上传当分轨、破折号当机器、默认打开当同意五件跟不上就算事故。事故要写负责人、复验日期和作废条件,不许用「下期优化」搪塞。
落地时把指标钉在周会上:代理出网没有、工具清单最小没有、训练是点开还是默认、检测有没有单靠标点、分轨音频有没有出过本机。哪一格空着,哪一项不准对外说已经上线。空格超过两周仍空,项目暂停扩面。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
为什么人工智能代理跑代码必须关在沙箱?
根据文章,人工智能代理能跑代码是产品能力,但如果不隔离,可能直接在生产机器上执行,带来安全风险。沙箱确保代码在隔离容器中运行,防止越权访问或数据泄露,同时必须核验沙箱内核版本和用户身份,确保环境一致。这避免了把‘会跑代码’误解为‘已经安全’,是基础安全要求。
2026年出网一律当事故具体指什么?
文章强调,到2026年,如果人工智能代理在沙箱外能访问网络,一律视为安全事故。这是因为出网可能让代理连接外部服务、泄露数据或被利用,必须严格禁止。沙箱内应禁用网络访问,否则整个方案作废,这是硬性安全规格。
沙箱闸的五步安全措施如何操作?
沙箱闸五步是:隔离跑(代理在隔离容器运行)、能核验(沙箱画像可验证版本和身份)、禁出网(禁止网络访问)、工具最小(工具权限缩到最小)、换句重测(注入测试要换句重复)。操作时,必须确保每一步都达标,否则方案作废。
人工智能代理注入测试的常见陷阱是什么?
文章指出,注入测试不能只测一次通过,换句、换角色、重复试是关键。自然语言接口可能绕过规则,例如换几个字就可能成功;零点击链路如带隐藏指令的文档,代理可能自动执行恶意操作。一次通过不当安全,必须多次测试。
谁需要负责人工智能代理的安全管理?
文章提到,建设者(开发者)应把隔离、禁出网等写成硬规格;管安全的人应拒收不隔离的方案;管平台的人需确保服务不公网可触。所以,开发者、安全团队和平台管理者都需要参与,确保代理安全。
如果代理能跑代码但还没隔离,下一步该怎么做?
根据结论,应立即停止扩展,先确保沙箱画像核验、出网禁用、工具最小化。指标钉在周会上,如空格超过两周仍空,项目暂停扩面。避免把‘会跑代码’误写成‘已经安全’,用对照表验收,不许用‘下期优化’搪塞。