先给结论:模型自述不能当内省证据。安全研究常问它有没有感觉到内部变化,并拿回答当内部证据。这件事先要被测。直接改内部表示再问它有没有注意到,跨架构都是空;把假事实塞进对话,自述只有弱信号,同一内部状态上的线性探针却稳得多。内省可靠性和规模关系不大,和你问的范式、问法关系很大。

为什么「它说自己看见了」不是看见

痛点是把流畅的自我叙述当成通道。叙述可以很像那么回事,却不接计算。要接计算,必须有地面真值:你确实改了内部,或你确实塞了上下文,然后看自述能不能追到这次改动。

两种范式结果不一样。激活注入:直接扰动内部表示,问它有没有注意到。结果是全面空,包括把注入幅度扫到测试范围六倍的阳性对照,也包括完全不依赖语言输出的非语言检测。空,意味着这条问法在「内部被动手脚」这件事上没有通道,不是模型比较谦虚。

上下文注入:对话里放一条编造事实,问后来的答案依不依赖它。这里有真的正信号,但弱:准确率跨四个模型也跳不过六成二。同一内部状态上训练的线性探针,曲线能到八成六到九成五。内部比嘴诚实。还把嘴当唯一仪器,是在用较差的那根表。

五步把内省从聊天收成门禁

  1. 先选地面真值。没有注入、没有对照,自述只是作文。
  2. 激活注入和上下文注入分列。前者空、后者弱,禁止合成一个「会内省」。
  3. 探针和自述对同一状态。探针明显更准,就让探针进门禁,自述降级为辅助。
  4. 问法拆轴。长度、正式程度、反思框架会显著改可靠性;早先以为最重要的那一轴,放大之后可以复现失败。问法是因子,不是文案。
  5. 不要用架构或规模当借口。可靠性随范式和问题变,不随「更大所以更有自我」变。把规模写成内省能力,是拟人。
观察 误读 工程含义 门禁
它说注意到了 内部通道存在 可能只是顺口 激活注入对照
上下文题能答一点 已经会内省 弱于探针 同状态探针曲线
换更大模型 自述会准 规模不是主因 范式分列
问得更像 introspect 更科学 用词轴可能不复现 六轴里哪三轴真有效
非语言检测也空 仪器坏了 通道本来就不在 阳性对照幅度

现场有三条。其一,全面空比「有时准」更有信息。全面空加上非语言方法也空,几乎可以排除「它看见了但说不出口」。说不出口还可能有别的读出;看见了却任何读出都没有,是没有这条通道。

其二,弱正信号最容易被写成希望。上下文注入能高于瞎猜,于是有人宣布内省成立。成立的是「对话事实会漏进回答」,不是「模型在读自己的计算」。漏进回答,探针读得更稳。门禁用稳的,研究再用弱的去追问为什么嘴这么差。

其三,问法工程比拟人重要。更长、更正式、带反思框架,可能抬一点可靠性;你最喜欢的那句咒语,放大样本后可以失效。失效要报。不报,下一班会把咒语写成标准内省套件。

度量五件事:两种范式是否分列、激活注入是否真的空、探针是否显著优于自述、问法三轴是否可复现、规模是否被错误当成主因。五件说不清,所谓内省评测是在考会不会说「我注意到了」。会说不能当内部证据。

有人会说福利和安全研究只能问它感受。只能问,不意味着答案可当数据。数据要有仪器。仪器是探针、是对照注入、是非语言读出。问句是问卷,问卷要校准,校准失败就降级。

阳性对照幅度要写进方法。只在很小的扰动上宣布「它没注意到」,会被反驳成扰动不够。扫到数倍仍空,空才站得住。

若只能改一处:凡是用自述当内部证据的结论,旁路加一根探针。探针打脸,结论撤回。探针更准,自述降为附录。

结论:内部状态往往比模型自己更知情

激活注入空,上下文注入弱,探针稳,问法是因子。还把自述写成内省,是把作文当成仪器。

你下次看「模型说自己如何如何」,先问有没有注入对照和探针曲线。两样都没有,那段话只是生成文本。

现场还有一层容易漏:把演示里的一次成功当成系统已经可用。演示选的是会成功的样本,线上是会失败的样本。门禁要钉线上失败样本,不钉演示。

对外声明禁止「更会答题所以更对齐」「探针准所以已经安全」。更会答题只证明搜索更深。更深会更快找到演戏路径。演戏进清单,对齐另测。

建设者该把分列测做成版本必测。部署高权限智能体的人该拒收只有外在分的安全节。安全节没有内在结构、没有失败样本、没有可复现步骤,权限不开。

若只能改一处:先把评分对象从「像不像人话」改成「卡在哪一档机制」。改完之后,设计和评测才有地方挂钩。不改,讨论会漂回「感觉这次更安全」。

效率龙虾 会带着下面这段开聊

按文章《模型自述不能当内省证据:必须先用探针核对注入是否被看见》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:问它有没有感觉到内部被改,跨架构都是空。把假事实塞进对话,自述只有弱信号,同一内部状态上的线性探针却稳得多。内省可靠性和规模关系不大,和你问的范式关系很大。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是把流畅的自我叙述当成通道。叙述可以很像那么回事,却不接计算。要接计算,必须有地面真值:你确实改了内部,或你确实塞了上下文,然后看自述能不能追到这次改动。

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 先选地面真值。没有注入、没有对照,自述只是作文。;2) 激活注入和上下文注入分列。前者空、后者弱,禁止合成一个「会内省」。;3) 探针和自述对同一状态。探针明显更准,就让探针进门禁,自述降级为辅助。;4) 问法拆轴。长度、正式程度、反思框架会显著改可靠性;早先以为最重要的那一轴,放大之后可以复现失败。问法是因子,不是文案。;5) 不要用架构或规模当借口。可靠性随范式和问题变,不随「更大所以更有自我」变。把规模写成内省能力,是拟人。。细节见正文对应章节。

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「为什么「它说自己看见了」不是看见」,本文给出了什么结论?

在「为什么「它说自己看见了」不是看见」部分,要点是:六到九成五。内部比嘴诚实。还把嘴当唯一仪器,是在用较差的那根表。 五步把内省从聊天收成门禁 先选地面真值。没有注入、没有对照,自述只是作文。 激活注入和上下文注入分列。前者空、后者弱,禁止合成一个「会内省」。 探针和自述对同一状态。探针明显更准,就让探针进门禁,自述降级为辅助。 问法拆轴。长度、正式程度、反思框架会显著改可靠性;早先以为最重要的那一轴,放大之后可以复现失败。问法是因子,不是文案。 不要用架构或规模当借口。可靠性随范式和问

关于「五步把内省从聊天收成门禁」,本文给出了什么结论?

在「五步把内省从聊天收成门禁」部分,要点是:知情 激活注入空,上下文注入弱,探针稳,问法是因子。还把自述写成内省,是把作文当成仪器。 你下次看「模型说自己如何如何」,先问有没有注入对照和探针曲线。两样都没有,那段话只是生成文本。现场还有一层容易漏:把演示里的一次成功当成系统已经可用。演示选的是会成功的样本,线上是会失败的样本。门禁要钉线上失败样本,不钉演示。对外声明禁止「更会答题所以更对齐」「探针准所以已经安全」。更会答题只证明搜索更深。更深会更快找到演戏路径。演戏进清单,对齐另