先给结论:若能看懂网络内部,就该能验证它在没见过的输入上会不会做危险的事。用人话写电路图做不到,完整形式证明在大模型上也会先垮。要把机械可解释和验证合成启发式解释:不必给人读懂,但要能量质量。意外记账就是这把尺——解释没覆盖的惊讶必须入账,账清了才许拿去估分布外和异常。紧凑证明是跳板不是终点。
为什么「再做一个可证的小网络」推不到上线模型
痛点是保证的形态。形式验证要的是:对所有输入,性质成立。深度一加、宽度一变,现有白盒方法就会从「宽随机多层感知机上赢过黑盒」变成失效。训练网络比随机网络更有结构,也更不像可以穷举的电路。可解释若停在「人能讲一个故事」,故事在分布外没有误差条。需要的是算法能消费的解释:和网络一样大也没关系,人看不懂也没关系,只要估计器拿着它能把期望、尾部、异常算到和抽样打平或更好。
启发式解释承认自己不完备。它会做独立性假定、丢掉高阶累积量、用低阶多项式代替指示函数。这些近似会漏掉真惊讶。意外记账把漏掉的部分写成账:观察到的行为和解释预测之间的差,必须能被「还没写进解释的结构」或「允许的随机性」接住。账接不住,解释就还没写完。账清了,才谈得上用这份解释去做分布外预测——因为分布外无非是另一组输入,解释若真抓住了机制,惊讶不该突然爆掉。
五步把解释从故事收成可记账的对象
- 禁止把「人能讲通」当验收。验收是:给定解释,估计器在约定预算内打平或胜过抽样,并且在解释声称不依赖的变换下预测稳定。
- 每条解释写明假定:哪一层被当成高斯、哪两块被当成独立、哪一阶以上被丢掉。假定就是账本上的负债,分布一偏就要重测。
- 意外入账。训练损失远低于随机网络,这是必须被解释的惊讶。解释若只说「梯度下降会降损失」而给不出可计算的预测,账就还挂着。局部上,某类输入上的相关若被说成滑翔机,就要能把巧合造成的相关从机制造成的相关里拆开。
- 紧凑证明当跳板。能对小模型给出性能的形式证明,说明机制可以被压缩成证书。大模型上不要把「可证」当路线图终点,而要把证书里用到的分解,迁到启发式估计里继续用。
- 解释跟任务走:尾部估计、异常检测、灾难期望,各要能消费同一份结构描述。只会生成热力图、不会进入估计器的解释,当可视化,不当安全证据。
| 形态 | 给人什么 | 给算法什么 | 上线能否当证据 |
|---|---|---|---|
| 人话电路图 | 局部直觉 | 几乎没有 | 不能 |
| 完整形式证明 | 确定性保证 | 证书 | 小模型可以,大模型会垮 |
| 启发式解释 + 记账 | 不必读懂 | 可计算的预测与剩余惊讶 | 账清了才能 |
| 紧凑性能证明 | 跳板 | 可迁移的分解 | 单独不够 |
| 抽样平均 | 经验频率 | 无结构 | 稀有事件不够 |
现场有三条。其一,剩余惊讶要有单位。不能只说「还有点不准」。用和抽样相同的误差尺度,才能判断解释是不是真的在省算力。其二,独立性假定最容易在部署时炸。训练分布上不相关的两块激活,对抗输入上会相关。记账要包含「假定被打破时预测怎么坏」,而不是假定永远成立。其三,解释可以大到和网络一样。压缩是好事,但不是验收条件。验收是估计质量,不是篇幅。
把可解释和验证合成一条线,是为了问分布外会不会突然换机制。只做可解释,没有预测;只做验证,没有规模。启发式解释是两者都能活下来的中间物。
记账的最小单位建议写成三条:这条解释预测了什么可观测的量、预测和观察差了多少、差被记到哪一条假定上。差若反复落在同一条假定,就优先改那条,而不是再写一段故事。差若均匀散开,可能是随机性额度不够,该把允许的噪声写进解释,而不是假装网络是确定性电路。这样评审才有下一动作,而不是停在「看起来有道理」。紧凑证明迁到启发式时,迁的是分解不是定理语句。哪一层被当成近似线性、哪一组权重被当成低秩、哪一种对称被当成近似独立,这些才是能进估计器的零件。定理本身在宽度一变就会失效;零件还可以继续用,只要记账跟着走。
若只能改解释评审一项:要求每份解释附一张意外表,列出它解释了哪些惊讶、还剩哪些、用什么实验关闭。表是空的,解释就还是故事。
结论:大模型上要记账的启发式,不要不可扩展的证明
人话电路图验不了上线。完整证明会先在规模上垮。启发式解释加上意外记账,才能量「这份结构够不够用」。紧凑证明贡献分解,不贡献终点。仍把热力图当安全证据,分布外一偏就会变成另一种机制。
你下次交内部解释,先把意外表填完。填不完,就还不能用它去估没抽到的输入。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
为什么大网络不应该追求可证保证?
因为完整形式证明在大模型上会先垮。深度一加、宽度一变,现有白盒方法就会失效;训练网络比随机网络更有结构,不像可以穷举的电路。所以,大模型上要记账的启发式解释,而不是不可扩展的证明,这样才能量得动解释质量。
什么是启发式解释,它和完整证明有什么区别?
启发式解释承认自己不完备,会做独立性假定、丢掉高阶累积量、用低阶多项式近似。它不追求确定性保证,而是提供可计算的预测和剩余惊讶账。完整证明在大模型上不可扩展,而启发式解释加意外记账能用于分布外预测和异常检测。
如何把解释从故事收成可记账的对象?
文章提到五步:禁止把“人能讲通”当验收;每条解释写明假定,如哪层被当成高斯或独立;意外入账,计算观察行为和解释预测的差并记录;紧凑证明当跳板,迁分解到启发式估计;解释要跟任务走,能用于尾部估计、异常检测等。
意外记账在评估解释质量中起什么作用?
意外记账是量解释质量的尺。它把解释没覆盖的惊讶写成账:观察行为和解释预测的差,必须能被未解释的结构或允许的随机性接住。账清了,才能用解释去做分布外预测;否则解释还不完整,无法验证机制是否抓住了核心。
紧凑证明在大模型安全验证中扮演什么角色?
紧凑证明是跳板,不是终点。它能对小模型给出性能的形式证明,说明机制可被压缩成证书。在大模型上,要把证明里用到的分解迁移到启发式估计中继续用,而不是追求不可扩展的证明,因为分解零件还能用,只要记账跟着走。
在部署时,独立性假定容易导致什么问题?
独立性假定最容易在部署时炸。训练分布上不相关的两块激活,在对抗输入上会变得相关。记账要包含假定被打破时预测怎么坏,而不是假定永远成立;否则解释可能在分布外失效,导致安全风险。