先给结论:对齐若靠「做灾难检测器,再对抗训练把打到的输入压下去」,会卡两处。检测器会被更强模型骗;即便完美,期望也抽不到——事件太稀,随机抽样慢到用不了。出路是按网络结构做机械估计:有解释时,相同算力下最差打平抽样,有结构的训练网络上才应明显胜过。解释要跟训练并行长,时间和找参数同量级,税才付得起。
为什么「再多抽一点」解决不了稀有灾难
痛点是期望算不出来。对抗训练要优化输入分布去抬灾难率,同时优化模型去压灾难率。两边都要算检测器在模型输出上的期望。随机抽,百万分之一要百万次前向,三个独立条件合取到百万分之一的三次方,抽样会爆。若能看结构:检测器是三个谓词的合取,且在该输入分布上近似独立,期望就是三个边际的乘积。三次百万次代替十万亿次。结构比这复杂,但方向一样:先找到「为什么会是这个期望」,再算,而不是从样本里猜存在一个理由。
机械估计和抽样的差别要写死。抽样是归纳:这一百个输入全是一,就报一,默认它们代表没抽到的。机械估计是演绎:没有结构证据表明这一百个能外推,就只能把已知的一百个算进去,其余按解释所允许的默认来。若模型真的处处为一点,应存在一段短解释说明这件事;没给这段解释,估计器不许偷用「样本很齐」去报一。这才叫按结构推理,而不是换皮抽样。
五步把「比抽样更好」写成可验收的估计门禁
- 先固定要估的量:输入分布上,检测器打在模型输出上的期望。量写不清,白盒项目会滑成普通可解释。
- 估计器必须机械。允许逐层矩、累积量、低阶多项式逼近;不允许「抽一批再平均」当主算法。启发式:主路径尽量不靠伪随机样本,除非解释明确说这一块只能穷举。
- 最差情况打平抽样。同样时间(约 1/ε² 次前向),均方误差不超过抽样的方差尺度。有结构时应明显更好。只在玩具分布上好看、随机网络上惨败,说明还在吃特殊结构,不是一般方法。
- 解释长度不超过参数量级,并且能找。存在一段解释不够;要有和训练同量级时间的解释算法,看着优化过程把结构砌起来。找解释和找参数一样贵,税大约一倍,这比灾难便宜。
- 解释不能只写答案。否则解释就是把期望抄进去。要能回答一类非对抗的上下文问题,随机上下文上的误差仍打平抽样。只会报一个数字,解释是作弊。
| 做法 | 能估什么 | 估不到什么 | 门禁 |
|---|---|---|---|
| 随机抽样 | 不太稀的平均行为 | 训练里几乎不出现的灾难 | 禁止当唯一估计 |
| 结构合取 / 独立分解 | 可分解的极小概率 | 强相关的谓词 | 独立假设要可检查 |
| 机械估计 + 解释 | 有结构时的期望与尾部 | 解释没覆盖的随机性 | 误差和运行时间对标抽样 |
| 训练并行解释 | 跟得上 SGD 砌出来的结构 | 训练没经过的对抗参数 | 解释时间 ≤ 训练时间量级 |
| 只报一个数字的「解释」 | 该数字本身 | 任何新上下文 | 禁止当解释 |
现场有三条。其一,匹配抽样不是认输。无结构或结构就是「一千零二十四个几乎随机的小计算」时,机械估计只能略好于抽样。训练网络通常不是这种最坏情况,匹配是为了在最坏情况下不崩,好情况再赢。其二,随机多层感知机、随机半空间交、训练过第二层的两层网络,是在把原则落到能证能测的实例上。宽随机网络上累积量传播已能和抽样竞争;更深、有共享权重的循环网络会难得多,因为随机里也能长出结构。其三,灾难检测器仍可能被骗。白盒估计解决的是「算得动期望」,不是「检测器不会被愚弄」。两件事要分开排期,焊在一个口号里会假装已经对齐。
对抗训练若用机械估计代替抽样,红队输入分布可以针对结构去抬灾难率,而不必真的抽到灾难样本。这和「找不到正例就没法对抗训练」是同一缺口的两面。估计可微时,还可以直接对估计做梯度下降,把尾部再压低。现场还要防一件事:机械估计若偷偷在内部抽样,只是换皮。主路径必须走结构;只有解释明确写「这一块只能穷举」时才允许局部抽样。验收时把随机种子打掉,数字仍应稳定,才说明不是在吃样本运气。
若只能改评估栈一处:给灾难率加「抽样估计」和「机械估计」两列,并写清算力预算。机械估计不比抽样好、也说不清结构,就还不能把对抗训练建立在这个期望上。
结论:稀有灾难要靠结构来算,解释要跟训练一起长
抽样对常见行为够用,对一次都不能发生的灾难不够。机械估计按解释演绎,最差打平抽样,有结构时才该明显胜过。解释跟训练并行、长度和参数同量级,税才付得起。仍只靠抽到再压,等于假设灾难会在训练里露面。
你下次写对抗训练,先问灾难期望是抽的还是按结构算的。只会抽,方案就还停在检测器完美且事件不够稀的世界里。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是白盒估计(机械估计),它如何用于灾难概率计算?
白盒估计也叫机械估计,是基于网络结构进行演绎推理的方法,用于计算灾难概率。它分析检测器和模型的结构,而不是依赖随机抽样。例如,如果检测器是三个谓词的合取且近似独立,期望可以分解为边际乘积,从而在相同算力下更高效。有解释时最差打平抽样,有结构时明显胜过。
为什么随机抽样在计算稀有灾难概率时效率低下?
因为稀有灾难事件概率极低,比如百万分之一,随机抽样需要大量前向计算才能捕获。如果三个独立条件合取概率为百万分之一的三次方,抽样次数会爆炸式增长,导致算力无法承受,所以再多抽一点也解决不了问题。
如何将机械估计应用到对抗训练中以替代随机抽样?
在对抗训练中,可以用机械估计代替抽样来计算灾难期望。首先固定估计量,确保估计器机械如使用逐层矩方法,避免主路径依赖伪随机样本。最差情况打平抽样,有结构时明显更好。解释要与训练并行生长,长度不超过参数量级,并能回答随机上下文问题。
使用机械估计时有哪些常见陷阱需要避免?
要避免机械估计偷偷内部抽样,这会导致换皮;主路径必须走结构,只在解释明确要求时允许局部抽样。验收时打掉随机种子数字应稳定。另外,灾难检测器仍可能被骗,需分开处理,不能焊在一个口号里假装已对齐。
机械估计与随机抽样在算力和准确性上有什么区别?
机械估计是演绎方法,基于结构证据推理;抽样是归纳方法,依赖样本外推。同样算力下,机械估计最差打平抽样的均方误差,有结构时明显更好。抽样对常见行为够用,但对一次都不能发生的灾难不够,且事件太稀时效率低下。
文章中提到的五步验收估计门禁包括哪些内容?
五步门禁是:先固定要估计的量,确保估计器机械如使用逐层矩,最差情况打平抽样,解释长度不超过参数量级且可找,解释不能只写答案需能处理随机上下文。这确保了机械估计的有效性,防止滑成普通可解释。