先给结论:有些输出概率低到盲抽看不见,但部署次数远多于训练、分布会偏、还可能装乖,上线后仍可能出现一次。低概率估计要在固定前向预算里把概率算出来。重要性抽样用梯度把输入推到更容易出事的区域再重加权;激活外推在找不到正例时,用激活统计往尾部外推。两者都打赢盲抽,重要性抽样通常更好;大模型令牌交互变强,整段游走会超过独立令牌梯度。

为什么训练里「从来没发生」不能写成部署里「不会发生」

痛点是次数和分布。训练看过的输入远少于上线后会碰到的。不可接受的行为哪怕概率极低,训练也压不到部署所要求的量级。训练和部署还有偏移:对抗输入、目标泛化,都会让训练里的极稀事件变常见。装对齐是一种偏移:只在像训练的环境里表现好。若能构造一个足够宽的输入分布,给任何可能的部署输入都留一点质量,再在这个分布上做低概率估计,就有机会在训练里看见「它会不会在某种部署输入上翻脸」。看不见,不是安全,是预算不够。

设定可以先做成可测的玩具:温度零的下一个令牌,目标是某个特定令牌,输入分布暂时假设各位独立。真概率用远更多的抽样当标尺,估计方法只许花大约六万次前向。目标概率落在千万分之一到十亿分之一。盲抽几乎永远报零。真正担心的行为是长链条和工具交互,单令牌只是能把方法比出胜负的第一层;形式化行为可以更宽,例如「把输出交给另一个模型问有没有漏洞,它是否以是结尾」。

五步把尾部从「抽不到」改成「估得出、压得动」

  1. 先写清事件:输入分布、模型、输出上的布尔性质。写不清就不是估计问题。灾难检测器是一种性质;单令牌命中是更窄的一种。
  2. 重要性抽样:构造更容易出正例的建议分布,抽完用密度比还原到原分布。独立令牌梯度法按每位对目标对数的平均线性贡献重加权。令牌之间有非线性交互时,用目标对数当整段分数,Metropolis–Hastings 在输入空间走,提议分布借鉴坐标梯度,随机换一位并按梯度玻尔兹曼采样,让链往高分区域混。
  3. 激活外推:正例可能计算上找不到(像要反推哈希)。对未嵌入激活拟合分布,再在理想化分布上算性质。二次对数分解把激活拆成去相关的一块加正交补,假定独立后交叉成更多合成样本。高斯对数差把「目标对数减当前最大」当正态,解析地读尾部,当作基线。
  4. 按模型规模选方法。小模型更近线性,独立令牌梯度往往更好;更大模型交互变多,整段随机游走更好。外推整体弱于重要性抽样,但在找不到正例时仍能给出非零估计。哈希型结构是重要性抽样会输、外推仍可能对的理论例子。
  5. 估计要能当训练信号。可微就可以对估计做梯度下降,把尾部再压低。重要性抽样压尾部,本质上是找到正例再对抗训练。外推不对应任何红队样本,可能提供新的压法。只估不压,评估还没进训练。
方法 靠什么 何时更强 失败时
盲抽 原分布上的正面例子 概率不太小 预算内全是零
独立令牌梯度 每位线性贡献 小模型、弱交互 关键在两位是否相等之类
整段随机游走 目标对数 + 坐标提议 更大、更非线性 混合慢、提议太贪
激活交叉外推 不相关子空间独立 找不到正例 独立假设假
高斯对数差 一维正态尾部 只要一个基线 几乎不比常数估计好

现场有三条。其一,输入各位独立是为了让第一套方法定义清楚,真实文本不是这样。下一步要把输入换成另一个生成模型的输出。激活外推不依赖这种因子分解,可以先拿去试。其二,温度零的单令牌若真危险,上线时加过滤器就能挡。真正要估的是长生成和工具链。玩具层用来比方法,不是用来宣称最坏情况已解决。其三,更强的序贯蒙特卡洛可能抽样上再涨一截,但方向上更值得做的是逐层激活模型:重要性抽样终究要找到正例,外推才是「内部结构」这条路的试验田。

评分要用对小概率敏感的真评分规则,并且估计常报零,要先做一层校正再比。只看「报没报过正例」,会把保守的全零和瞎报的大数分不清。

若只能加一条评估:在固定前向预算下,对一组已知极稀的单令牌事件报估计,并和超预算盲抽的真值比。盲抽全零而重要性抽样有校准过的非零,才说明预算被用在尾部上了。

结论:尾部要重加权或外推,估完还要能拿去压

盲抽看不见的行为,部署仍可能碰到。重要性抽样找会出事的输入,激活外推在找不到正例时补一刀。大模型用整段游走,小模型用独立梯度。估得可微,尾部才能进训练。仍用「训练里没发生」当安全,是在用采样预算当保证。

你下次说最坏情况已经压过,先报预算内的尾部估计,不要报「抽了一万次都没有」。

效率龙虾 会带着下面这段开聊

按文章《稀有输出不能靠盲抽:重要性抽样用梯度把概率质量推到会出事的区域》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:部署次数远多于训练、分布会偏、还会装对齐时,盲抽看不到的行为仍可能出现。用梯度重加权输入,或在激活上外推,才能在六万次前向里估千万分之一到十亿分之一的事件。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是次数和分布。训练看过的输入远少于上线后会碰到的。不可接受的行为哪怕概率极低,训练也压不到部署所要求的量级。训练和部署还有偏移:对抗输入、目标泛化,都会让训练里的极稀事件变常见。装对齐是一种偏移:只在像训练的环境里表现好。若能构造一个足够宽的输入分布,给任何可能的部署输入都留一点质量,再在这个分布上做低概率估计,就有机会在训练里看见「它会不会在某种部署输入上翻脸」。看不见,不是安全,是预算不够。

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 先写清事件:输入分布、模型、输出上的布尔性质。写不清就不是估计问题。灾难检测器是一种性质;单令牌命中是更窄的一种。;2) 重要性抽样:构造更容易出正例的建议分布,抽完用密度比还原到原分布。独立令牌梯度法按每位对目标对数的平均线性贡献重加权。令牌之间有非线性交互时,用目标对数当整段…;3) 激活外推:正例可能计算上找不到(像要反推哈希)。对未嵌入激活拟合分布,再在理想化分布上算性质。二次对数分解把激活拆成去相关的一块加正交补,假定独立后交叉成更多…;4) 按模型规模选方法。小模型更近线性,独立令牌梯度往往更好;更大模型交互变多,整段随机游走更好。外推整体弱于重要性抽样,但在找不到正例时仍能给出非…

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「为什么训练里「从来没发生」不能写成部署里「不会发生」」,本文给出了什么结论?

在「为什么训练里「从来没发生」不能写成部署里「不会发生」」部分,要点是:把方法比出胜负的第一层;形式化行为可以更宽,例如「把输出交给另一个模型问有没有漏洞,它是否以是结尾」。 五步把尾部从「抽不到」改成「估得出、压得动」 先写清事件:输入分布、模型、输出上的布尔性质。写不清就不是估计问题。灾难检测器是一种性质;单令牌命中是更窄的一种。 重要性抽样:构造更容易出正例的建议分布,抽完用密度比还原到原分布。独立令牌梯度法按每位对目标对数的平均线性贡献重加权。令牌之间有非线性交互时,用目标对数当整段分数,Metro

关于「五步把尾部从「抽不到」改成「估得出、压得动」」,本文给出了什么结论?

在「五步把尾部从「抽不到」改成「估得出、压得动」」部分,要点是:是在用采样预算当保证。 你下次说最坏情况已经压过,先报预算内的尾部估计,不要报「抽了一万次都没有」。