先给结论:积分梯度的基线不是可有可无的超参,它定义了「特征缺失长什么样」。路径从基线走到当前输入,沿途累加梯度。全黑基线会对黑色像素失明,因为与基线相同的坐标重要性恒为零。血糖为零不是「没测到」而是要命。缺失该用分布来建模,对训练分布做期望梯度。热力图好看不等于解释对了。

为什么「默认全零」会把真正致命的特征抹掉

痛点是深度学习里没有现成的「缺席」。合作博弈里,参与者可以在联盟里或不在;模型输入必须给一个数。基线就是被拿来扮演缺席的那个输入。积分沿直线路径累加局部梯度,再乘上「现值减基线」。这一乘保证了完备性:所有特征重要性加起来等于输出差。完备性对任何基线都成立,所以它不能帮你选基线,只能帮你检查离散积分有没有收敛。

饱和是必须走路径的原因。网络在真实图像附近往往已经把正确类推平,输入处的梯度接近零,哪怕模型极度依赖这些像素。从「什么都没看见」的基线走到饱和点,才能看见哪些像素在爬坡阶段贡献最大。实践里用几百个等分点近似积分,并用完备性残差当收敛门禁。残差相对输出还很大,就加点数。收敛和基线是两件事:点再密,选错的缺失定义也不会自己变对。

五步把基线从习惯收成可声明的缺失假设

  1. 先把缺失写成一句话。常数颜色、最大距离图像、模糊、均匀噪声、高斯噪声、训练分布,各自对应不同假设。写不出来,禁止跑积分梯度。
  2. 禁止用与任务有含义的常数。表格里的零、图像里的黑,常常是合法甚至极端的真实值。与基线相同的坐标,重要性被公式钉死为零。换一种常数颜色,失明的就是那种颜色。这不是实现 bug,是定义。
  3. 单张随机基线会留下抽样伪影。从同一分布抽多条路径再平均,等于把分布本身当缺失。高斯基线的期望梯度与「平滑梯度」很像,差别是乘的是噪声而不是「输入加噪声」,并且沿路径均匀采样而不是只采端点。独立高斯还暗含像素独立,会拆掉邻域相关,热力图更干净,但是在用一种你知道为假的独立假设换平滑。
  4. 优先用训练分布当缺失。监督学习已经假设训练和测试来自同一分布,用训练集当抽样是最不另加故事的做法。代价是收敛更慢:要对路径和基线做双重期望,同样点数往往不如单基线贴完备性。这是在用计算换「对某种颜色失明」。
  5. 评审不要靠「是否圈出了物体」。诱饵数字可以把类别写进边角或噪声强度,边检测加平滑在人眼里更像解释,真正被模型用的是诱饵。消融测试会把输入推到训练分布外,分不清掉点是因为删对了特征还是因为分布漂了。重训消融更接近「对数据重要」而不是「对该模型重要」。报告必须声明你要忠于模型还是忠于数据。
基线 缺失假设 典型失败 门禁
常数黑 / 全零 该值代表缺席 对基线色或零失明 有含义的常数禁止
最大距离图像 尽量远离现值 不含「缺信息」,只是反色 不能当缺席
模糊 去掉高频即缺席 偏爱标高频像素 要声明频率偏置
噪声分布平均 未知像素来自该分布 分布选错;独立假设假 必须多样本
训练分布期望 缺失=从数据再抽一张 收敛慢 优先,并报完备性残差

现场有三条。其一,完备性不能当选基线的裁判。任何基线都能把输出差拆完,拆完只说明算术对,不说明缺失有意义。其二,定性好看会奖励「像人一样看物体」的方法,包括与模型无关的边检测。随机初始化的网络和准确率很高的网络,在某些改过的数字数据上可以画出几乎一样的期望梯度图——因为标签被写进了像素统计。参数随机化测试有用,但不是全部。其三,顶 k 消融里,训练分布和均匀分布往往掉得更快;质量中心消融大家差不多,因为物体本来就常在画面中间,随机热力图也能蒙对中心。消融方式最好和缺失定义匹配:用模糊当基线,就该用模糊来删,否则是在拿两种缺失对打。

路径归因只是解释家族里明确需要基线的一支。扰动删除、参考激活传播、局部代理,都在用某种缺席。不把缺席说清楚,解释比较的是不同的问题。定量评价至今没有像测试集那样的金标准,因为我们本来就不知道网络在做什么。

若只能改解释配置一处:把默认全黑基线改成对训练分布的期望梯度,并在图旁写「缺失=从训练集再抽」。仍用全黑又不声明失明色,热力图不能进评审。

结论:基线是缺失定义,不是调色板

积分梯度沿路径累加,乘上与基线的差。差为零的坐标永远不被看见。常数基线会失明,分布基线用计算换盲区。好看的热力图可以完全不反映模型。仍把全黑当自然选择,是在用习惯代替假设。

你下次交归因图,先写缺失假设、样本数和完备性残差。写不出假设,重要性分数就不能当证据。

效率龙虾 会带着下面这段开聊

按文章《积分梯度的基线不是装饰参数:它定义了「缺失」,选错颜色就看不见》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

积分梯度的基线到底是什么?

基线在积分梯度中不是可选的超参数,而是定义了特征缺失的表示。从基线走到当前输入,沿途累加梯度,基线扮演缺席的角色。如果基线选择不当,会导致对某些特征失明,比如全黑基线会使黑色像素的重要性为零,因为差值恒为零。基线必须声明缺失假设,否则解释无效。

为什么默认全零基线会把真正致命的特征抹掉?

全零基线会导致与基线相同的坐标重要性为零,因为积分梯度乘以现值减基线的差,差为零时特征不被看见。例如在图像中,全黑基线对黑色像素失明,如果黑色像素是关键特征,模型就会忽略它,就像血糖为零不是没测到而是要命。这会使重要特征被抹掉。

如何正确选择积分梯度的基线?

文章建议五步:先将缺失写成一句话;禁止使用与任务有含义的常数;避免单张随机基线,应从同一分布抽多条路径平均;优先用训练分布当缺失;评审时声明缺失假设。例如,用训练集当基线是最不另加故事的做法,但收敛更慢,需要计算完备性残差。

选择积分梯度基线时有哪些常见陷阱?

常见陷阱包括:使用常数黑或全零基线,这会导致对特定颜色失明;最大距离图像不含缺信息,只是反色;模糊基线偏爱高频像素,需声明频率偏置;噪声分布基线分布选错,且独立假设可能假;训练分布基线收敛慢,必须报完备性残差。这些错误会使解释不可靠。

完备性能不能作为选择基线的标准?

不能。任何基线都能满足完备性,即所有特征重要性加起来等于输出差,但这只保证算术正确,不说明缺失有意义。完备性残差可以用来检查积分收敛,但不能帮助选择基线。选错基线,即使完备性成立,解释也可能错误,因为基线定义缺失方式不同。

评审积分梯度解释时应该怎么做?

评审时不要只靠是否圈出了物体,因为热力图好看不等于解释正确,可能只是边检测效果。必须声明缺失假设、样本数和完备性残差。优先使用训练分布基线,并在图旁写明缺失定义,如「缺失=从训练集再抽」。写不出假设,重要性分数就不能当证据。