先给结论:深度网络的损失面不是一口口互不相通的深坑。梯度下降找到的低损失解,常常能用分段折线连起来,沿途几乎还是低损失。过参数化本身不够:两层就能造出全局最小互不相通的数据集。真正用得上的是训练解的稳定性——能丢掉一半节点或扛住层输出噪声还不崩。直线插值会把一家的顶层接到另一家的底层,拼出人头马。

为什么「坑与坑不相通」这张想象图是错的

痛点是景观被画成随机初始化掉进最近的坑,坑底互不相通,要换坑就得翻过高损失山脊。经验上,两个近最优之间往往存在简单路径:两段折线或一条贝塞尔曲线,沿途损失几乎不升。这很反直觉。就算两层线性网络,参数空间的直线对应把两套权重做凸组合,中间项等于把一个网络的顶层接到另一个的底层,一般会是胡说的函数。要给五十层、真实数据上的连通写证明,看起来像在证明人头马也低损失。早期解释只覆盖极度冗余的两层网,隐层数可能要大于样本数,和实际训练差太远。

更关键的是:相对某个真网络过参数化,仍不够。存在数据集,两层、两个隐单元就能完美拟合,但把隐单元加到任意 h,全局最小集合仍然不连通。所以不能靠「参数比任务多」当连通的充分条件。要解释为什么标准训练经常看见连通,必须用「典型训练解」才有的性质,而不是任意全局最小都有的性质。

五步把连通从现象收成可验证的折线

  1. 先测稳定性,再谈路径。丢弃稳定:存在一种去掉一半节点、剩下的加倍的方式,损失最多升 ε。噪声稳定:往某层输出加相当大的高斯噪声,更高层几乎拒掉。噪声稳定能推出一种丢弃稳定。两条都测失败,定理不保证连通,经验上有时仍能找到路,那是别的性质,不要冒充已经证明。
  2. 禁止用参数直线当默认连接。直线几乎必然经过人头马。路径要分段,每段尽量只动一层。
  3. 丢弃稳定的构造:先把网络连到它的丢弃版(一半节点关掉),再在两个丢弃版之间走,因为两边都有大量失活单元当缓冲区。三层例子里,权重写成左右块。顶层损失对顶层权重凸,可以在只差顶层的两个网络之间插值;某组节点的输出权重已经是零,其输入权重可以任意改而不改网络输出。交替这两种步,就能一层层把右半边清掉。段数随层数线性增长。
  4. 噪声稳定更强:路径可以压到至多十条折线,与深度无关。代价是性质更强,参数不太多的解常常达不到定理要求的稳健,但经验上仍连通。卷积要用通道级丢弃;普通丢弃训练出的网络不一定通道稳定。
  5. 把连通用到训练,而不是只当景观故事。若低损失区域是一片连着的,沿路径做平均、做快照集成、做模式之间的迁移,才有几何根据。两点之间仍要翻山,就不要假装可以线性插值权重。
假设 能推出什么 推不出什么 门禁
任意过参数化 拟合能力 最小解连通 禁止当连通证明
参数直线插值 一条曲线 沿途低损失 默认禁止
丢弃稳定 段数随层数线性的折线 常数段数 先测再连
噪声稳定 至多十条折线 卷积通道自动稳定 卷积要通道级测
只看经验贝塞尔 存在某条路 任意两点、任意架构 当现象,不当定理

现场有三条。其一,损失函数要对最后一层输出凸,交叉熵和均方都满足;证明里用的就是这一点来给顶层插值封顶。换非凸的输出损失,这段要重写。其二,丢弃稳定说的是「存在一种去掉一半的方式」,不是训练时随机丢弃。训练用了丢弃,不自动等于成品满足定义。其三,经验上参数不太多时稳健性不够,路却还能找到。定理给的是充分条件,不是必要条件。缺的是更弱、仍够用的性质,以及怎么用连通来改优化,而不是再画一张彩色损失面。

人头马这一步必须写进工程清单:任何「把两个检查点做权重平均」的操作,都要先问中间点是不是人头马。模式连通给出的折线,正是在用失活通道当缓冲区,避免顶层接到别人的底层。

若只能改训练后处理一处:禁止对两个随机初始化的解做直线权重平均。先检查丢弃或噪声稳定,再沿分段折线平均。直线平均掉点,优先怀疑人头马,而不是学习率。

结论:连通靠的是训练解的平坦,不是坑的数量

低损失解能连,是因为典型训练解扛得住丢弃和噪声,可以一层层清掉一半节点再汇合。过参数化不够,直线不够。仍把景观画成互不相通的深坑,是在用未训练的最小值集合代替训练轨迹上的解。

你下次做检查点平均,先问两点之间的路径有几段、沿途损失升了多少。说不清,平均就不能当集成。

效率龙虾 会带着下面这段开聊

按文章《低损失解往往能用折线连起来:丢弃稳定就够,不必爬过高损失山脊》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:过参数化不够保证连通。典型训练解能丢掉一半节点还不崩,就能用分段折线连到另一个低损失解,沿途损失几乎不升。直线插值会拼出人头马。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是景观被画成随机初始化掉进最近的坑,坑底互不相通,要换坑就得翻过高损失山脊。经验上,两个近最优之间往往存在简单路径:两段折线或一条贝塞尔曲线,沿途损失几乎不升。这很反直觉。就算两层线性网络,参数空间的直线对应把两套权重做凸组合,中间项等于把一个网络的顶层接到另一个的底层,一般会是胡说的函数。要给五十层、真实数据上的连通写证明,看起来像在证明人头马也低损失。早期解释只覆盖极度冗余的两层网,隐层数可能要大于样本数,和实际训练差太远。

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 先测稳定性,再谈路径。丢弃稳定:存在一种去掉一半节点、剩下的加倍的方式,损失最多升 ε。噪声稳定:往某层输出加相当大的高斯噪声,更高层几乎拒掉。噪声稳定能推出…;2) 禁止用参数直线当默认连接。直线几乎必然经过人头马。路径要分段,每段尽量只动一层。;3) 丢弃稳定的构造:先把网络连到它的丢弃版(一半节点关掉),再在两个丢弃版之间走,因为两边都有大量失活单元当缓冲区。三层例子里,权重写成左右块。顶层损失对顶层权重…;4) 噪声稳定更强:路径可以压到至多十条折线,与深度无关。代价是性质更强,参数不太多的解常常达不到定理要求的稳健,但经验上仍连通。卷积要用通道级丢弃;普通丢弃训练出…;5) 把连通用…

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「为什么「坑与坑不相通」这张想象图是错的」,本文给出了什么结论?

在「为什么「坑与坑不相通」这张想象图是错的」部分,要点是:多」当连通的充分条件。要解释为什么标准训练经常看见连通,必须用「典型训练解」才有的性质,而不是任意全局最小都有的性质。 五步把连通从现象收成可验证的折线 先测稳定性,再谈路径。丢弃稳定:存在一种去掉一半节点、剩下的加倍的方式,损失最多升 ε。噪声稳定:往某层输出加相当大的高斯噪声,更高层几乎拒掉。噪声稳定能推出一种丢弃稳定。两条都测失败,定理不保证连通,经验上有时仍能找到路,那是别的性质,不要冒充已经证明。 禁止用参数直线当默认连接。直

关于「五步把连通从现象收成可验证的折线」,本文给出了什么结论?

在「五步把连通从现象收成可验证的折线」部分,要点是:住丢弃和噪声,可以一层层清掉一半节点再汇合。过参数化不够,直线不够。仍把景观画成互不相通的深坑,是在用未训练的最小值集合代替训练轨迹上的解。 你下次做检查点平均,先问两点之间的路径有几段、沿途损失升了多少。说不清,平均就不能当集成。